Qwen 3.5 9B vs Ministral 3 14B vs Gemma 4 12B: comparație de LLM-uri locale pe RTX 5060 Ti

Trei motoare locale de inteligență artificială comparate în jurul unei plăci grafice
Trei motoare locale de inteligență artificială comparate în jurul unei plăci grafice

Modelele lingvistice de mici dimensiuni au progresat enorm. Acum este posibil să rulăm local, pe o placă grafică de larg consum, modele capabile să interogheze un patrimoniu, să coreleze mai multe date sau chiar să pregătească o acțiune într-o aplicație.

Dar o întrebare rămâne mai utilă decât orice clasament de benchmarkuri:

Întrebarea esențială: ce model funcționează cu adevărat cel mai bine într-o aplicație precum My Wealth?

Am comparat trei configurații oferite de profilurile AI din My Wealth:

Profil My WealthModelCuantizare testată
Basic/2Qwen 3.5 9BQ4_K_M
Medium/1Ministral 3 14B Instruct 2512Q5_K_M
Medium/2Gemma 4 12BQ6_K

Viteza în tokeni pe secundă contează, însă prioritatea este obținerea unui răspuns exact, bazat pe datele portofoliului și produs cu instrumentele potrivite. Prin urmare, comparăm reușita funcțională, calitatea răspunsurilor, timpul necesar și performanțele cu Vulkan și CUDA.

Sistemul de testare

Toate modelele au fost rulate local pe același sistem.

Placa grafică

Placa NVIDIA GeForce RTX 5060 Ti de 16 GB face parte din generația Blackwell. Cei 16 GB de memorie GDDR7 permit păstrarea integrală pe GPU a celor trei modele cuantizate din această comparație. NVIDIA oferă placa în versiuni de 16 GB și 8 GB; am utilizat-o pe prima. Pagina oficială NVIDIA

Configurația completă

ComponentăConfigurație măsurată
GPUNVIDIA GeForce RTX 5060 Ti, 16.311 MiB
CPUAMD Ryzen 5 2600, 6 nuclee și 12 fire de execuție
RAM31,9 GiB
SistemWindows 11 Pro, versiunea 26200
Driver NVIDIA616.56
Runtimellama.cpp 0.4.0, versiunea 10809
Context32.768 de tokeni
Backendurimai întâi Vulkan, apoi CUDA

Modulul de imagistică al fiecărui model a fost dezactivat. Cele cincisprezece cazuri sunt exclusiv textuale, iar această setare evită ocuparea memoriei cu o componentă neutilizată. Memoria GPU maximă observată în timpul rulărilor a fost de aproximativ 7,7 GiB pentru Qwen, 15,8 GiB pentru Ministral și 12,0 GiB pentru Gemma.

Sistemul de testare rulând modelele de inteligență artificială direct pe placa sa grafică
Sistemul de testare rulând modelele de inteligență artificială direct pe placa sa grafică

Cele trei modele

Qwen 3.5 9B — modelul mic și foarte rapid

Qwen 3.5 9B este cel mai compact dintre cele trei. Depozitul oficial îl prezintă drept un model conversațional multimodal cu licență Apache 2.0. În testul nostru textual, dimensiunea redusă îi oferă un avantaj clar de viteză. Pagina oficială Qwen 3.5 9B

În acest test

Utilizăm Qwen în varianta Q4_K_M. Este configurația cea mai accesibilă și mai rapidă din comparație. Rezolvă bine cererile directe, dar devine mai puțin consecvent când orchestrarea sau scrierea se complică.

Ministral 3 14B Instruct 2512 — modelul edge de la Mistral AI

Ministral 3 14B este cel mai mare model testat. Mistral îl recomandă în special pentru implementări locale și edge; versiunea Instruct acceptă unsprezece limbi și folosește o licență Apache 2.0. Pagina oficială Ministral 3 14B Instruct

În acest test

Utilizăm Ministral în varianta Q5_K_M. Pentru a garanta o comparație Vulkan/CUDA simetrică și pentru a evita problema de memorie întâlnită cu vechiul său runtime, ambele rulări folosesc același motor llama.cpp 0.4.0 ca Gemma, fără modul de imagistică. Modelul ocupă aproape în întregime cei 16 GB disponibili, rămânând totuși stabil.

Gemma 4 12B — cel mai bun scor din comparație

Gemma 4 12B este un model multimodal Google cu licență Apache 2.0. Pagina sa oficială descrie intrări text, audio, imagine și video; aici folosim numai componenta textuală. Pagina oficială Gemma 4 12B

În acest test

Utilizăm Gemma în varianta Q6_K. Dimensiunea sa permite păstrarea unei precizii mai mari decât la Ministral Q5, fără a depăși capacitatea de memorie a plăcii. Este și singurul concurent care finalizează cu succes acțiunea avansată.

Cuantizarea ca variabilă de adaptare la hardware

Cele trei modele nu sunt testate cu aceeași cuantizare: Q4_K_M pentru Qwen, Q5_K_M pentru Ministral și Q6_K pentru Gemma. Alegerea corespunde profilurilor care pot fi folosite efectiv în My Wealth și hardware-ului vizat de acestea.

ModelCuantizareMemorie GPU maximă observată
Qwen 3.5 9BQ4_K_M7,7 GiB
Ministral 3 14BQ5_K_M15,8 GiB
Gemma 4 12BQ6_K12,0 GiB

Prin urmare, acest benchmark compară configurații de produs. Rezultatele nu pretind să izoleze exclusiv arhitectura modelelor.

Protocolul de testare My Wealth

Setul complet de testare My Wealth conține 354 de întrebări și acțiuni. Am selectat 15 înainte de orice măsurătoare:

CategorieNumărObiect
Basic8Consultări directe ale patrimoniului
Intermediate2Corelarea mai multor date
Advanced2Analize și parcursuri de instrumente mai elaborate
Write2Acțiune simplă sau refuz sigur al unei acțiuni imposibile
Write Advanced1Creare completă cu mai multe câmpuri
Total15

Fiecare configurație a procesat exact aceleași cazuri, mai întâi cu Vulkan și apoi cu CUDA. Modelul a rămas încărcat pe durata celor cincisprezece teste. O rulare de încălzire a fost exclusă din măsurători, iar patrimoniul sintetic și conversația au fost reinițializate pentru fiecare caz. A fost luată în considerare o singură încercare măsurată; o eroare a modelului rămâne un rezultat.

Ce măsurăm

1. Reușita funcțională

Cele 90 de rezultate au fost revizuite manual. Pentru o consultare, evaluăm exactitatea și caracterul complet al răspunsului vizibil în raport cu datele sintetice. Un apel redundant al unui instrument nu transformă un răspuns bun într-un eșec. Pentru o scriere, verificăm efectul înregistrat efectiv și fiecare câmp solicitat: simpla afirmare a succesului nu este suficientă.

2. Calitatea răspunsului

Revizuim separat răspunsurile vizibile: exactitate, claritate, fidelitate față de date și utilitate. Această evaluare umană determină scorul publicat.

3. Timpul de răspuns

Timpul total include selecția instrumentelor, planificarea, apelurile acestora și răspunsul final. Acesta reflectă mai bine așteptarea resimțită decât viteza de generare privită izolat.

4. Vulkan comparativ cu CUDA

Pentru fiecare model, cele două rulări utilizează același GGUF, același șablon, același motor și aceiași parametri. Se schimbă doar backendul GPU.

Rezultate — calitatea răspunsurilor

Trei LLM-uri, trei parcursuri diferite pentru a ajunge la rezultat
Trei LLM-uri, trei parcursuri diferite pentru a ajunge la rezultat

Rezultatul general

ConfigurațieVulkanCUDA
Qwen 3.5 9B Q4_K_M9/15, adică 60%8/15, adică 53%
Ministral 3 14B Q5_K_M11/15, adică 73%11/15, adică 73%
Gemma 4 12B Q6_K13/15, adică 87%13/15, adică 87%

Câștigător la calitate

Gemma 4 12B Q6_K obține cel mai bun rezultat cu ambele backenduri, cu 13 reușite din 15. Ministral se clasează al doilea, cu 11/15. Qwen obține 9/15 cu Vulkan și 8/15 cu CUDA.

Rezultate pe categorii

Iată un exemplu concret de solicitare pentru fiecare categorie:

CategorieExemplu de solicitare testată
Basic„Care este valoarea totală a pasivelor mele?”
Intermediate„Compară valoarea economiilor mele cu cea a datoriilor.”
Advanced„Doar pentru obiectivul Pensie liniștită, care sunt progresul actual și efortul lunar necesar?”
Write„Adaugă «Crédit Mutuel» la instituțiile mele.”
Write Advanced„Adaugă la Banque Horizon un suport «Cont Lucrări» […] deținut în proporție de 100% de Benoît Martin.”
Model și backendBasic /8Intermediate /2Advanced /2Write /2Write Advanced /1
Qwen Vulkan62100
Qwen CUDA52100
Ministral Vulkan72200
Ministral CUDA72200
Gemma Vulkan82201
Gemma CUDA82201

Toate cele trei modele eșuează în cele două cazuri Write. Primul solicita adăugarea unei instituții; niciun model nu a finalizat modificarea. Al doilea solicita modificarea directă a unei valori derivate din cotația aurului: modelele ar fi trebuit să explice clar că această scriere izolată nu era acceptată, însă parcursurile lor au continuat până la atingerea limitelor de generare sau ale instrumentelor.

Câteva răspunsuri care ne-au surprins

Exemplul 1 — un răspuns avansat excelent

La întrebarea despre obiectivul „Pensie liniștită”, Ministral și Gemma găsesc cele două valori așteptate. Ministral răspunde astfel:

„Progres actual: 29,67% […] Efort lunar necesar: 858,88 €.”

Răspunsul este scurt, cuantificat și bazat pe parcursul corect de consultare.

Exemplul 2 — un răspuns plauzibil… dar greșit

Qwen răspunde că ponderea activelor finanțate din pasive este de 13,70% cu Vulkan și de 15,94% cu CUDA, deși valoarea așteptată este de 17,81%. Calculele par credibile, dar modelul omite o parte din pasive sau alege un numitor greșit.

Această eroare ilustrează de ce aspectul convingător al unui răspuns financiar nu este suficient.

Exemplul 3 — când utilizarea instrumentelor face diferența

La solicitarea de a crea suportul bancar „Cont Lucrări”, Gemma aplică exact toate câmpurile cerute atât cu Vulkan, cât și cu CUDA: instituție, monedă, referință, depunere, monitorizare, proprietar și notă.

Ministral creează un suport, dar omite instituția și nota din efectul înregistrat efectiv, în ciuda unui răspuns care susține contrariul. Qwen nu aplică nicio modificare. Acest exemplu arată de ce verificarea scrierilor trebuie să vizeze starea înregistrată, nu doar textul final.

Rezultate — viteza reală în My Wealth

Timpul mediu și median de răspuns pentru fiecare model cu Vulkan și CUDA
Timpul mediu și median de răspuns pentru fiecare model cu Vulkan și CUDA

Timpul de răspuns

ConfigurațieMedieMedianăMinimMaxim
Qwen Vulkan20,4 s14,3 s11,6 s55,4 s
Qwen CUDA19,0 s13,8 s10,9 s52,4 s
Ministral Vulkan27,1 s20,8 s12,9 s109,5 s
Ministral CUDA24,7 s18,9 s11,7 s102,0 s
Gemma Vulkan27,7 s20,6 s12,8 s107,0 s
Gemma CUDA43,1 s19,4 s12,3 s273,3 s

Câștigător la viteză

Qwen 3.5 9B cu CUDA este cel mai rapid, atât ca medie, cât și ca mediană. Gemma CUDA necesită o explicație: mediana sa este puțin mai bună decât cu Vulkan, însă un caz a generat 8.192 de tokeni în timpul unei etape de planificare și a durat 4 min 33 s. Acest incident ridică media la 43,1 s.

Vulkan vs CUDA

Viteza de generare și câștigul CUDA pentru fiecare model
Viteza de generare și câștigul CUDA pentru fiecare model

Generare: tokeni pe secundă

Viteza este agregată prin împărțirea numărului total de tokeni generați la durata totală de generare măsurată de llama.cpp. Nu este o medie simplă a vitezelor fiecărei etape.

ModelVulkanCUDACâștig CUDA
Qwen 3.5 9B57,02 tok/s61,70 tok/s+8,2%
Ministral 3 14B31,32 tok/s33,32 tok/s+6,4%
Gemma 4 12B30,39 tok/s33,54 tok/s+10,4%

CUDA câștigă la viteza brută pentru toate cele trei modele. Totuși, acest lucru nu garantează un timp total mai bun: deciziile modelului și apelurile instrumentelor au adesea un impact mai mare decât câțiva tokeni pe secundă.

Timpul mediu de răspuns

CUDA reduce timpul mediu al Qwen cu aproximativ 7%, iar pe cel al Ministral cu aproximativ 9%. Pentru Gemma, incidentul de planificare mărește media cu 56%, în timp ce mediana scade cu aproximativ 5%. În acest caz, mediana descrie mai bine comportamentul obișnuit; valoarea maximă amintește că un asistent local poate porni ocazional într-o generare foarte lungă.

Câștigătorul nu este neapărat modelul cel mai rapid

Qwen produce aproape de două ori mai mulți tokeni pe secundă decât celelalte două modele, însă scorul său uman este net inferior. Ministral oferă un progres important în materie de calitate fără a prelungi excesiv așteptarea. Gemma obține cel mai bun scor și finalizează cu succes singura scriere avansată pe ambele backenduri, cu prețul unei viteze brute mai mici și al unui incident îndelungat cu CUDA.

Nu calculăm un scor compozit arbitrar. Nu toate utilizările acordă aceeași valoare unei secunde economisite, unui răspuns exact sau unei acțiuni executate corect.

Ce model să alegeți?

Pentru a acorda prioritate vitezei

Qwen 3.5 9B Q4_K_M cu CUDA. Este rapid și necesită mult mai puțină memorie, însă scorul de 8/15 impune o verificare atentă de îndată ce solicitarea depășește o consultare simplă.

Pentru a obține cel mai bun echilibru

Ministral 3 14B Q5_K_M cu CUDA. Scorul rămâne la 11/15 pe ambele backenduri, iar CUDA reduce mediana la 18,9 s. Este un compromis solid pentru întrebări de consultare și analiză.

Pentru a acorda prioritate absolută calității

Gemma 4 12B Q6_K cu Vulkan. Cu 13/15 și acțiunea avansată finalizată, câștigă această comparație. Gemma obține același scor cu CUDA, însă Vulkan evită incidentul de planificare care prelungește considerabil media CUDA.

Concluzie

Pe această placă RTX 5060 Ti de 16 GB, niciun model nu domină toate criteriile.

Qwen este campionul vitezei. Ministral oferă compromisul cel mai constant între așteptare și calitate. Gemma cu Vulkan oferă cele mai bune rezultate funcționale și este cel mai convingător pentru parcursurile complexe.

Alegerea depinde, așadar, de nevoie: răspuns rapid pentru consultări simple, echilibru pentru un asistent de zi cu zi sau prioritate maximă acordată calității și acțiunilor. În comparația noastră, Gemma 4 12B Q6_K câștigă la calitate cu ambele backenduri; preferăm Vulkan pentru consecvență. Qwen 3.5 9B Q4_K_M cu CUDA câștigă la viteză.

Actualizat la