Qwen 3.5 9B vs Ministral 3 14B vs Gemma 4 12B: test lokálních LLM na RTX 5060 Ti

Tři lokální systémy umělé inteligence porovnávané kolem grafické karty
Tři lokální systémy umělé inteligence porovnávané kolem grafické karty

Malé jazykové modely udělaly obrovský pokrok. Na běžné grafické kartě lze nyní lokálně provozovat modely, které dokážou zjišťovat informace o majetku, propojovat různá data nebo připravit akci v aplikaci.

Jedna otázka je ale užitečnější než žebříček benchmarků:

Klíčová otázka: který model skutečně funguje nejlépe v aplikaci, jako je My Wealth?

Porovnali jsme tři konfigurace nabízené v profilech AI služby My Wealth:

Profil My WealthModelTestovaná kvantizace
Basic/2Qwen 3.5 9BQ4_K_M
Medium/1Ministral 3 14B Instruct 2512Q5_K_M
Medium/2Gemma 4 12BQ6_K

Počet tokenů za sekundu je důležitý, prioritou je však přesná odpověď založená na datech portfolia a vytvořená pomocí správných nástrojů. Porovnáváme proto funkční úspěšnost, kvalitu odpovědí, potřebný čas a výkon ve Vulkanu a CUDA.

Testovací počítač

Všechny modely běžely lokálně na stejném počítači.

Grafická karta

NVIDIA GeForce RTX 5060 Ti 16 GB patří ke generaci Blackwell. Jejích 16 GB paměti GDDR7 umožňuje uchovat všechny tři kvantizované modely celé v GPU. NVIDIA nabízí kartu ve variantách 16 GB a 8 GB; použili jsme první z nich. Oficiální specifikace NVIDIA

Úplná konfigurace

SoučástNaměřená konfigurace
GPUNVIDIA GeForce RTX 5060 Ti, 16 311 MiB
CPUAMD Ryzen 5 2600, 6 jader a 12 vláken
RAM31,9 GiB
SystémWindows 11 Professional, sestavení 26200
Ovladač NVIDIA616.56
Runtimellama.cpp 0.4.0, sestavení 10809
Kontext32 768 tokenů
Backendynejprve Vulkan, poté CUDA

Obrazový modul každého modelu byl vypnut. Všech patnáct případů je čistě textových, takže toto nastavení neplýtvá pamětí na nepoužívanou součást. Maximální pozorovaná spotřeba paměti GPU byla přibližně 7,7 GiB pro Qwen, 15,8 GiB pro Ministral a 12,0 GiB pro Gemma.

Testovací počítač spouštějící modely umělé inteligence přímo na grafické kartě
Testovací počítač spouštějící modely umělé inteligence přímo na grafické kartě

Tři modely

Qwen 3.5 9B — velmi rychlý malý model

Qwen 3.5 9B je z trojice nejkompaktnější. Oficiální repozitář jej popisuje jako multimodální konverzační model s licencí Apache 2.0. V našem textovém testu mu menší velikost dává výrazný náskok v rychlosti. Oficiální karta Qwen 3.5 9B

V tomto testu

Qwen používáme v Q4_K_M. Jde o nejdostupnější a nejrychlejší konfiguraci ve srovnání. Přímé požadavky zvládá dobře, ale při složitější orchestraci nebo zápisu je méně spolehlivý.

Ministral 3 14B Instruct 2512 — edge model od Mistral AI

Ministral 3 14B je největší testovaný model. Mistral jej určuje zejména pro lokální nasazení a edge; verze Instruct podporuje jedenáct jazyků a používá licenci Apache 2.0. Oficiální karta Ministral 3 14B Instruct

V tomto testu

Ministral používáme v Q5_K_M. Aby bylo srovnání Vulkan/CUDA symetrické a nevznikl problém s pamětí pozorovaný ve starším runtime, oba průchody využívají stejný engine llama.cpp 0.4.0 jako Gemma, bez obrazového modulu. Model zaplní téměř celých dostupných 16 GB, ale zůstává stabilní.

Gemma 4 12B — nejlepší výsledek srovnání

Gemma 4 12B je multimodální model Googlu s licencí Apache 2.0. Oficiální karta uvádí textové, zvukové, obrazové a video vstupy; zde používáme jen textovou část. Oficiální karta Gemma 4 12B

V tomto testu

Gemma používáme v Q6_K. Její velikost umožňuje zachovat větší přesnost než Ministral Q5 a současně se vejít do paměti karty. Je také jediným modelem, který uspěl v pokročilé akci.

Kvantizace jako proměnná pro přizpůsobení hardwaru

Modely netestujeme se stejnou kvantizací: Q4_K_M pro Qwen, Q5_K_M pro Ministral a Q6_K pro Gemma. Volba odpovídá konfiguracím skutečně použitelným v My Wealth a jejich cílovému hardwaru.

ModelKvantizaceNejvyšší pozorovaná paměť GPU
Qwen 3.5 9BQ4_K_M7,7 GiB
Ministral 3 14BQ5_K_M15,8 GiB
Gemma 4 12BQ6_K12,0 GiB

Benchmark tedy porovnává produktové konfigurace. Výsledky nemají izolovat pouze architekturu modelů.

Testovací protokol My Wealth

Úplná sada My Wealth obsahuje 354 otázek a akcí. 15 jsme pevně vybrali před měřením:

KategoriePočetPředmět
Basic8Přímé dotazy na majetek
Intermediate2Propojení více údajů
Advanced2Pokročilejší analýza a řetězce nástrojů
Write2Jednoduchá akce nebo bezpečné odmítnutí nemožné akce
Write Advanced1Úplné vytvoření s několika poli
Celkem15

Každá konfigurace zpracovala stejné případy, nejprve ve Vulkanu a potom v CUDA. Model zůstal načtený během všech patnácti testů. Zahřátí nebylo měřeno a syntetický majetek i konverzace se před každým případem resetovaly. Zachovali jsme jediný měřený pokus; chyba modelu zůstává výsledkem.

Co měříme

1. Funkční úspěšnost

Všech 90 výsledků jsme ručně zkontrolovali. U dotazu posuzujeme správnost a úplnost viditelné odpovědi vůči syntetickým datům. Nadbytečné volání nástroje nemění dobrou odpověď v neúspěch. U zápisu kontrolujeme skutečně uložený výsledek a všechna požadovaná pole: pouhé tvrzení o úspěchu nestačí.

2. Kvalita odpovědi

Viditelné odpovědi hodnotíme zvlášť podle správnosti, srozumitelnosti, věrnosti datům a užitečnosti. Toto lidské hodnocení určuje zveřejněné skóre.

3. Doba odezvy

Celkový čas zahrnuje výběr nástrojů, plánování, jejich volání a konečnou odpověď. Skutečné čekání vystihuje lépe než samotná rychlost generování.

4. Vulkan proti CUDA

Pro každý model používají oba průchody stejný GGUF, šablonu, engine i parametry. Mění se pouze backend GPU.

Výsledky — kvalita odpovědí

Tři LLM a tři různé cesty k výsledku
Tři LLM a tři různé cesty k výsledku

Celkový výsledek

KonfiguraceVulkanCUDA
Qwen 3.5 9B Q4_K_M9/15, tedy 60 %8/15, tedy 53 %
Ministral 3 14B Q5_K_M11/15, tedy 73 %11/15, tedy 73 %
Gemma 4 12B Q6_K13/15, tedy 87 %13/15, tedy 87 %

Vítěz v kvalitě

Gemma 4 12B Q6_K dosahuje v obou backendech nejlepšího výsledku: 13 úspěchů z 15. Ministral je druhý s 11/15. Qwen získává 9/15 ve Vulkanu a 8/15 v CUDA.

Výsledky podle kategorií

Konkrétní příklad požadavku pro každou kategorii:

KategoriePříklad testovaného požadavku
Basic„Jaká je celková výše mých závazků?“
Intermediate„Porovnej hodnotu mých úspor s mými dluhy.“
Advanced„Pouze pro cíl Klidný důchod: jaký je jeho současný postup a požadované měsíční úsilí?“
Write„Přidej Crédit Mutuel mezi mé instituce.“
Write Advanced„Přidej u Banque Horizon produkt Compte Travaux […] vlastněný ze 100 % Benoîtem Martinem.“
Model a backendBasic /8Intermediate /2Advanced /2Write /2Write Advanced /1
Qwen Vulkan62100
Qwen CUDA52100
Ministral Vulkan72200
Ministral CUDA72200
Gemma Vulkan82201
Gemma CUDA82201

Všechny tři modely selhávají ve dvou případech Write. První požadoval přidání instituce; žádný nedokončil změnu. Druhý chtěl přímo změnit hodnotu odvozenou od ceny zlata: modely měly vysvětlit, že samostatný zápis není podporován, jejich postup však pokračoval až k limitům generování či nástrojů.

Několik odpovědí, které nás překvapily

Příklad 1 — výborná pokročilá odpověď

U otázky na cíl „Klidný důchod“ najdou Ministral a Gemma obě očekávané hodnoty. Ministral mimo jiné odpovídá:

„Současný postup: 29,67 % […] Požadované měsíční úsilí: 858,88 €.“

Odpověď je krátká, číselná a založená na správném postupu dotazu.

Příklad 2 — věrohodná, ale chybná odpověď

Qwen tvrdí, že podíl aktiv financovaných závazky činí 13,70 % ve Vulkanu a 15,94 % v CUDA, očekávaná hodnota je však 17,81 %. Výpočty působí věrohodně, model ale vynechá část závazků nebo zvolí špatný jmenovatel.

Chyba ukazuje, proč přesvědčivá forma finanční odpovědi sama nestačí.

Příklad 3 — když rozhoduje použití nástrojů

Při vytvoření bankovního produktu „Compte Travaux“ Gemma ve Vulkanu i CUDA přesně uloží všechna pole: instituci, měnu, referenci, vklad, sledování, vlastníka a poznámku.

Ministral produkt vytvoří, ale ve skutečně uloženém výsledku vynechá instituci a poznámku, přestože tvrdí opak. Qwen neprovede žádnou změnu. Zápisy proto musíme kontrolovat podle uloženého stavu, nikoli jen konečného textu.

Výsledky — skutečná rychlost v My Wealth

Průměrná a mediánová doba odezvy každého modelu ve Vulkanu a CUDA
Průměrná a mediánová doba odezvy každého modelu ve Vulkanu a CUDA

Doba odezvy

KonfiguracePrůměrMediánMinimumMaximum
Qwen Vulkan20,4 s14,3 s11,6 s55,4 s
Qwen CUDA19,0 s13,8 s10,9 s52,4 s
Ministral Vulkan27,1 s20,8 s12,9 s109,5 s
Ministral CUDA24,7 s18,9 s11,7 s102,0 s
Gemma Vulkan27,7 s20,6 s12,8 s107,0 s
Gemma CUDA43,1 s19,4 s12,3 s273,3 s

Vítěz v rychlosti

Qwen 3.5 9B v CUDA je nejrychlejší v průměru i mediánu. Gemma CUDA vyžaduje vysvětlení: medián je o něco lepší než ve Vulkanu, jeden případ však během plánování vygeneroval 8 192 tokenů a trval 4 min 33 s. Incident zvyšuje průměr na 43,1 s.

Vulkan vs CUDA

Rychlost generování a přínos CUDA pro každý model
Rychlost generování a přínos CUDA pro každý model

Generování: tokeny za sekundu

Propustnost počítáme vydělením celkového počtu tokenů celkovou dobou generování naměřenou llama.cpp. Nejde o prostý průměr rychlostí jednotlivých fází.

ModelVulkanCUDAPřínos CUDA
Qwen 3.5 9B57,02 tok./s61,70 tok./s+8,2 %
Ministral 3 14B31,32 tok./s33,32 tok./s+6,4 %
Gemma 4 12B30,39 tok./s33,54 tok./s+10,4 %

CUDA vítězí v hrubé propustnosti u všech modelů. Nezaručuje však lepší celkový čas: rozhodování modelu a volání nástrojů často ovlivňují výsledek více než několik tokenů za sekundu.

Průměrná doba odezvy

CUDA zkracuje průměrný čas Qwen asi o 7 % a Ministral asi o 9 %. U Gemma incident při plánování zvyšuje průměr o 56 %, zatímco medián klesá asi o 5 %. Medián zde lépe popisuje obvyklé chování; maximum připomíná, že lokální asistent může občas spustit velmi dlouhé generování.

Vítězem nemusí být nejrychlejší model

Qwen generuje téměř dvakrát více tokenů za sekundu než ostatní modely, ale jeho lidské hodnocení je výrazně nižší. Ministral podstatně zvyšuje kvalitu bez nepřiměřeného čekání. Gemma má nejlepší skóre a jako jediná zvládá pokročilý zápis v obou backendech, za cenu nižší hrubé rychlosti a dlouhého incidentu v CUDA.

Nevytváříme svévolné složené skóre. Každé použití přikládá jinou váhu ušetřené sekundě, přesné odpovědi či správně provedené akci.

Který model zvolit?

Pokud je prioritou rychlost

Qwen 3.5 9B Q4_K_M v CUDA. Je rychlý a potřebuje výrazně méně paměti, ale skóre 8/15 vyžaduje pečlivou kontrolu složitějších požadavků.

Pro nejlepší rovnováhu

Ministral 3 14B Q5_K_M v CUDA. V obou backendech má 11/15 a CUDA snižuje medián na 18,9 s. Je to solidní kompromis pro dotazy a analýzy.

Pokud je nejdůležitější kvalita

Gemma 4 12B Q6_K ve Vulkanu. S 13/15 a úspěšnou pokročilou akcí srovnání vyhrává. V CUDA má stejné skóre, Vulkan se však vyhne incidentu při plánování, který silně zvyšuje průměr CUDA.

Závěr

Na RTX 5060 Ti 16 GB žádný model nevládne všem kritériím.

Qwen je vítězem rychlosti. Ministral nabízí nejstálejší kompromis mezi čekáním a kvalitou. Gemma ve Vulkanu dosahuje nejlepších funkčních výsledků a je nejpřesvědčivější ve složitých postupech.

Volba závisí na potřebě: rychlá odpověď pro jednoduché dotazy, vyvážený každodenní asistent, nebo nejvyšší priorita kvality a akcí. V našem srovnání Gemma 4 12B Q6_K vyhrává kvalitou v obou backendech; pro pravidelnost preferujeme Vulkan. Qwen 3.5 9B Q4_K_M v CUDA vyhrává rychlostí.

Aktualizováno