Qwen 3.5 9B vs Ministral 3 14B vs Gemma 4 12B: test af lokale LLM’er på RTX 5060 Ti

Tre lokale AI-motorer sammenlignes omkring et grafikkort
Tre lokale AI-motorer sammenlignes omkring et grafikkort

Små sprogmodeller har gjort enorme fremskridt. Det er nu muligt lokalt på et grafikkort til forbrugere at køre modeller, som kan søge i en formue, sammenholde flere oplysninger eller forberede en handling i en applikation.

Men ét spørgsmål er mere nyttigt end en rangliste over benchmarkresultater:

Nøglespørgsmål: Hvilken model fungerer faktisk bedst i en applikation som My Wealth?

Vi har sammenlignet tre konfigurationer fra AI-profilerne i My Wealth:

My Wealth-profilModelTestet kvantisering
Basic/2Qwen 3.5 9BQ4_K_M
Medium/1Ministral 3 14B Instruct 2512Q5_K_M
Medium/2Gemma 4 12BQ6_K

Antallet af tokens pr. sekund betyder noget, men det vigtigste er et korrekt svar, der bygger på porteføljens data og er udarbejdet med de rigtige værktøjer. Derfor sammenligner vi funktionel succes, svarkvalitet, tidsforbrug og ydeevne med Vulkan og CUDA.

Testmaskinen

Alle modeller blev kørt lokalt på den samme maskine.

Grafikkort

NVIDIA GeForce RTX 5060 Ti 16 GB tilhører Blackwell-generationen. Kortets 16 GB GDDR7 gør det muligt at have alle tre kvantiserede modeller i denne sammenligning fuldt indlæst i GPU’en. NVIDIA tilbyder kortet i udgaver med 16 GB og 8 GB; vi brugte den første. NVIDIAs officielle produktside

Komplet konfiguration

KomponentMålt konfiguration
GPUNVIDIA GeForce RTX 5060 Ti, 16.311 MiB
CPUAMD Ryzen 5 2600, 6 kerner og 12 tråde
RAM31,9 GiB
SystemWindows 11 Professional, build 26200
NVIDIA-driver616.56
Runtimellama.cpp 0.4.0, build 10809
Kontekst32.768 tokens
BackendsFørst Vulkan, derefter CUDA

Billedmodulet i hver model blev deaktiveret. De femten testtilfælde er udelukkende tekstbaserede, og indstillingen forhindrer en ubrugt komponent i at optage hukommelse. Det højeste observerede GPU-hukommelsesforbrug under kørslerne var cirka 7,7 GiB for Qwen, 15,8 GiB for Ministral og 12,0 GiB for Gemma.

Testcomputer, der kører AI-modellerne direkte på sit grafikkort
Testcomputer, der kører AI-modellerne direkte på sit grafikkort

De tre modeller

Qwen 3.5 9B — den meget hurtige lille model

Qwen 3.5 9B er den mest kompakte af de tre. Det officielle repository præsenterer den som en multimodal samtalemodel under Apache 2.0-licensen. I vores tekstbaserede test giver den mindre størrelse modellen et tydeligt forspring i hastighed. Officiel side for Qwen 3.5 9B

I denne test

Vi bruger Qwen i Q4_K_M. Det er den mest tilgængelige og hurtigste konfiguration i sammenligningen. Den klarer direkte forespørgsler godt, men bliver mindre stabil, så snart orkestreringen eller en skrivehandling bliver kompleks.

Ministral 3 14B Instruct 2512 — Mistral AI’s edge-model

Ministral 3 14B er den største model i testen. Mistral retter den blandt andet mod lokale installationer og edge-miljøer; Instruct-versionen understøtter elleve sprog og bruger Apache 2.0-licensen. Officiel side for Ministral 3 14B Instruct

I denne test

Vi bruger Ministral i Q5_K_M. For at sikre en symmetrisk sammenligning mellem Vulkan og CUDA og undgå det hukommelsesproblem, der blev konstateret med dens tidligere runtime, anvender begge kørsler den samme llama.cpp 0.4.0-motor som Gemma, uden billedmodul. Modellen bruger næsten alle de tilgængelige 16 GB, men forbliver stabil.

Gemma 4 12B — den højeste score i sammenligningen

Gemma 4 12B er en multimodal model fra Google under Apache 2.0-licensen. Den officielle side beskriver input i form af tekst, lyd, billeder og video; her bruger vi kun tekstdelen. Officiel side for Gemma 4 12B

I denne test

Vi bruger Gemma i Q6_K. Dens størrelse gør det muligt at bevare mere præcision end Ministral Q5 og samtidig holde sig inden for kortets hukommelsesramme. Det er også den eneste deltager, der gennemfører den avancerede handling.

Kvantisering som tilpasning til hardwaren

De tre modeller er ikke testet med den samme kvantisering: Q4_K_M for Qwen, Q5_K_M for Ministral og Q6_K for Gemma. Valget svarer til de profiler, der reelt kan bruges i My Wealth, og deres tilsigtede hardware.

ModelKvantiseringHøjeste observerede GPU-hukommelse
Qwen 3.5 9BQ4_K_M7,7 GiB
Ministral 3 14BQ5_K_M15,8 GiB
Gemma 4 12BQ6_K12,0 GiB

Denne benchmark sammenligner altså produktkonfigurationer. Resultaterne gør ikke krav på alene at isolere modellernes arkitektur.

My Wealths testprotokol

My Wealths komplette testbænk indeholder 354 spørgsmål og handlinger. Vi fastlagde 15 af dem før nogen måling:

KategoriAntalFormål
Basic8Direkte opslag i formuen
Intermediate2Sammenholdelse af flere oplysninger
Advanced2Mere avanceret analyse og værktøjsforløb
Write2Enkel handling eller sikker afvisning af en umulig handling
Write Advanced1Komplet oprettelse med flere felter
I alt15

Hver konfiguration behandlede nøjagtig de samme tilfælde, først med Vulkan og derefter med CUDA. En model forblev indlæst under sine femten test. En opvarmningskørsel blev udeladt fra målingerne, og den syntetiske formue samt samtalen blev nulstillet for hvert tilfælde. Kun ét målt forsøg blev medtaget; en fejl fra modellen er stadig et resultat.

Det måler vi

1. Funktionel succes

Alle 90 resultater blev gennemgået manuelt. Ved et opslag vurderer vi det synlige svar ud fra dets korrekthed og fuldstændighed i forhold til de syntetiske data. Et overflødigt værktøjskald gør ikke et godt svar til en fiasko. Ved en skrivehandling kontrollerer vi den faktisk gemte effekt og hvert af de ønskede felter: Det er ikke nok blot at hævde, at handlingen lykkedes.

2. Svarkvalitet

Vi gennemgår de synlige svar særskilt: korrekthed, klarhed, trofasthed mod dataene og nytteværdi. Denne menneskelige gennemgang afgør den offentliggjorte score.

3. Svartid

Den samlede tid omfatter valg af værktøjer, planlægning, værktøjskald og det endelige svar. Den repræsenterer den oplevede ventetid bedre end en isoleret genereringshastighed.

4. Vulkan mod CUDA

For hver model bruger de to kørsler den samme GGUF-fil, den samme skabelon, den samme motor og de samme parametre. Kun GPU-backend ændres.

Resultater — svarenes kvalitet

Tre LLM’er, tre forskellige veje til resultatet
Tre LLM’er, tre forskellige veje til resultatet

Samlet resultat

KonfigurationVulkanCUDA
Qwen 3.5 9B Q4_K_M9/15, svarende til 60 %8/15, svarende til 53 %
Ministral 3 14B Q5_K_M11/15, svarende til 73 %11/15, svarende til 73 %
Gemma 4 12B Q6_K13/15, svarende til 87 %13/15, svarende til 87 %

Vinder på kvalitet

Gemma 4 12B Q6_K opnår det bedste resultat med begge backends: 13 vellykkede tilfælde ud af 15. Ministral bliver nummer to med 11/15. Qwen opnår 9/15 med Vulkan og 8/15 med CUDA.

Resultater efter kategori

Her er et konkret eksempel på en testet anmodning i hver kategori:

KategoriEksempel på testet anmodning
Basic»Hvad er det samlede beløb for mine forpligtelser?«
Intermediate»Sammenlign værdien af min opsparing med værdien af min gæld.«
Advanced»Hvad er den aktuelle fremgang og den nødvendige månedlige indsats alene for målet Tryg pension?«
Write»Føj ‘Crédit Mutuel’ til mine institutter.«
Write Advanced»Tilføj produktet ‘Compte Travaux’ hos Banque Horizon […] ejet 100 % af Benoît Martin.«
Model og backendBasic /8Intermediate /2Advanced /2Write /2Write Advanced /1
Qwen Vulkan62100
Qwen CUDA52100
Ministral Vulkan72200
Ministral CUDA72200
Gemma Vulkan82201
Gemma CUDA82201

Alle tre modeller fejler i de to Write-tilfælde. I det første skulle et institut tilføjes; ingen gennemførte ændringen. I det andet skulle en værdi afledt af guldprisen ændres direkte. Modellerne burde tydeligt have forklaret, at denne isolerede skrivehandling ikke blev understøttet, men deres forløb fortsatte, indtil grænsen for generering eller værktøjer blev nået.

Nogle svar, der overraskede os

Eksempel 1 — et fremragende avanceret svar

På spørgsmålet om målet »Tryg pension« finder Ministral og Gemma de to forventede værdier. Ministral svarer blandt andet:

»Aktuel fremgang: 29,67 % […] Nødvendig månedlig indsats: 858,88 €.«

Svaret er kort, talbaseret og bygger på det rigtige opslag.

Eksempel 2 — et plausibelt svar … der er forkert

Qwen svarer, at andelen af aktiver, der er finansieret af forpligtelser, er 13,70 % med Vulkan og 15,94 % med CUDA, mens den forventede værdi er 17,81 %. Beregningerne virker troværdige, men modellen udelader en del af forpligtelserne eller vælger en forkert nævner.

Fejlen viser, hvorfor en overbevisende formulering af et finansielt svar ikke er nok.

Eksempel 3 — når brugen af værktøjer gør forskellen

På anmodningen om at oprette bankproduktet »Compte Travaux« anvender Gemma nøjagtig alle de ønskede felter med både Vulkan og CUDA: institut, valuta, reference, indbetaling, opfølgning, ejer og note.

Ministral opretter et produkt, men udelader instituttet og noten i den faktisk gemte effekt, selv om svaret hævder det modsatte. Qwen foretager ingen ændring. Eksemplet viser, hvorfor skrivehandlinger skal vurderes ud fra den gemte tilstand og ikke kun den endelige tekst.

Resultater — reel hastighed i My Wealth

Gennemsnitlig og median svartid for hver model med Vulkan og CUDA
Gennemsnitlig og median svartid for hver model med Vulkan og CUDA

Svartid

KonfigurationGennemsnitMedianMinimumMaksimum
Qwen Vulkan20,4 s14,3 s11,6 s55,4 s
Qwen CUDA19,0 s13,8 s10,9 s52,4 s
Ministral Vulkan27,1 s20,8 s12,9 s109,5 s
Ministral CUDA24,7 s18,9 s11,7 s102,0 s
Gemma Vulkan27,7 s20,6 s12,8 s107,0 s
Gemma CUDA43,1 s19,4 s12,3 s273,3 s

Vinder på hastighed

Qwen 3.5 9B med CUDA er hurtigst, både i gennemsnit og målt på medianen. Gemma CUDA kræver en forklaring: Medianen er en smule bedre end med Vulkan, men i ét tilfælde blev der genereret 8.192 tokens under en planlægningsfase, og processen tog 4 min. 33 sek. Denne hændelse hæver gennemsnittet til 43,1 s.

Vulkan vs CUDA

Genereringshastighed og CUDA-gevinst for hver model
Genereringshastighed og CUDA-gevinst for hver model

Generering: tokens pr. sekund

Hastigheden aggregeres ved at dividere det samlede antal genererede tokens med den samlede genereringstid målt af llama.cpp. Det er ikke et simpelt gennemsnit af hastigheden i hver fase.

ModelVulkanCUDACUDA-gevinst
Qwen 3.5 9B57,02 tok/s61,70 tok/s+8,2 %
Ministral 3 14B31,32 tok/s33,32 tok/s+6,4 %
Gemma 4 12B30,39 tok/s33,54 tok/s+10,4 %

CUDA vinder på rå gennemstrømning for alle tre modeller. Det garanterer dog ikke en bedre samlet tid: Modellens beslutninger og værktøjskald vejer ofte tungere end nogle få tokens pr. sekund.

Gennemsnitlig svartid

CUDA reducerer Qwens gennemsnitlige tid med cirka 7 % og Ministrals med cirka 9 %. For Gemma øger planlægningshændelsen gennemsnittet med 56 %, mens medianen falder med cirka 5 %. Medianen beskriver her den normale adfærd bedre; maksimumværdien minder om, at en lokal assistent indimellem kan havne i en meget lang generering.

Vinderen er ikke nødvendigvis den hurtigste model

Qwen producerer næsten dobbelt så mange tokens pr. sekund som de to andre modeller, men dens menneskelige bedømmelse er markant lavere. Ministral giver en væsentlig forbedring af kvaliteten uden at forlænge ventetiden urimeligt. Gemma opnår den bedste score og gennemfører den eneste avancerede skrivehandling med begge backends, på bekostning af lavere rå hastighed og én langvarig hændelse med CUDA.

Vi beregner ikke en vilkårlig samlet score. Ikke alle anvendelser tillægger et sparet sekund, et korrekt svar eller en korrekt udført handling samme værdi.

Hvilken model skal du vælge?

Når hastighed har førsteprioritet

Qwen 3.5 9B Q4_K_M med CUDA. Den er hurtig og kræver betydeligt mindre hukommelse, men resultatet på 8/15 kræver omhyggelig kontrol, så snart anmodningen går videre end et enkelt opslag.

For den bedste balance

Ministral 3 14B Q5_K_M med CUDA. Scoren forbliver 11/15 med begge backends, og CUDA sænker medianen til 18,9 s. Det er et solidt kompromis til opslag og analysespørgsmål.

Når kvalitet frem for alt er vigtigst

Gemma 4 12B Q6_K med Vulkan. Med 13/15 og en vellykket avanceret handling vinder den sammenligningen. Gemma opnår samme score med CUDA, men Vulkan undgår den planlægningshændelse, der øger CUDA-gennemsnittet kraftigt.

Konklusion

På dette RTX 5060 Ti 16 GB dominerer ingen model alle kriterier.

Qwen er hastighedsmesteren. Ministral tilbyder det mest stabile kompromis mellem ventetid og kvalitet. Gemma med Vulkan giver de bedste funktionelle resultater og er mest overbevisende i komplekse forløb.

Valget afhænger derfor af behovet: hurtigt svar på enkle opslag, balance til en daglig assistent eller maksimal prioritet til kvalitet og handlinger. I vores sammenligning vinder Gemma 4 12B Q6_K på kvalitet med begge backends; vi foretrækker Vulkan på grund af stabiliteten. Qwen 3.5 9B Q4_K_M med CUDA vinder på hastighed.

Opdateret