Qwen 3.5 9B vs. Ministral 3 14B vs. Gemma 4 12B: Lokaler LLM-Benchmark auf einer RTX 5060 Ti

Drei lokale KI-Engines im Vergleich rund um eine Grafikkarte
Drei lokale KI-Engines im Vergleich rund um eine Grafikkarte

Kleine Sprachmodelle haben enorme Fortschritte gemacht. Heute können Modelle, die ein Vermögen abfragen, mehrere Datenpunkte abgleichen oder eine Aktion in einer Anwendung vorbereiten, lokal auf einer Grafikkarte für Endverbraucher ausgeführt werden.

Doch eine Frage ist nützlicher als jede Benchmark-Rangliste:

Kernfrage: Welches Modell funktioniert in einer Anwendung wie My Wealth tatsächlich am besten?

Wir haben drei Konfigurationen aus den KI-Profilen von My Wealth verglichen:

My-Wealth-ProfilModellGetestete Quantisierung
Basic/2Qwen 3.5 9BQ4_K_M
Medium/1Ministral 3 14B Instruct 2512Q5_K_M
Medium/2Gemma 4 12BQ6_K

Tokens pro Sekunde sind relevant, entscheidend ist jedoch eine korrekte, auf den Vermögensdaten beruhende und mit den richtigen Werkzeugen erzeugte Antwort. Deshalb vergleichen wir funktionalen Erfolg, Antwortqualität, benötigte Zeit sowie die Leistung unter Vulkan und CUDA.

Der Testrechner

Alle Modelle liefen lokal auf demselben Rechner.

Grafikkarte

Die NVIDIA GeForce RTX 5060 Ti mit 16 GB gehört zur Blackwell-Generation. Ihre 16 GB GDDR7 reichen aus, um alle drei quantisierten Modelle dieses Vergleichs vollständig im GPU-Speicher zu halten. NVIDIA bietet die Karte mit 16 GB und 8 GB an; wir verwendeten die erste Variante. Offizielle NVIDIA-Seite

Vollständige Konfiguration

KomponenteGemessene Konfiguration
GPUNVIDIA GeForce RTX 5060 Ti, 16.311 MiB
CPUAMD Ryzen 5 2600, 6 Kerne und 12 Threads
RAM31,9 GiB
SystemWindows 11 Pro, Build 26200
NVIDIA-Treiber616.56
Laufzeitllama.cpp 0.4.0, Build 10809
Kontext32.768 Tokens
Backendszuerst Vulkan, dann CUDA

Das Bildmodul jedes Modells war deaktiviert. Die fünfzehn Fälle sind ausschließlich textbasiert; dadurch belegt eine ungenutzte Komponente keinen Speicher. Der beobachtete maximale GPU-Speicher betrug ungefähr 7,7 GiB für Qwen, 15,8 GiB für Ministral und 12,0 GiB für Gemma.

Testrechner, der die KI-Modelle direkt auf seiner Grafikkarte ausführt
Testrechner, der die KI-Modelle direkt auf seiner Grafikkarte ausführt

Die drei Modelle

Qwen 3.5 9B — das sehr schnelle kleine Modell

Qwen 3.5 9B ist das kompakteste der drei Modelle. Das offizielle Repository beschreibt es als multimodales Dialogmodell unter der Apache-2.0-Lizenz. Im reinen Texttest verschafft ihm seine geringere Größe einen deutlichen Geschwindigkeitsvorteil. Offizielle Seite von Qwen 3.5 9B

In diesem Test

Wir verwenden Qwen in Q4_K_M. Dies ist die zugänglichste und schnellste Konfiguration im Vergleich. Direkte Anfragen gelingen gut, bei komplexer Orchestrierung oder Schreibvorgängen wird das Modell jedoch weniger zuverlässig.

Ministral 3 14B Instruct 2512 — das Edge-Modell von Mistral AI

Ministral 3 14B ist das größte getestete Modell. Mistral richtet es insbesondere auf lokale und Edge-Bereitstellungen aus; die Instruct-Version unterstützt elf Sprachen und steht unter der Apache-2.0-Lizenz. Offizielle Seite von Ministral 3 14B Instruct

In diesem Test

Wir verwenden Ministral in Q5_K_M. Damit der Vulkan/CUDA-Vergleich symmetrisch bleibt und das Speicherproblem der früheren Laufzeit vermieden wird, nutzen beide Durchläufe dieselbe llama.cpp-0.4.0-Engine wie Gemma, ohne Bildmodul. Das Modell belegt fast die gesamten verfügbaren 16 GB und bleibt dabei stabil.

Gemma 4 12B — die höchste Wertung in diesem Vergleich

Gemma 4 12B ist ein multimodales Google-Modell unter der Apache-2.0-Lizenz. Die offizielle Seite beschreibt Text-, Audio-, Bild- und Videoeingaben; hier wird nur die Textkomponente genutzt. Offizielle Seite von Gemma 4 12B

In diesem Test

Wir verwenden Gemma in Q6_K. Die Größe bewahrt mehr Präzision als Ministral Q5 und passt dennoch in den Speicherrahmen der Karte. Gemma ist außerdem der einzige Kandidat, der die anspruchsvolle Aktion erfolgreich ausführt.

Quantisierung als Anpassung an die Hardware

Die drei Modelle werden nicht mit derselben Quantisierung getestet: Q4_K_M für Qwen, Q5_K_M für Ministral und Q6_K für Gemma. Diese Auswahl entspricht tatsächlich nutzbaren My-Wealth-Konfigurationen und ihren Hardwarezielen.

ModellQuantisierungMaximal beobachteter GPU-Speicher
Qwen 3.5 9BQ4_K_M7,7 GiB
Ministral 3 14BQ5_K_M15,8 GiB
Gemma 4 12BQ6_K12,0 GiB

Dieser Benchmark vergleicht somit Produktkonfigurationen. Die Ergebnisse sollen nicht allein die Modellarchitektur isolieren.

Das My-Wealth-Testprotokoll

Der vollständige My-Wealth-Prüfstand enthält 354 Fragen und Aktionen. 15 davon wurden vor jeder Messung festgelegt:

KategorieAnzahlZweck
Basic8Direkte Abfragen des Vermögens
Intermediate2Abgleich mehrerer Datenpunkte
Advanced2Anspruchsvollere Analysen und Werkzeugpfade
Write2Einfache Aktion oder sichere Ablehnung einer unmöglichen Aktion
Write Advanced1Vollständige Erstellung mit mehreren Feldern
Gesamt15

Jede Konfiguration bearbeitete exakt dieselben Fälle, zuerst unter Vulkan und danach unter CUDA. Ein Modell blieb während seiner fünfzehn Tests geladen. Ein Aufwärmlauf wurde nicht gemessen; das synthetische Vermögen und die Unterhaltung wurden für jeden Fall zurückgesetzt. Es zählt jeweils nur ein gemessener Versuch, und ein Modellfehler bleibt ein Ergebnis.

Was wir messen

1. Funktionaler Erfolg

Alle 90 Ergebnisse wurden manuell geprüft. Bei einer Abfrage bewerten wir die sichtbare Antwort anhand ihrer Richtigkeit und Vollständigkeit gegenüber den synthetischen Daten. Ein überflüssiger Werkzeugaufruf macht eine korrekte Antwort nicht zum Fehler. Bei Schreibvorgängen prüfen wir die tatsächlich gespeicherte Wirkung und jedes angeforderte Feld: Eine bloße Erfolgsmeldung genügt nicht.

2. Antwortqualität

Die sichtbaren Antworten werden getrennt nach Richtigkeit, Klarheit, Datentreue und Nutzen beurteilt. Diese menschliche Prüfung bestimmt die veröffentlichte Wertung.

3. Antwortzeit

Die Gesamtzeit umfasst Werkzeugauswahl, Planung, Werkzeugaufrufe und die abschließende Antwort. Sie bildet die tatsächliche Wartezeit besser ab als der reine Generierungsdurchsatz.

4. Vulkan gegen CUDA

Für jedes Modell verwenden beide Durchläufe dasselbe GGUF, dieselbe Vorlage, dieselbe Engine und dieselben Parameter. Nur das GPU-Backend ändert sich.

Ergebnisse — Antwortqualität

Drei LLMs, drei verschiedene Wege zum Ergebnis
Drei LLMs, drei verschiedene Wege zum Ergebnis

Gesamtergebnis

KonfigurationVulkanCUDA
Qwen 3.5 9B Q4_K_M9/15, also 60 %8/15, also 53 %
Ministral 3 14B Q5_K_M11/15, also 73 %11/15, also 73 %
Gemma 4 12B Q6_K13/15, also 87 %13/15, also 87 %

Qualitätssieger

Gemma 4 12B Q6_K erzielt unter beiden Backends mit 13 von 15 Erfolgen das beste Ergebnis. Ministral folgt mit 11/15. Qwen erreicht 9/15 unter Vulkan und 8/15 unter CUDA.

Ergebnisse nach Kategorie

Hier ein konkretes Beispiel aus jeder Kategorie:

KategorieBeispiel einer getesteten Anfrage
Basic„Wie hoch sind meine gesamten Verbindlichkeiten?“
Intermediate„Vergleiche den Wert meiner Ersparnisse mit meinen Schulden.“
Advanced„Wie hoch sind beim Ziel Retraite sereine der aktuelle Fortschritt und der erforderliche monatliche Beitrag?“
Write„Füge Crédit Mutuel zu meinen Instituten hinzu.“
Write Advanced„Lege bei Banque Horizon ein Konto Compte Travaux […] an, das zu 100 % Benoît Martin gehört.“
Modell und BackendBasic /8Intermediate /2Advanced /2Write /2Write Advanced /1
Qwen Vulkan62100
Qwen CUDA52100
Ministral Vulkan72200
Ministral CUDA72200
Gemma Vulkan82201
Gemma CUDA82201

Alle drei Modelle scheitern an beiden Write-Fällen. Im ersten sollte ein Institut hinzugefügt werden; keines führte die Änderung zu Ende. Im zweiten sollte ein direkt vom Goldpreis abgeleiteter Wert verändert werden. Die Modelle hätten klar erklären müssen, dass dieser isolierte Schreibvorgang nicht unterstützt wird, liefen aber bis an die Grenzen von Generierung oder Werkzeugnutzung weiter.

Einige Antworten, die uns überrascht haben

Beispiel 1 — eine ausgezeichnete anspruchsvolle Antwort

Bei der Frage zum Ziel „Retraite sereine“ finden Ministral und Gemma beide erwarteten Werte. Ministral antwortet unter anderem:

„Aktueller Fortschritt: 29,67 % […] Erforderlicher monatlicher Beitrag: 858,88 €.“

Die Antwort ist kurz, beziffert und beruht auf dem richtigen Abfragepfad.

Beispiel 2 — eine plausible, aber falsche Antwort

Qwen antwortet, dass die Verbindlichkeiten unter Vulkan 13,70 % und unter CUDA 15,94 % der Vermögenswerte finanzieren, obwohl 17,81 % erwartet werden. Die Berechnungen wirken glaubwürdig, doch das Modell lässt einen Teil der Verbindlichkeiten aus oder wählt den falschen Nenner.

Dieser Fehler zeigt, warum eine überzeugend formulierte Finanzantwort allein nicht genügt.

Beispiel 3 — wenn die Werkzeugnutzung den Unterschied macht

Beim Auftrag, das Bankkonto „Compte Travaux“ anzulegen, setzt Gemma unter Vulkan wie CUDA alle angeforderten Felder exakt um: Institut, Währung, Referenz, Einzahlung, Nachverfolgung, Eigentümer und Notiz.

Ministral legt zwar ein Konto an, lässt aber Institut und Notiz in der tatsächlich gespeicherten Wirkung aus, obwohl die Antwort das Gegenteil behauptet. Qwen führt keine Änderung aus. Deshalb müssen Schreibvorgänge am gespeicherten Zustand und nicht nur am Abschlusstext geprüft werden.

Ergebnisse — reale Geschwindigkeit in My Wealth

Mittlere und mediane Antwortzeit jedes Modells unter Vulkan und CUDA
Mittlere und mediane Antwortzeit jedes Modells unter Vulkan und CUDA

Antwortzeiten

KonfigurationMittelwertMedianMinimumMaximum
Qwen Vulkan20,4 s14,3 s11,6 s55,4 s
Qwen CUDA19,0 s13,8 s10,9 s52,4 s
Ministral Vulkan27,1 s20,8 s12,9 s109,5 s
Ministral CUDA24,7 s18,9 s11,7 s102,0 s
Gemma Vulkan27,7 s20,6 s12,8 s107,0 s
Gemma CUDA43,1 s19,4 s12,3 s273,3 s

Geschwindigkeitssieger

Qwen 3.5 9B unter CUDA ist sowohl im Mittel als auch beim Median am schnellsten. Gemma CUDA braucht eine Einordnung: Sein Median ist etwas besser als unter Vulkan, doch ein Fall erzeugte während der Planung 8.192 Tokens und dauerte 4 Minuten 33 Sekunden. Dadurch steigt der Mittelwert auf 43,1 Sekunden.

Vulkan vs. CUDA

Generierungsdurchsatz und CUDA-Gewinn je Modell
Generierungsdurchsatz und CUDA-Gewinn je Modell

Generierung: Tokens pro Sekunde

Der Durchsatz ergibt sich aus der Gesamtzahl erzeugter Tokens geteilt durch die von llama.cpp gemessene gesamte Generierungsdauer. Es handelt sich nicht um den einfachen Mittelwert der einzelnen Phasen.

ModellVulkanCUDACUDA-Gewinn
Qwen 3.5 9B57,02 tok/s61,70 tok/s+8,2 %
Ministral 3 14B31,32 tok/s33,32 tok/s+6,4 %
Gemma 4 12B30,39 tok/s33,54 tok/s+10,4 %

CUDA gewinnt beim Rohdurchsatz für alle drei Modelle. Eine kürzere Gesamtzeit ist damit jedoch nicht garantiert: Modellentscheidungen und Werkzeugaufrufe wiegen oft schwerer als einige Tokens pro Sekunde.

Mittlere Antwortzeit

CUDA senkt Qwens Mittelwert um etwa 7 % und den von Ministral um etwa 9 %. Bei Gemma erhöht der Planungsvorfall den Mittelwert um 56 %, während der Median um ungefähr 5 % sinkt. Der Median beschreibt hier das typische Verhalten besser; das Maximum erinnert daran, dass ein lokaler Assistent gelegentlich sehr lange generieren kann.

Der Sieger ist nicht unbedingt das schnellste Modell

Qwen erzeugt fast doppelt so viele Tokens pro Sekunde wie die beiden anderen Modelle, wird von Menschen jedoch deutlich schlechter bewertet. Ministral verbessert die Qualität erheblich, ohne die Wartezeit übermäßig zu verlängern. Gemma erzielt die beste Wertung und führt den einzigen anspruchsvollen Schreibvorgang unter beiden Backends aus, ist dafür im Rohdurchsatz langsamer und hatte unter CUDA einen langen Ausreißer.

Wir berechnen keinen willkürlichen Gesamtwert. Je nach Nutzung sind eine gesparte Sekunde, eine korrekte Antwort oder eine richtig ausgeführte Aktion unterschiedlich wichtig.

Welches Modell wählen?

Wenn Geschwindigkeit Vorrang hat

Qwen 3.5 9B Q4_K_M unter CUDA. Es ist schnell und benötigt deutlich weniger Speicher, doch bei einer Wertung von 8/15 sollten Anfragen jenseits einfacher Abfragen sorgfältig geprüft werden.

Für das beste Gleichgewicht

Ministral 3 14B Q5_K_M unter CUDA. Die Wertung bleibt unter beiden Backends bei 11/15, während CUDA den Median auf 18,9 Sekunden senkt. Für Abfragen und Analysen ist dies ein solider Kompromiss.

Wenn Qualität oberste Priorität hat

Gemma 4 12B Q6_K unter Vulkan. Mit 13/15 und einer erfolgreichen anspruchsvollen Aktion gewinnt es diesen Vergleich. Unter CUDA erreicht Gemma dieselbe Wertung, doch Vulkan vermeidet den Planungsvorfall, der den CUDA-Mittelwert stark erhöht.

Fazit

Auf dieser RTX 5060 Ti mit 16 GB dominiert kein Modell alle Kriterien.

Qwen ist der Geschwindigkeitsmeister. Ministral bietet das beständigste Verhältnis zwischen Wartezeit und Qualität. Gemma unter Vulkan liefert die besten funktionalen Ergebnisse und überzeugt bei komplexen Abläufen am meisten.

Die Wahl hängt daher vom Bedarf ab: schnelle Antworten auf einfache Abfragen, Ausgewogenheit für einen täglichen Assistenten oder höchste Priorität für Qualität und Aktionen. In unserem Vergleich gewinnt Gemma 4 12B Q6_K mit beiden Backends bei der Qualität; wegen seiner Beständigkeit bevorzugen wir Vulkan. Qwen 3.5 9B Q4_K_M unter CUDA gewinnt bei der Geschwindigkeit.

Aktualisiert am