Qwen3.5-9B ou Ministral-3-14B-Instruct-2512 : que change vraiment le modèle d’IA locale ?

Choix et configuration d’un modèle d’intelligence artificielle locale dans My Wealth
Choix et configuration d’un modèle d’intelligence artificielle locale dans My Wealth

My Wealth 1.6 propose plusieurs modèles d’intelligence artificielle locale afin de s’adapter aux ressources de chaque ordinateur. Parmi eux, Qwen3.5-9B compte 9 milliards de paramètres, tandis que Ministral-3-14B-Instruct-2512 en compte 14 milliards.

Sur le papier, Ministral-3-14B-Instruct-2512 dispose de davantage de capacités. Dans la pratique, nos tests montrent une réalité plus intéressante : le modèle le plus grand réussit plus souvent les demandes complexes, mais il n’est pas systématiquement meilleur. Un modèle plus léger peut être plus direct, plus rapide et parfois plus fidèle aux informations structurées qui lui sont fournies.

Cette comparaison ne cherche donc pas à désigner un vainqueur absolu. Elle nous aide à comprendre comment chaque modèle raisonne et à améliorer l’assistant pour tous les profils.

Comment évaluons-nous les modèles ?

Nous utilisons un patrimoine de test reproductible et des questions formulées comme elles pourraient l’être dans l’application. Les scénarios couvrent notamment :

  • la valeur et la composition du patrimoine ;
  • les répartitions et les concentrations ;
  • les dettes et les actifs qu’elles financent ;
  • les revenus passifs ;
  • les budgets et les opérations récurrentes ;
  • les objectifs d’investissement et leurs projections ;
  • les demandes qui nécessitent de croiser plusieurs sources ;
  • la préparation d’opérations de modification en respectant les autorisations.

Chaque test observe plusieurs étapes. Le modèle doit comprendre la demande, sélectionner les bons outils MCP, préparer leurs paramètres, exploiter les résultats puis rédiger une réponse conforme aux données obtenues. Nous vérifions également qu’il n’invente pas de valeur et qu’il ne propose pas une opération non demandée.

Les échecs sont ensuite classés selon leur première cause : mauvais outil, paramètre inventé, valeur métier incorrecte, réponse insuffisamment fondée ou problème d’exécution. Une correction n’est ajoutée que lorsque les traces permettent d’en démontrer la nécessité.

Les résultats en chiffres

Pour obtenir une comparaison équitable, nous avons soumis Qwen3.5-9B et Ministral-3-14B-Instruct-2512 aux 46 mêmes questions portant sur un patrimoine de référence identique. Les deux modèles disposaient également des mêmes outils pour consulter et analyser les données. Les résultats présentés ci-dessous correspondent aux exécutions les plus récentes disponibles pour chacun d’eux :

Résultat sur ces 46 scénarios communsQwen3.5-9BMinistral-3-14B-Instruct-2512
Tests réussis33 / 46 — 71,7 %37 / 46 — 80,4 %
Tests échoués13 / 46 — 28,3 %9 / 46 — 19,6 %
Durée médiane observée2 min 523 min 44

Ces chiffres sont une photographie de développement, pas un benchmark universel. Les tests ont été réalisés sur un ordinateur équipé d’un Intel Core Ultra 7 165U, de son circuit graphique Intel intégré et de 18 Go de mémoire partagée. Cette machine n’est clairement pas une station de travail conçue pour exécuter des LLM locaux : elle ne dispose ni d’une carte graphique dédiée ni de mémoire vidéo propre. Malgré cela, Qwen3.5-9B fournit des réponses en quelques minutes et peut traiter certaines questions courantes en un peu plus d’une minute, ce qui reste relativement rapide compte tenu du matériel utilisé.

Les deux modèles ont, en pratique, exécuté leurs calculs sur la partie Compute du GPU Intel. Pour Ministral-3-14B-Instruct-2512, Vulkan peut signaler un repli présenté comme une exécution sur le processeur, mais l’observation des ressources montre que le CPU ne travaille pas pendant l’inférence et que la charge reste portée par le GPU. Les tests ont également accompagné plusieurs améliorations successives de l’orchestrateur : les durées observées ne constituent donc pas une comparaison isolée des architectures des deux modèles.

Sur cette campagne, Ministral-3-14B-Instruct-2512 réussit davantage de scénarios, tandis que Qwen3.5-9B reste sensiblement plus rapide.

Cela confirme un compromis attendu : le modèle plus grand améliore la réussite sur certaines demandes complexes, au prix de ressources et d’un temps de traitement généralement supérieurs.

Là où Ministral-3-14B-Instruct-2512 prend l’avantage

Ministral-3-14B-Instruct-2512 s’est montré plus à l’aise lorsqu’une demande oblige à relier plusieurs informations avant de répondre. Il a notamment mieux réussi plusieurs scénarios portant sur :

  • la comparaison entre propriétaires ;
  • la valeur d’une famille d’actifs rapprochée du niveau de dette ;
  • la part de revenus générée par des actifs financiers ;
  • l’identification d’actifs de grande valeur mais peu rémunérateurs ;
  • le rapprochement entre actifs financés et passifs associés ;
  • les investissements récurrents configurés dans les budgets ;
  • les objectifs les plus éloignés de leur cible.

Cette différence correspond bien à l’usage prévu de Ministral-3-14B-Instruct-2512 : des comparaisons plus riches, des relations entre plusieurs entités et des demandes comprenant davantage d’étapes.

Là où Qwen3.5-9B surprend

Qwen3.5-9B n’est pas seulement une alternative plus légère à Ministral-3-14B-Instruct-2512. Son comportement est souvent plus direct. Lorsqu’une question peut être résolue à partir d’une synthèse claire ou d’un résultat canonique, il tend à restituer les informations sans les réinterpréter inutilement.

Un lot récent reprenait les quatre questions proposées par défaut dans le panneau IA :

  1. Quelle est la situation de mon patrimoine ?
  2. Où mon patrimoine est-il le plus concentré ?
  3. Quel actif a la meilleure performance ?
  4. Quelle part de mon patrimoine puis-je mobiliser rapidement ?

Qwen3.5-9B a réussi les quatre questions. Ministral-3-14B-Instruct-2512 en a réussi trois lors de sa première exécution complète, mais a omis la concentration la plus élevée dans la deuxième réponse alors que la donnée était disponible. Le modèle avait correctement sélectionné l’analyse MCP ; l’erreur provenait de sa façon de réinterpréter les dimensions retournées.

Cet exemple résume bien l’un de nos enseignements : un raisonnement plus développé peut aider à résoudre une demande complexe, mais il peut aussi conduire le modèle à reclasser ou enrichir une réponse qui devait rester strictement fidèle à un résultat déjà calculé.

Le modèle ne travaille pas seul

La qualité de l’assistant ne dépend pas uniquement du nombre de paramètres du LLM. My Wealth ajoute une couche d’orchestration entre la question et les données du patrimoine.

Cette couche remplit plusieurs fonctions :

  • elle présente un catalogue compact des outils disponibles ;
  • elle laisse le modèle choisir les outils utiles et préparer leurs paramètres ;
  • elle valide les appels avant leur exécution ;
  • elle fournit des erreurs structurées lorsque le plan peut être corrigé ;
  • elle calcule certaines relations canoniques à partir des résultats MCP ;
  • elle conserve au modèle la responsabilité de comprendre la demande et de rédiger la réponse.

L’objectif n’est pas de remplacer l’intelligence du modèle par une succession de réponses prédéfinies. Il est de lui offrir un cadre fiable : le LLM interprète et explique, tandis que l’application sécurise les accès et stabilise les faits exacts qui ne doivent pas dépendre d’une approximation linguistique.

Nos tests ont également montré que les deux modèles ne profitent pas toujours des mêmes instructions. Une consigne efficace pour Qwen3.5-9B peut être ignorée ou surinterprétée par Ministral-3-14B-Instruct-2512, et inversement. My Wealth utilise donc des politiques adaptées à chaque modèle plutôt qu’un prompt unique supposé convenir à tous.

Quel profil choisir ?

Qwen3.5-9B reste le meilleur point de départ pour les questions courantes, les synthèses patrimoniales et les ordinateurs disposant de ressources plus limitées. Sa rapidité et son comportement direct lui permettent déjà de répondre correctement à de nombreuses demandes utiles.

Ministral-3-14B-Instruct-2512 devient intéressant lorsque vous interrogez plusieurs dimensions à la fois, comparez des entités ou demandez une analyse nécessitant davantage d’étapes. Il ne garantit cependant pas une réponse parfaite et peut demander plus de temps, surtout lorsqu’il fonctionne sans accélération GPU.

Le bon choix dépend donc moins d’un classement abstrait que de trois critères : les questions que vous posez, les ressources disponibles sur votre ordinateur et le temps de réponse que vous jugez acceptable.

Une évaluation qui continue après la sortie

La sortie de My Wealth 1.6 ne met pas fin à cette campagne. Chaque erreur reproductible peut révéler une ambiguïté dans un outil, une relation métier insuffisamment explicite ou un comportement propre à un modèle.

Ces enseignements servent à améliorer l’orchestrateur, les contrats MCP et les politiques des modèles sans masquer leurs limites. Ils pourront aussi guider l’intégration de nouveaux LLM lorsque ceux-ci offriront un meilleur équilibre entre qualité, rapidité et ressources nécessaires.

Comme toute intelligence artificielle, l’assistant peut toujours se tromper. Les informations financières importantes doivent être vérifiées, quel que soit le profil utilisé.

Découvrir My Wealth 1.6.0

Mis à jour le