Qwen3.5-9B o Ministral-3-14B-Instruct-2512: ¿qué cambia realmente con el modelo de IA local?

My Wealth 1.6 ofrece varios modelos de inteligencia artificial local para adaptarse a los recursos de cada ordenador. Qwen3.5-9B cuenta con 9.000 millones de parámetros, frente a los 14.000 millones de Ministral-3-14B-Instruct-2512.
Sobre el papel, Ministral tiene mayor capacidad. En la práctica, las pruebas muestran una realidad más interesante: el modelo grande resuelve más solicitudes complejas, pero no siempre es mejor. Un modelo ligero puede ser más directo, rápido y, a veces, más fiel a la información estructurada recibida.
La comparación no busca un ganador absoluto, sino comprender cómo razona cada modelo y mejorar el asistente para todos los perfiles.
¿Cómo evaluamos los modelos?
Utilizamos un patrimonio de prueba reproducible y preguntas formuladas como en la aplicación. Los escenarios cubren el valor y la composición del patrimonio, distribución y concentración, deudas y activos financiados, ingresos pasivos, presupuestos y operaciones recurrentes, objetivos y proyecciones, cruces de varias fuentes y preparación de modificaciones respetando los permisos.
El modelo debe comprender la solicitud, elegir las herramientas MCP adecuadas, preparar sus parámetros, aprovechar los resultados y redactar una respuesta coherente con los datos. También verificamos que no invente valores ni proponga operaciones no solicitadas.
Los fallos se clasifican por su primera causa: herramienta incorrecta, parámetro inventado, valor de negocio erróneo, respuesta insuficientemente fundamentada o problema de ejecución. Solo añadimos una corrección cuando las trazas demuestran su necesidad.
Resultados en cifras
Para comparar de forma equitativa, ambos modelos recibieron las mismas 46 preguntas sobre el mismo patrimonio de referencia y las mismas herramientas:
| Resultado en los 46 escenarios comunes | Qwen3.5-9B | Ministral-3-14B-Instruct-2512 |
|---|---|---|
| Pruebas superadas | 33 / 46 — 71,7 % | 37 / 46 — 80,4 % |
| Pruebas fallidas | 13 / 46 — 28,3 % | 9 / 46 — 19,6 % |
| Duración mediana observada | 2 min 52 s | 3 min 44 s |
Es una fotografía del desarrollo, no un benchmark universal. Las pruebas se realizaron con un Intel Core Ultra 7 165U, sus gráficos Intel integrados y 18 GB de memoria compartida, sin gráfica dedicada ni memoria de vídeo propia. Aun así, Qwen responde en pocos minutos y trata algunas preguntas habituales en algo más de un minuto.
Ambos modelos usaron en la práctica la parte Compute de la GPU Intel. Con Ministral, Vulkan puede indicar una aparente ejecución en CPU, aunque el seguimiento de recursos muestra que la CPU permanece inactiva y la GPU soporta la carga. Las pruebas acompañaron además varias mejoras del orquestador, por lo que los tiempos no aíslan únicamente la arquitectura de los modelos.
En esta campaña, Ministral supera más escenarios y Qwen sigue siendo sensiblemente más rápido. El modelo grande mejora algunas solicitudes complejas a cambio de más recursos y tiempo.
Dónde destaca Ministral
Ministral fue más eficaz al relacionar varias informaciones: comparaciones entre propietarios, valor de una familia de activos frente a la deuda, proporción de ingresos de activos financieros, activos valiosos pero poco rentables, relación entre activos financiados y pasivos, inversiones recurrentes de los presupuestos y objetivos más alejados de su meta.
Coincide con su uso previsto: comparaciones más ricas, relaciones entre entidades y solicitudes con más etapas.
Dónde sorprende Qwen
Qwen no es solo una alternativa ligera. Suele ser más directo y, cuando basta con un resumen claro o un resultado canónico, evita reinterpretarlo innecesariamente.
Un lote reciente incluía las cuatro preguntas predeterminadas del panel de IA:
- ¿Cuál es la situación de mi patrimonio?
- ¿Dónde está más concentrado mi patrimonio?
- ¿Qué activo tiene el mejor rendimiento?
- ¿Qué parte de mi patrimonio puedo movilizar rápidamente?
Qwen resolvió las cuatro. Ministral resolvió tres en su primera ejecución completa, pero omitió la concentración máxima aunque el dato estaba disponible. Había elegido el análisis MCP correcto; el error surgió al reinterpretar las dimensiones devueltas.
Un razonamiento más elaborado puede resolver una solicitud compleja, pero también reclasificar o enriquecer una respuesta que debía respetar estrictamente un resultado ya calculado.
El modelo no trabaja solo
La calidad no depende únicamente del número de parámetros. My Wealth añade una capa de orquestación entre la pregunta y los datos. Presenta un catálogo compacto de herramientas, deja al modelo elegirlas y preparar parámetros, valida las llamadas, devuelve errores estructurados corregibles, calcula relaciones canónicas a partir de MCP y mantiene al modelo responsable de comprender y redactar.
El LLM interpreta y explica; la aplicación protege los accesos y estabiliza los hechos exactos. Como una instrucción eficaz para Qwen puede ser ignorada o sobreinterpretada por Ministral —y viceversa—, My Wealth usa políticas adaptadas a cada modelo en lugar de un prompt universal.
¿Qué perfil elegir?
Qwen es el mejor punto de partida para preguntas habituales, resúmenes patrimoniales y equipos con recursos limitados. Ministral interesa cuando se consultan varias dimensiones, se comparan entidades o se requiere un análisis con más pasos. No garantiza una respuesta perfecta y puede tardar más, especialmente sin aceleración GPU.
La elección depende de las preguntas, los recursos del ordenador y el tiempo de respuesta aceptable.
Una evaluación que continúa tras el lanzamiento
My Wealth 1.6 no pone fin a la campaña. Cada error reproducible puede revelar una ambigüedad de herramienta, una relación de negocio poco explícita o un comportamiento propio del modelo. Estas conclusiones mejoran el orquestador, los contratos MCP y las políticas, y orientarán la integración de futuros LLM.
Como toda inteligencia artificial, el asistente puede equivocarse. La información financiera importante debe verificarse siempre, sea cual sea el perfil.
