Qwen3.5-9B ar Ministral-3-14B-Instruct-2512: kiek iš tiesų lemia vietinis DI modelis?

Vietinio dirbtinio intelekto modelio pasirinkimas ir konfigūravimas „My Wealth“
Vietinio dirbtinio intelekto modelio pasirinkimas ir konfigūravimas „My Wealth“

„My Wealth 1.6“ siūlo kelis vietinius DI modelius, pritaikytus skirtingiems kompiuterio ištekliams. Qwen3.5-9B turi 9 milijardus parametrų, o Ministral-3-14B-Instruct-2512 – 14 milijardų.

Teoriškai Ministral pajėgesnis. Tačiau bandymai rodo įdomesnį vaizdą: didesnis modelis dažniau įveikia sudėtingas užklausas, bet ne visada yra geresnis. Lengvesnis modelis gali būti tiesesnis, greitesnis ir kartais tiksliau laikytis pateiktos struktūruotos informacijos.

Šiuo palyginimu nesiekiame paskelbti absoliutaus laimėtojo. Jis padeda suprasti kiekvieno modelio samprotavimą ir tobulinti asistentą visiems profiliams.

Kaip vertiname modelius?

Naudojame pakartojamą bandomąjį portfelį ir klausimus, suformuluotus kaip programoje. Scenarijai apima turto vertę ir sudėtį, paskirstymą ir koncentraciją, skolas bei finansuojamą turtą, pasyvias pajamas, biudžetus ir pasikartojančias operacijas, investavimo tikslus ir prognozes, kelių šaltinių susiejimą bei pakeitimų rengimą laikantis leidimų.

Modelis turi suprasti užklausą, pasirinkti tinkamus MCP įrankius, parengti parametrus, panaudoti rezultatus ir pateikti duomenis atitinkantį atsakymą. Taip pat tikriname, ar jis neišgalvoja verčių ir nesiūlo neprašytos operacijos.

Nesėkmes klasifikuojame pagal pirmąją priežastį: netinkamas įrankis, išgalvotas parametras, klaidinga dalykinė vertė, nepakankamai pagrįstas atsakymas arba vykdymo problema. Pataisą įtraukiame tik tada, kai jos poreikį patvirtina vykdymo įrašai.

Rezultatai skaičiais

Kad palyginimas būtų sąžiningas, abu modeliai gavo tuos pačius 46 klausimus apie tą patį etaloninį portfelį ir tuos pačius įrankius:

46 bendrų scenarijų rezultatasQwen3.5-9BMinistral-3-14B-Instruct-2512
Sėkmingi testai33 / 46 — 71,7 %37 / 46 — 80,4 %
Nesėkmingi testai13 / 46 — 28,3 %9 / 46 — 19,6 %
Stebėta trukmės mediana2 min. 52 sek.3 min. 44 sek.

Tai kūrimo etapo nuotrauka, o ne universalus etalonas. Testai atlikti kompiuteriu su Intel Core Ultra 7 165U, integruota Intel grafika ir 18 GB bendrinamos atminties, be atskiros vaizdo plokštės ar nuosavos vaizdo atminties. Vis dėlto Qwen atsako per kelias minutes, o kai kuriuos įprastus klausimus apdoroja per kiek daugiau nei minutę.

Praktiškai abu modeliai naudojo Intel GPU Compute dalį. Ministral atveju Vulkan gali pranešti apie tariamą perėjimą prie CPU, tačiau išteklių stebėjimas rodo neveiklų procesorių ir GPU apkrovą. Be to, bandymai vyko kartu su keliais orkestratoriaus patobulinimais, todėl trukmės neatskiria vien modelių architektūros.

Šioje kampanijoje Ministral įveikė daugiau scenarijų, o Qwen išliko pastebimai greitesnis. Didesnis modelis pagerina kai kurias sudėtingas užklausas, tačiau reikalauja daugiau išteklių ir laiko.

Kur Ministral turi pranašumą

Ministral geriau veikė, kai reikėjo susieti kelis duomenis: palyginti savininkus, turto grupės vertę su skola, finansinio turto pajamų dalį, didelės vertės bet mažo pajamingumo turtą, finansuojamą turtą ir susijusius įsipareigojimus, pasikartojančias biudžeto investicijas bei labiausiai nuo tikslo nutolusius tikslus.

Tai atitinka jo paskirtį: turtingesni palyginimai, ryšiai tarp kelių objektų ir daugiapakopės užklausos.

Kur Qwen nustebina

Qwen nėra vien lengvesnė alternatyva. Jis dažnai atsako tiesiau ir be reikalo neperinterpretuoja aiškios santraukos ar kanoninio rezultato.

Naujausiame rinkinyje buvo keturi numatytieji DI skydelio klausimai:

  1. Kokia mano turto padėtis?
  2. Kur mano turtas labiausiai koncentruotas?
  3. Kuris turtas pasiekė geriausią rezultatą?
  4. Kokią turto dalį galiu greitai panaudoti?

Qwen teisingai atsakė į visus keturis. Ministral per pirmą pilną vykdymą įveikė tris, bet nepaminėjo didžiausios koncentracijos, nors duomenys buvo prieinami. Jis pasirinko tinkamą MCP analizę; klaida atsirado perinterpretuojant grąžintus matmenis.

Išsamesnis samprotavimas gali padėti išspręsti sudėtingą užklausą, bet taip pat be reikalo pakeisti jau apskaičiuotą atsakymą.

Modelis dirba ne vienas

Kokybė priklauso ne tik nuo parametrų skaičiaus. „My Wealth“ tarp klausimo ir duomenų įterpia orkestravimo sluoksnį. Jis pateikia glaustą įrankių katalogą, leidžia modeliui pasirinkti įrankius ir parametrus, tikrina iškvietimus, grąžina pataisomas struktūrines klaidas, apskaičiuoja kanoninius ryšius iš MCP rezultatų ir palieka modeliui suprasti bei suformuluoti atsakymą.

LLM interpretuoja ir aiškina, o programa saugo prieigą ir stabilizuoja tikslius faktus. Kadangi Qwen veiksmingą nurodymą Ministral gali ignoruoti arba per daug interpretuoti — ir atvirkščiai — „My Wealth“ taiko kiekvienam modeliui pritaikytas taisykles, o ne vieną universalų promptą.

Kurį profilį pasirinkti?

Qwen yra geriausia pradžia įprastiems klausimams, turto santraukoms ir ribotų išteklių kompiuteriams. Ministral naudingas analizuojant kelis matmenis, lyginant objektus ar atliekant daugiapakopę analizę. Jis negarantuoja tobulo atsakymo ir gali užtrukti ilgiau, ypač be GPU spartinimo.

Pasirinkimą lemia jūsų klausimai, kompiuterio ištekliai ir priimtinas atsakymo laikas.

Vertinimas tęsiamas ir po išleidimo

„My Wealth 1.6“ išleidimas neužbaigia kampanijos. Kiekviena pakartojama klaida gali atskleisti dviprasmį įrankį, nepakankamai aiškų dalykinį ryšį ar konkretaus modelio elgesį. Šios išvados tobulina orkestratorių, MCP sutartis ir modelių taisykles bei padės rinktis būsimus LLM.

Kaip ir bet kuris DI, asistentas gali klysti. Svarbią finansinę informaciją visada reikia patikrinti, nepaisant pasirinkto profilio.

Atraskite „My Wealth 1.6.0“

Atnaujinta