Lühidalt: Külmutatud 12B mudel koos verifitseeritud lahenduste mäluga saavutab verifitseeritud probleemiperekondades 100% täpsuse, ilma et kuluks ühtki tokenit, andes deterministlikke ja bititäpseid tulemusi.
Teadlased on välja töötanud meetodi, kus suur keelemudel jäetakse külmutatuks ning selle kõrvale luuakse pidevalt kasvav verifitseeritud lahenduste mälu. 180 testjuhtumi puhul üheksas probleemiperekonnas saavutas 12B mudel nelja eri tootja neljal erineval arhitektuuril järjepidevalt 180/180 õiget vastust ilma ühegi genereerimistokenita.
Kontseptsioon pöörab senise optimeerimiskäsitluse pea peale: selle asemel, et mudel õpiks järgmise treenimisvooru käigus kõike uuesti nullist, jäetakse olemasolev mudel külmutatuks ning selle kõrvale ehitatakse verifitseeritud lahenduste mälu. Probleemijuhtum lisatakse mällu alles pärast sõltumatut kontrolli, mis vastusele endale ligi ei pääse. Verifitseeritud probleemiperekondade puhul lahendatakse iga sama kategooria uus päring seejärel täpse otsingu teel – ilma genereerimistokeniteta, bititäpselt ja deterministlikult.
Hindamine hõlmas 180 uut juhtumit üheksas probleemiperekonnas ja neljal mudeliarhitektuuril (sealhulgas nii tihe- kui ka Mixture-of-Experts arhitektuurid neljalt eri pakkujalt). Kõik saavutasid tulemuse 180/180 õiget vastust. Negatiivne kontrollkatse näitas: tühjendatud mäluga ei suuda süsteem lahendada mitte midagi – kogu jõudlus tuleneb üksnes mälust. Avatud arutlusülesannete puhul kinnitati masinaga 88/88 päringut verifitseerituna; arutlusmeetod kandus uutele mudelitele üle 77/80 õnnestumisega.
Praktilised nõuded on minimaalsed: mäluotsing võtab aega 1,4 mikrosekundit; verifitseeritud lahenduse täielik pärimine nõuab 6–23 millisekundit ja 36 mWh energiat. Kriitiline tähelepanek: ligilähedase sarnasuse põhine otsing (similarity search) valib 4500 kirjega mälu puhul 94,3% juhtudest vale kirje, samas kui täpne aadresseerimine ei tee ühtegi viga.
Mälu toimib ka töökontekstina: süsteem haldab 6 000 000 tokeni suurust akent ühel 46 GB graafikaprotsessoril, kasutades lamedat mäluarhitektuuri. Võrdluseks: vLLM peatub 30 399 tokeni juures ning SGLang katkestab vaikimisi 32 000 tokeni ületamisel. Standardsete võrdlustestide puhul on tipptasemel mudelid nullist arutlemises endiselt ees, kuid verifitseeritud probleemide puhul olukord pöördub: tipptasemel API-d maksavad iga päringu eest uue genereerimiskäigu eest, samas kui verifitseeritud pärimised on tasuta ja tagastavad identsed bitid.
Allikas: arxiv.org · Avaldatud 25. juuli 2026
Lumi AI News — tehisintellekti abil kureeritud vastavalt tehisintellektimääruse artiklile 50. Parafraseerimine ja klassifitseerimine Lumi News Pipeline v1.7.3 abil.