Lühidalt: Suured keelemudelid ei suuda mitmevoorulistes vestlustes usaldusväärselt sammu pidada kasutajate muutuvate kavatsustega, kuigi tavapärased võrdlustestid seda ei kajasta.
Uuringud näitavad, et suured keelemudelid, hoolimata heast tulemuslikkusest staatilistes testides, muutuvad märgatavalt kehvemaks olukorras, kus kasutajad muudavad või täpsustavad vestluse käigus järk-järgult oma nõudeid. Seda põhimõttelist puudujääki tavapärased ühevoorulised hindamismeetodid ei tuvasta.
Ülikooli teadlased on välja töötanud raamistiku, mis muudab staatilised ühevoorulised ülesanded dünaamilisteks mitmevoorulisteks vestlusteks. Selle käigus paljastatakse kasutaja kavatsus teadlikult samm-sammult, seda muudetakse ja vahepeal osaliselt suunatakse hoopis mujale — säilitades samal ajal algsete ülesannete hindamisprotokollid. See võimaldab kasutada olemasolevaid võrdlustestide kogumeid kontrollitud testkeskkondadena ilma uute annotatsioonideta.
Empiirilised tulemused on eri mudeliarhitektuuride lõikes ühtsed: tugev tulemuslikkus staatilistes seadistustes ei kandu üle stsenaariumile, kus kavatsused muutuvad. Kõik testitud mudeliperekonnad näitasid märkimisväärset tulemuslikkuse langust. See viitab sellele, et praegused suured keelemudelid ei suuda kasutaja kavatsust vestluse kulgemise jooksul usaldusväärselt jälgida ega selle järgi tegutseda.
Tehnoloogiajuhtidele on see oluline, kuna tootmises kasutatavad keelemudeli-lahendused põhinevad üha enam korduval koostööl: kasutajad delegeerivad keerukaid ülesandeid agentidele, kes suhtlevad nendega mitme vooru vältel ja täpsustavad seejuures nõudeid. Kokkulangevus tugevate ühevooruliste mõõdikute ja tegeliku mitmevoorulise ebaõnnestumise vahel tähendab, et organisatsioonid peavad oma hindamisprotsesse täiendama dünaamiliste kavatsuste jälgimise testidega, enne kui selliseid süsteeme kriitilistes töövoogudes kasutusele võetakse.
Allikas: arxiv.org · Avaldatud 21. juuli 2026
Lumi AI News — tehisintellekti abil kureeritud vastavalt tehisintellektimääruse art. 50-le. Parafraseerimine ja klassifitseerimine Lumi News Pipeline v1.7.3 abil.