Lühidalt: Suured keelemudelid ei agregeeri alampopulatsioonide kohta tehtud ennustusi järjepidevalt kehtivateks kogupopulatsiooni hinnanguteks, kuigi neil on selleks vajalikud teadmised olemas.
Teadlased uurisid, kas suured keelemudelid järgivad kontekstipõhise õppimise (in-context learning) käigus tõenäosusteooria põhiseadusi. Tulemus: LLM-id rikuvad süstemaatiliselt täistõenäosuse valemit, kui alampopulatsioonide kohta tehtud ennustusi agregeeritakse kogupopulatsiooni tasandile.
Uuring käsitleb küsimust, kas kontekstipõhist õppimist LLM-ides saab tõlgendada tingimusliku järeldusena — see tähendab, kas mudel hindab konteksti kirjelduse põhjal kehtivat tingliku tõenäosuse jaotust. Sellisel eeldusel peaksid LLM-i hinnangud vastama täistõenäosuse valemile: alampopulatsioonide kaalutud tingliku jaotused peaksid agregeeruma kogupopulatsiooni marginaaljaotusteks, sõltumata sellest, kuidas populatsioon on jaotatud.
Teadlased kasutasid hindamisraamistikuna binaarpuid, et jaotada populatsioonid rekursiivselt üha peenemateks alampopulatsioonideks. Seejärel esitati LLM-idele sõnastatud alampopulatsioonide kirjeldusi, agregeeriti saadud hinnangud tagasi populatsiooni tasandile ning võrreldi neid erineva detailsusastmega jaotuste lõikes. Protokolli rakendati mitmes probleemvaldkonnas ja mitme tipptasemel mudeliga.
Tulemused näitavad laialdasi rikkumisi põhiliste järjepidevuspõhimõtete vastu. Persoonapõhise viipamise (persona prompting) põhjalikum uurimine tõi esile nähtuse, mida autorid nimetavad „makro-eksituseks” (Macro Fallacy): peenema granulaarsusega alampopulatsiooni vastuste põhjal rekonstrueeritud hinnangud vastavad tihti paremini inimestelt saadud võrdlusandmetele kui otsesed populatsiooni tasandi hinnangud. See mõju püsib erinevate puustruktuuride ja hindamisülesannete lõikes ning seda on osaliselt võimalik tasakaalustada kaudse viipamise abil.
Tulemused viitavad sellele, et mudelitel on olemas asjakohased teadmised alampopulatsioonide kohta, kuid nad ei suuda neid usaldusväärselt koondhinnangutesse üle kanda. Selline lõhe kehtestab statistilise iseenesega kooskõla iseseisva, võrdlusandmeid mittevajava ja põhimõtteliselt küllastumatu hindamiskriteeriumina LLM-ide jaoks — see on test, mis ei vaja kuldstandardi märgendusi, vaid kontrollib ainult sisemisi järjepidevusreegleid.
Allikas: arxiv.org · Avaldatud 15. juuli 2026
Lumi AI News — tehisintellekti abil kureeritud vastavalt tehisintellektimääruse artiklile 50. Parafraseerimine ja klassifitseerimine Lumi News Pipeline v1.7.3 abil.