Skip to content

Ise juhitud testiaegne treening parandab pikakontekstiliste sisendite töötlemist LLM-ides

Lühidalt: Ise juhitud testiaegne treening (S-TTT) parandab pikakontekstiliste sisendite töötlemist, sest mudel tuvastab enne parameetrite kohandamist ise asjakohased tekstilõigud, mitte ei vali juhuslikke katkendeid.

Teadlased pakuvad välja ise juhitud testiaegse treeningu (Self-Guided Test-Time Training, S-TTT) meetodi, mille puhul keelemudelid tuvastavad pikkades kontekstides kõigepealt automaatselt asjakohased tekstilõigud, enne kui nad end sihipärase kohandamise abil optimeerivad. Meetod näitab LongBench-v2 ja LongBench-Pro testides kuni 15% suurust täiustust selliste mudelite puhul nagu Qwen3-4B-Thinking-2507 ja Llama-3.1-8B-Instruct.

Pikakontekstiliste sisendite töötlemine on suurte keelemudelite tuntud kitsaskoht: kuigi konteksti akna lihtne pikendamine tundub esmapilgul lahendusena, toob kasvav sisendimaht praktikas kaasa täpsuse languse. Mudelitel on ilmselgelt raskusi küsimusele vastamiseks tegelikult vajalike tõendite leidmise ja kasutamisega.

Testiaegne treening (TTT) on tuntud lähenemine selle probleemi lahendamiseks: mudel käsitleb testikonteksti treeningnäitena, mille põhjal toimub eksemplarispetsiifiline parameetrite kohandamine. Sellega kaasneb aga oluline probleem: TTT rakendamine kogu pika konteksti peale on arvutuslikult liiga kulukas, ning kohandamine juhuslikult valitud tekstilõikude põhjal tekitab olulist müra. Arran Fernandez ja tema kolleegid näitavad oma uuringus, et TTT on väga tundlik treeninglõikude kvaliteedi suhtes. LongBench-v2 testis vähendas TTT juhuslikult valitud lõikudega isegi lähtetaset ületavat tulemuslikkust, samas kui TTT oraakli-lõikudel (optimaalsetel teadaolevalt asjakohastel lõikudel) parandas seda oluliselt.

Sellest tähelepanekust lähtudes töötasid teadlased välja S-TTT: mudel tuvastab enne kohandamist iseseisvalt tekstilõigud, millest ta peaks õppima, ning rakendab standardset keelemudeldamise eesmärki ainult nende valitud lõikude peal. Sel moel väldib meetod treenimist konteksti ebaolulistel osadel, mis muidu halvendaksid baasmudeli tulemuslikkust.

Kahel nõudlikul pikakontekstilise arutluse võrdlustestil, LongBench-v2 ja LongBench-Pro, saavutas S-TTT täpsuse paranemise nii Qwen3-4B-Thinking-2507 kui ka Llama-3.1-8B-Instruct puhul, suhtelise täiustusega kuni 15%. Lähenemine pakub inseneridele praktilise võimaluse optimeerida keelemudelite tulemuslikkust pikemate sisendite korral, ilma et oleks vaja ulatuslikku ümbertreenimist või arhitektuurilisi muudatusi.


Allikas: arxiv.org · Avaldatud 9. juuli 2026
Lumi AI News — tehisintellekti abil kureeritud vastavalt tehisintellektimääruse artiklile 50. Parafraseerimine ja klassifitseerimine Lumi News Pipeline v1.7.3 abil.

Share on: