Lühidalt: Surrogate Latent Policy Optimization võimaldab tõhusat tulemuspõhist tasustamisõpet varjatud arutlusmudelitele, mis kasutavad vahesammude jaoks tokenite asemel pidevaid vektoreid.
Teadlased on välja töötanud SLPO (Surrogate Latent Policy Optimization) meetodi, et rakendada tõestatavatel tasudel põhinevat tugevdusõpet ka varjatud arutlusmudelitele. Meetod väldib selgesõnaliste Chain-of-Thought-lähenemiste suuri arvutuskulusid, töödeldes vahesamme pidevate vektoritena, selle asemel et neid täielikult dekodeerida.
Varjatud arutlusmudelid kodeerivad vahesammud pidevate vektoritena, mitte tokenitena, tänu millele nad suudavad juba lühemate arvutusahelatega konkureerida selgesõnaliste Chain-of-Thought-meetoditega või neid ületada. Probleem seisneb selles, et kui selgesõnalisi CoT-mudeleid sai skaleerida tulemuspõhise tasustamisega tugevdusõppe abil, siis varjatud arutlusmudelid piirdusid seni jäljendusõppega, kuna nende trajektooridel puudub käsitletav samm-sammult tõenäosus ning fikseeritud arvutuseelarve juures puudub adaptiivne peatumisliides.
SLPO lahendab selle piirangu kahe põhikomponendi abil: empiirilise asendus-poliitika tihedusega varjatud üleminekute üle, mis võimaldab tasu omistamist trajektoori tasandil, ning peatumispeaga, mida juhendatakse õigsuse alusel ja mida tulemuspõhine tasustamisõpe täiustab muutuva ajahorisondiga poliitikaks. Sellega muutub tasupõhine tugevdusõpe esimest korda rakendatavaks autoregressiivsetele varjatud arutlusmudelitele.
Katsetes pidevate ja nn Soft-Thinking-seadistustega parandab SLPO Pass@k-määrasid paralleelse valimi võtmise korral ning jaotab keerukamatele juhtumitele adaptiivselt pikemaid varjatud arvutusahelaid, samal ajal kui lihtsamad ülesanded lahendatakse lühemalt ja suurema täpsusega.
Allikas: arxiv.org · Avaldatud 21. juuli 2026
Lumi AI News — tehisintellekti abil kureeritud sisu vastavalt tehisintellektimääruse artiklile 50. Parafraseerimine ja klassifitseerimine Lumi News Pipeline v1.7.3 abil.