Skip to content

SEED: iseõppiv käitumise selgitamine agendipõhistele tugevdusõppe mudelitele

Lühidalt: SEED kasutab keelemudeli enda genereeritud tagantjärele-järelevalvet trajektooride analüüside põhjal, et kaotada lõhe episoodiliste tulemuste ja tokenitasandi õppekäskude vahelises järelevalves.

Teadlased on välja töötanud raamistiku SEED, mis muudab suurte keelemudelite tugevdusõppe keeruliste mitmekäiguliste ülesannete jaoks tõhusamaks. Meetod eraldab lõpetatud trajektooridest automaatselt loomulikus keeles oskusi ja kasutab neid otseseks, tokenipõhiseks optimeerimiseks.

Tulemustepõhise tugevdusõppe (RL) põhiprobleem interaktiivsete agentide puhul seisneb hõredas trajektooritasandi tasus: see annab piiratud suunist mitmekäigulise dialoogi, tööriista kasutamise või keskkonnaga suhtlemise üksikute vahesammude jaoks. See tekitab järelevalvelõhe kogu episoodi üldise õnnestumise ja mudeli tokenhaaval toimuva õppeprotsessi vahel.

SEED (Self-Evolving On-Policy Distillation) lahendab selle probleemi iseevolveeruva disaini abil: mudel analüüsib kõigepealt oma lõpetatud trajektoore, et eraldada loomulikus keeles oskusi – korduvkasutatavaid töövooge, olulisi tähelepanekuid või vigade vältimise reegleid. Treeningu ajal kogub sama poliitika (policy) samaaegselt uusi trajektoore ja toimib ise nende andmete analüsaatorina. See võimaldab tihedat seost: poliitika värskendused parandavad nii järgnevaid otsuseid kui ka oskuste eraldamist ennast, samal ajal kui tagantjärele-järelevalve areneb koos muutuva poliitikaga.

Teises etapis hindab lähenemine juhitud tegevusi ümber nii tavapärastes kui ka oskustega täiendatud kontekstides. Sellest tulenev tõenäosusnihe teisendatakse tihedaks, tokenitasandi distillatsioonisignaaliks. Seda signaali optimeeritakse koos tulemustepõhise RL-eesmärgiga, mistõttu täiendav järelevalve püsib kooskõlas hetke trajektooride jaotusega ega hakka triivima vananenud andmejaotuse suunas.

Katsetulemused nii tekstipõhistel kui ka nägemispõhistel agendiülesannetel näitavad järjepidevat paranemist nii tulemuslikkuses kui ka valimitõhususes. Raamistik näitab ka tugevat üldistusvõimet varem nägemata stsenaariumide korral. Lähtekood on saadaval GitHubis.


Allikas: arxiv.org · Avaldatud 15. juulil 2026
Lumi AI News — tehisintellekti abil kureeritud vastavalt tehisintellektimääruse artiklile 50. Parafraseerimine ja klassifitseerimine Lumi News Pipeline v1.7.3 abil.

Share on: