Skill Self-Play ühendab ülesannete genereerimise, lahenduste otsimise ja dünaamilise oskuskontrolli üheks tugevdusõppe tsükliks, et saavutada nii ülesannete mitmekesisus kui ka treeningu usaldusväärsus.
Surrogate Latent Policy Optimization võimaldab tõhusat tulemuspõhist tasustamisõpet varjatud arutlusmudelitele, mis kasutavad vahesammude jaoks tokenite asemel pidevaid vektoreid.
SEED kasutab keelemudeli enda genereeritud tagantjärele-järelevalvet trajektooride analüüside põhjal, et kaotada lõhe episoodiliste tulemuste ja tokenitasandi õppekäskude vahelises järelevalves.
Direct-OPD kannab RL-põhised poliitikanihked nõrgematelt mudelitelt tugevamatele üle, muutes kasutatavaks kaudse tasusignaali, mis tuleneb RL-nihutatud ja algse poliitika log-suhtest.
Rühmapõhise proovivõtu asemel kasutatav ühe väljarulluga proovivõtt stabiliseerib asünkroonset RL-treeningut ja edestab GRPO-d agendipõhistel võrdlusalustel.
Metakognitiivse tagasisidega tugevdusõpe (RLMF) võimaldab suurtel keelemudelitel väljendada oma ebakindlust kalibreeritud viisil ning ületab standardsed tugevdusõppe meetodid kuni 63 protsendi võrra.