Kokkuvõtvalt: Direct-OPD kannab RL-põhised poliitikanihked nõrgematelt mudelitelt tugevamatele üle, muutes kasutatavaks kaudse tasusignaali, mis tuleneb RL-nihutatud ja algse poliitika log-suhtest.
Suurte keelemudelite treenimine tugevdusõppe (reinforcement learning, RL) abil on arvutusmahukas. Uus meetod nimega Direct On-Policy Distillation (Direct-OPD) võimaldab kanda väiksematel mudelitel saavutatud RL-põhise arengu üle võimekamatele mudelitele — ilma et tuleks kordama kulukaid RL-treeningtsükleid suurema mudeliga.
Probleem seisneb selles, et kontrollitavate tasudega tugevdusõpe (RLVR) parandab keelemudelite arutlusvõimet, kuid muutub suuremate mudelite puhul üha kulukamaks — põhjuseks on treeningu käigus vajaminev suur hulk rollout’e. Iga uus, võimekam mudel nõuab eraldi kulukat RL-treeningut.
Direct-OPD lahendab selle probleemi nõrgalt-tugevale (weak-to-strong) lähenemisega: RL-treening ei toimu otse suure mudeliga, vaid viiakse esmalt läbi väiksemal mudelil (mis on oluliselt odavam). Seejärel õpitakse, kuidas see väike mudel muutus. Keskne mehhanism seisneb selles, et võrreldakse väikese mudeli RL-treenitud poliitikat selle RL-eelse versiooniga. Nende kahe kontrollpunkti log-suhet (log-ratio) kasutatakse tugevama õpilasmudeli jaoks tiheda kaudse tasusignaalina. Konkreetselt näitab kontrollpunktide paar, milliseid tegevusi RL-treening muutis tõenäolisemaks ja milliseid vähem tõenäoliseks. See teave kantakse seejärel üle suurema mudeli on-policy olekutele.
Empiirilised tulemused näitavad: Direct-OPD parandab Qwen3-1.7B tulemust AIME 2024 testis 48,3%-lt 58,3%-ni 4 tunniga, kasutades 8 A100 GPU-d — see on 10-protsendipunktine hüpe ilma otsese RL-treeninguta suurel mudelil. Meetod ületab sama treeningsammude arvuga otsest RL-treeningut ja võimaldab mitme poliitikanihke järjestikust ühendamist.
Inseneride jaoks tähendab see, et RL-treeningust saadud teadmisi saab kaudsete tasusignaalidena taaskasutada üle erinevate mudelisuuruste, mitte ainult lõplike mudelitena imiteerimiseks. See vähendab oluliselt suuremate mudelite järeltreeningu (post-training) arvutuskulusid ja avab uusi optimeerimisstrateegiaid järelduse (inference) skaleerimiseks.
Allikas: arxiv.org · Avaldatud 7. juulil 2026
Lumi AI News — tehisintellekti abil kureeritud vastavalt tehisintellektimääruse artiklile 50. Parafraseerimine ja klassifitseerimine Lumi News Pipeline v1.7.3 abil.