Lühidalt: Skill Self-Play ühendab ülesannete genereerimise, lahenduste otsimise ja dünaamilise oskuskontrolli üheks tugevdusõppe tsükliks, et saavutada nii ülesannete mitmekesisus kui ka treeningu usaldusväärsus.
Teadlased tutvustavad raamistikku nimega Skill Self-Play, mis treenib LLM-e enesemänguga dünaamiliste oskuste abil — ilma käsitsi tehtud annotatsioonideta ja usaldusväärse tagasisidega.
Senine dilemma interaktiivses LLM-treeningus on olnud järgmine: keskkonnapõhised meetodid annavad usaldusväärset tagasisidet, kuid piiravad õppimise kitsastele valdkondadele. Avatud ülesannete genereerimine võimaldab laiemaid õppe-eesmärke, kuid on raskesti kontrollitav ning laseb treeningusse sisse vigaseid signaale. Skill Self-Play lahendab selle vastuolu, tuues sisse oskused (skills) kui kesksed vahekihid: iga oskus tagab põhjaliku ja kontrollitava käitumise konkreetses stsenaariumis, samas kui dünaamiline suunamine mitme oskuse vahel säilitab avatud ülesannete mitmekesisuse.
Raamistik orkestreerib tugevdusõppe tsüklis kolme ko-evolutsioonilist komponenti: Proposer genereerib keerulisi ülesandeid dünaamiliselt valitud oskuste põhjal. Solver uurib võimalikke lahendusi ja laiendab oma võimeid. Skill Controller kogub täitmise tagasisidet ning uuendab pidevalt oskuste kogumikku. See vastastikmõju ületab lõhe struktureeritud kontrolli ja avatud uurimise vahel.
Empiirilised testid tööriistakasutuse ja arutlusvõime (reasoning) võrdlusalustel näitavad, et Skill Self-Play evolutsioonimootorina tõstab järjekindlalt olemasolevate mudelite jõudlust. Ka algselt nõrgalt treenitud mudelid teevad läbi märkimisväärse jõudlushüppe. Kood on kättesaadav aadressil https://github.com/Qwen-Applications/skill-self-play.
Allikas: arxiv.org · Avaldatud 23. juuli 2026
Lumi AI News — tehisintellekti abil kureeritud vastavalt tehisintellektimääruse artiklile 50. Parafraseerimine ja klassifitseerimine Lumi News Pipeline v1.7.3 abil.