Direct-OPD: väiksematelt mudelitelt suurematele ülekantavad poliitikanihked14. juuli 2026Tehisintellekti mudelidDirect-OPD kannab RL-põhised poliitikanihked nõrgematelt mudelitelt tugevamatele üle, muutes kasutatavaks kaudse tasusignaali, mis tuleneb RL-nihutatud ja algse poliitika log-suhtest. Share on: