SLPO: tulemuspõhine tasustamisõpe varjatud arutlusmudelitele ilma tokeniteta dekodeerimiseta24. juuli 2026Tehisintellekti mudelidSurrogate Latent Policy Optimization võimaldab tõhusat tulemuspõhist tasustamisõpet varjatud arutlusmudelitele, mis kasutavad vahesammude jaoks tokenite asemel pidevaid vektoreid. Share on: