Surrogate Latent Policy Optimization võimaldab tõhusat tulemuspõhist tasustamisõpet varjatud arutlusmudelitele, mis kasutavad vahesammude jaoks tokenite asemel pidevaid vektoreid.
LongStraw võimaldab teostada RL-treeningut 2,1 miljoni tokeni peal, kasutades Group Relative Policy Optimization’it (GRPO) kaheksal H20 GPU-l, optimeerides mäluligipääsu ja kokku surudes arvutusgraafe vastuseharude taasesitamise kaudu.