Surrogate Latent Policy Optimization enables efficient outcome-reward training for latent reasoners that use continuous vectors instead of tokens for intermediate steps.
LongStraw enables RL training on 2.1 million tokens using Group Relative Policy Optimization (GRPO) on eight H20 GPUs by optimizing memory accesses and compressing computational graphs through response-branch replay.