SLPO: Outcome-Reward Training for Latent Reasoners Without Token Decoding24. July 2026AI ModelsSurrogate Latent Policy Optimization enables efficient outcome-reward training for latent reasoners that use continuous vectors instead of tokens for intermediate steps. Share on: