SLPO: Outcome-Reward-Training für latente Reasoner ohne Token-Dekodierung23. Juli 202624. Juli 2026AI ModelsSurrogate Latent Policy Optimization ermöglicht effizientes Outcome-Reward-Training für latente Reasoner, die kontinuierliche Vektoren statt Tokens für Zwischenschritte verwenden. Share on: