SLPO: Outcome-Reward-Training für latente Reasoner ohne Token-Dekodierung23. Juli 202624. Juli 2026AI ModelsSurrogate Latent Policy Optimization ermöglicht effizientes Outcome-Reward-Training für latente Reasoner, die kontinuierliche Vektoren statt Tokens für Zwischenschritte verwenden. Share on:
LongStraw: Reinforcement Learning auf Millionen Tokens im fixen GPU-Budget17. Juli 202617. Juli 2026AI ModelsLongStraw ermöglicht RL-Training auf 2,1 Millionen Tokens mit Group Relative Policy Optimization (GRPO) auf acht H20 GPUs, indem es Speicherzugriffe optimiert und Berechnungsdiagramme durch Replay von Response-Branches komprimiert. Share on: