SLPO: Outcome-Reward-Training für latente Reasoner ohne Token-Dekodierung23. Juli 202624. Juli 2026AI ModelsSurrogate Latent Policy Optimization ermöglicht effizientes Outcome-Reward-Training für latente Reasoner, die kontinuierliche Vektoren statt Tokens für Zwischenschritte verwenden. Share on:
Geometric Latent Reasoning verkürzt Generierung in großen Sprachmodellen2. Juni 20264. Juli 2026AI ModelsGeometric Latent Reasoning approximiert diskrete Denkschritte als kontinuierliche Pfade im Embedding-Raum und erzielt damit kürzere Generierungen bei gleichbleibender oder besserer Genauigkeit. Share on: