Bebop: Rejection Sampling verbessert Multi-Token-Prediction in RL-Training11. Juni 20264. Juli 2026AI ModelsBebop nutzt Rejection Sampling und TV-Loss-Optimierung, um MTP-Akzeptanzraten in RL-Training stabil zu halten und Rollouts um bis zu 1,8-fach zu beschleunigen. Share on: