Bebop: Rejection Sampling Improves Multi-Token Prediction in RL Training11. June 20264. July 2026AI ModelsBebop uses rejection sampling and TV loss optimization to maintain stable MTP acceptance rates during RL training and accelerates rollouts by up to 1.8x. Share on: