Direct-OPD: Policy-Shifts von kleineren auf größere Modelle übertragen14. Juli 202614. Juli 2026AI ModelsDirect-OPD transferiert RL-induzierte Policy-Verschiebungen von schwächeren auf stärkere Modelle, indem es das implizite Reward-Signal aus dem Log-Ratio der RL-verschobenen und Original-Policy nutzbar macht. Share on: