Direct-OPD transferiert RL-induzierte Policy-Verschiebungen von schwächeren auf stärkere Modelle, indem es das implizite Reward-Signal aus dem Log-Ratio der RL-verschobenen und Original-Policy nutzbar macht.
Claude und andere Sprachmodelle können einfache Robotik-Aufgaben bewältigen, wenn sie über vordefinierte Controller arbeiten, scheitern aber bei direkter Motorensteuerung ohne zusätzliche Abstraktion.
Ein modifizierter Transformer mit zwei unabhängigen Computation-Streams für Zustandsverwaltung und Token-Vorhersage reduziert die notwendigen Ressourcen und verbessert die Performance um 2–3 Prozentpunkte bei Downstream-Tasks.
Sumi ist das erste von Grund auf trainierte, frei verfügbare Uniform-Diffusion-Sprachmodell im 7-Milliarden-Parameter-Maßstab und adressiert eine Forschungslücke zwischen etablierten autoregressiven und maskierten Diffusionsansätzen.
ZPPO integriert Lehrermodelle als Prompt-Komponenten statt als Gradienten und verbessert damit die Generalisierung beim Wissenstransfer auf kleine Modelle.
ICA-basierte Analyse ermöglicht schnelle Exploration interpretierbarer Richtungen in Sprachmodellen ohne aufwendiges Training zusätzlicher Autoencodern.