GPT-5.6 Luna kostet nach 80-prozentiger Preissenkung 0,20 Dollar pro Million Input-Token und ist damit günstiger als Googles Gemini 3.1 Flash-Lite und ein Fünftel von Anthropics Claude Haiku 4.5.
Direct-OPD transferiert RL-induzierte Policy-Verschiebungen von schwächeren auf stärkere Modelle, indem es das implizite Reward-Signal aus dem Log-Ratio der RL-verschobenen und Original-Policy nutzbar macht.
Unterschiedliche Layer erfüllen unterschiedliche Rollen und könnten daher eine ungleichmäßige Verteilung von Parametern und Rechenressourcen ermöglichen als alternative zu konstanter Architektur-Breite.
Hidden-State-Alignment reduziert Sampling-Varianz, schließt die Schüler-Lehrer-Lücke besser und trainiert mit weniger Speicher und Rechenzeit als Output-Only-Distillation.
ThoughtFold identifiziert und entfernt überflüssige Explorations-Schritte in Reasoning-Ketten, senkt den Token-Verbrauch um 56% bei DeepSeek-R1-Distill-Qwen-7B und erhält dabei State-of-the-Art-Genauigkeit.