Auf den Punkt: Looped Transformers mit MoE-Architektur erzielen bei konstanten Trainings-Ressourcen bessere Ergebnisse als größere Vanilla-Modelle.
Loopie ist eine neue Serie von Mixture-of-Experts-Transformern, die durch Wiederholung (Looping) statt Parameter-Vergrößerung bei gleicher Rechenleistung bessere Ergebnisse erreicht als Baseline-Modelle. Die beiden Varianten mit 20B und 6B Parametern zeigen Goldmedaillen-Performance bei Mathematik-Olympiaden.
Loopie besteht aus zwei Mixture-of-Experts-Modellen: ein 20B-Parameter-Modell mit 2B aktiven Parametern und ein 6B-Parameter-Modell mit 0,6B aktiven Parametern. Der zentrale technische Fortschritt adressiert ein lange bestehendes Problem looped Transformer-Architekturen: Bei einer N-fachen Erhöhung der Trainingsrechenleistung übertrifft das N-fache Vergrößerung der Parameterzahl bisher das N-malige Looping eines kleineren Modells.
Die Ablation-Studien, einschließlich direkter Vergleiche mit einem 30B-Vanilla-Modell mit 3B aktiven Parametern, zeigen, dass Loopie diese Baseline unter identischem Rechenbudget substanziell übertrifft. Das bedeutet für Engineerings-Teams: Mit derselben Trainingsleistung lässt sich eine effektivere Architektur erreichen, statt nur die Modellgröße zu skalieren.
Loopie ist mit einer neuartigen Post-Training-Pipeline ausgestattet, die starke Reasoning-Fähigkeiten ermöglicht. Bei den Internationalen Mathematik-Olympiaden (IMO) und Physik-Olympiaden (IPhO) 2025 erreichte Loopie Goldmedaillen-Performance ohne externe Tools. Dies deutet auf verbesserte Fähigkeiten im strukturierten logischen Denken hin, die über das Standard-Sprachmodell-Training hinausgehen.
Quelle: arxiv.org · Erschienen 16. Juli 2026
Lumi AI News — KI-assistierte Kuratierung gemaess Art. 50 EU AI Act. Paraphrase und Klassifikation durch Lumi News Pipeline v1.7.3.