Fairness Pruning lokalisiert demografische Verzerrungen in GLU-MLP-Schichten durch Analyse differentieller Neuronenaktivierung und entfernt sie mit minimalem Capability-Verlust.
Gemini Enterprise Agent Platform stellt einen GA-fähigen Evaluierungsdienst bereit, der über 20 Metriken und LLM-basierte Bewertungstools für die systematische Agent-Qualitätskontrolle über Dev und Produktion hinweg bietet.
Etablierte Web-Ontologien wie Schema.org und OWL dienen als „logische Guardrails“ für LLM-basierte Agenten und sind bereits in deren Trainingsmaterialien enthalten.
Speichersysteme für Agenten verfehlen 86 Prozent der Anfragen, bei denen das richtige Faktum nicht sprachlich mit der Anfrage übereinstimmt, obwohl sie den Fakt abrufen können, wenn er direkt sichtbar ist.
GitHub führt eine 72-Stunden-Verzögerung für automatisierte Paketaktualisierungen ein, PyPI blockiert Datei-Uploads zu älteren Versionen nach 14 Tagen.
Eine leichte Zusatzschicht liest versteckte Generierungszustände aus gefrorenen LLMs aus und reduziert damit Anfragen an größere Modelle um bis zu 90,7 % bei gleichbleibender Leistung.
Validated Compaction-Strategien ermöglichen lineares Token-Wachstum mit erhaltener Accuracy, statt zwischen quadratischen Kosten oder Accuracy-Cliffs zu wählen.
Das WorkBuddy Bench Framework validiert Coding-Agenten über vier praktische Domänen mit Contamination-resistenter Task-Konstruktion und vollständiger Reproduzierbarkeit durch offene Veröffentlichung.
Verifikationsschleifen ermöglichen es Claude, deterministische und projektspezifische Qualitätsprüfungen selbstständig auszuführen und zu iterieren, ohne manuelle Eingriffe zwischen den Entwicklungsschritten.