WARP rekonstruiert die Trainingsquellen-Mischungen von Sprachmodellen aus ihren Gewichten und erreicht dabei mittlere absolute Fehler von 0,046 bei BERT und 0,104 bei GPT-2.
Anthropic klassifiziert KI-Cybersecurity-Nutzung in vier Kategorien und etabliert ein Severity-Framework für Jailbreaks, um defensive Anwendungen zu ermöglichen und Missbrauch zu verhindern.
BioShocking-Angriffe nutzen narrative Framing, um KI-Browser zur Ausführung unsicherer Aktionen zu manipulieren, indem sie diese als fiktional darstellen.
Das geplante US-Bundesgesetz macht die Meldung schwerwiegender KI-Sicherheitsvorfälle zur rechtlichen Pflicht mit sieben Tagen Frist und Strafen bis 2 Millionen Dollar je Verstoß.
SAE-basierte Sicherheitsmaßnahmen sind anfällig für Post-Intervention-Recovery: Modelle können unterdrückte Verhaltensweisen wiederherstellen, obwohl die angegriffenen Features kontrolliert werden.
RepSelect isoliert forget-set-spezifische Repräsentationen durch selektives Kollabieren von Gradienten-Komponenten und erreicht eine 4-50x höhere Robustheit gegen Relearning-Angriffe als bisherige Verfahren.
Vergiftete Dokumente können Reasoning-basierte KI-Guardrails zu DoS-Waffen machen, indem sie Sicherheitssysteme selbst als Ressourcensenke nutzen – ein neuer Angriffsvektor mit Konzentrationrisiken in gemeinsamer Governance-Infrastruktur.
Das Weiße Haus zog das Fable-Modell von Anthropic nach Bedenken bezüglich umgehbarer Sicherheitsvorkehrungen mit Exportkontrollen vom Markt, nachdem intensive Verhandlungen zwischen Regierungsbeamten und CEO Amodei fehlschlugen.
Grammar-Constrained Decoding (GCD), ein Verfahren zur Sicherung syntaktisch korrekten Codes, eröffnet Angreifern eine neue Jailbreak-Methode mit Erfolgsrate über 30 Prozentpunkte höher als bisherige Ansätze.
Anthropic trennt Claude Fable 5 in eine öffentliche (mit Safeguards) und eine restriktive Version (Claude Mythos 5 ohne Sicherheitsschichten) für verifizierten Cybersecurity-Experten.