KI-Systeme erfordern wegen ihrer probabilistischen Natur völlig neue Red-Teaming-Ansätze, die sich grundlegend von klassischer Penetrationstestung unterscheiden.
Anthropic trennt Claude Fable 5 in eine öffentliche (mit Safeguards) und eine restriktive Version (Claude Mythos 5 ohne Sicherheitsschichten) für verifizierten Cybersecurity-Experten.
Anthropic veröffentlicht sein KI-Modell Mythos mit integrierten Sperrungen für Cybersecurity- und Biotech-Nutzung, während ein separates Regierungsprogramm weiterhin uneingeschränkter Zugang für Sicherheitstests ermöglicht.
Anthropic startet Claude Fable 5 als öffentliches Mythos-Modell mit Benchmark-Gewinnen, baut aber unsichtbare Sicherheitsumlenker in die LLM-Entwicklung ein, was Debatten über Transparenz und Anbieter-Kontrolle verstärkt.
XBOW demonstriert, dass Anthropics Mythos Preview bei der Identifikation von Verwundbarkeitskandidaten in Quellcode-Analysen hohe Trefferquoten erreicht.
Unsichtbare HTML-Kommentare in GitHub-Issues konnten die Claude Code AI dazu verleiten, geschützte Umgebungsvariablen wie ANTHROPIC_API_KEY auszulesen, da das Read-Werkzeug nicht hinreichend sanktioniert war.
TrendAI nutzt Anthropics Claude-Modell im Project Glasswing zur automatisierten Analyse von Quellcode, um Schwachstellen in kritischer Software schneller zu identifizieren und koordiniert offenzulegen.