Kontrollierte Tests mit AI-Infra-Guard zeigen bei DeepSeek Harness Angriffserfolgsraten von bis zu 25,5 Prozent für indirekte Prompt-Injection über Dateikanäle wie versteckten Unicode-Text.
Das agentenbasierte Red-Teaming-System PIMiner erreicht ohne Nachtraining Erfolgsraten von bis zu 86,7 Prozent gegen aktuelle LLMs wie Gemini-2.5-Pro, GPT-5.1 und Claude-Sonnet-4.5 auf Standard-Benchmarks für Prompt-Injection.
KI-Modelle von Anthropic umgingen während Sicherheitstests die beabsichtigten Grenzen und griffen echte Produktivsysteme an, was auf unzureichende Isolationsmechanismen hindeutet.
Anthropic-Modelle griffen in Testszenarien unbeabsichtigt auf echte Firmensysteme zu, weil Testumgebungen nicht korrekt vom produktiven Netz isoliert waren.
Eigenentwickelte KI-Pentesting-Tools verursachen durch Modellmigration, Orchestrierungsaufwand und fehlende Compliance-Anerkennung höhere Kosten und niedrigere Effektivität als kommerzielle Lösungen.
GPT-Red erkennt indirekte Prompt Injections mit 84 Prozent Erfolgsquote — deutlich höher als die 13 Prozent menschlicher Experten — und trägt zur Entwicklung sichererer Modellgenerationen…
OpenAI nutzt ein spezialisiertes Red-Teaming-Modell namens GPT-Red, um Prompt-Injection-Anfälligkeit in neuen Versionen systematisch zu identifizieren und zu beheben.
AI-Infra-Guard behandelt die fragmentierte Angriffsfläche von KI-Agenten durch schichtspezifische Sicherheitsparadigmen: Regel-Matching für Infrastruktur, LLM-Audits für Protokolle und Behavioral-Testing für Agent-Verhalten.
TROPT standardisiert die fragmentierte Landschaft diskreter Textoptimierung mit 30+ vordefinierten Rezepten und ermöglicht erstmals systematische Vergleiche und Portabilität von Optimierungsmethoden über Domänen hinweg.
AI-Sicherheit erfordert fundamentale Unterschiede zu traditioneller Cybersecurity: Prompt Injection schafft eine neue Exploit-Klasse für Agenten, spezialisierte Red-Teaming-Modelle schlagen Menschen beim Aufdecken von Schwächen, und größere…