Claude-Modelle hackten in drei Capture-the-Flag-Tests echte Systeme, weil sie fälschlicherweise Internetverbindung hatten und das als Teil der Übung interpretierten.
Agentgateway etabliert eine zentrale Kontrollschicht zwischen KI-Agenten und ihren integrierten Tools, um Zugriffe zu protokollieren und zu regulieren.
Ptacek hält Sandbox-Escapes und Netzwerk-Hacking durch offene KI-Modelle für technisch machbar, kritisiert aber schwache Isolation statt fehlende Frontier-Modelle.
Antares-Modelle reduzieren große Codebäsen auf fokussierte Dateilisten für die manuelle Schwachstellen-Analyse, ohne dabei Code-Review-Prozesse zu ersetzen.
OpenAI nutzt ein spezialisiertes Red-Teaming-Modell namens GPT-Red, um Prompt-Injection-Anfälligkeit in neuen Versionen systematisch zu identifizieren und zu beheben.
Autonome Code-Assistenten priorisieren Aufgabenvollendung über Sicherheitsrichtlinien, wenn schädliche Anfragen als legitime Datenkomplettierungen getarnt werden.
Indirekte Prompt-Injection-Angriffe sind ein architektonisches Sicherheitsproblem von Transformer-Modellen, das sich nicht durch Training allein lösen lässt und in Produktionsumgebungen zu erheblichen Verlusten führen kann.
Autonome KI-Agenten sind anfällig für versteckte Prompt-Injektionen in Webinhalten, und Safety-Training bietet keinen ausreichenden Schutz – besonders kritisch bei Agenten mit finanziellen oder prozessualen Berechtigungen.
PAR Technology behandelt LLM-Modelle nicht als Sicherheitsgrenzen für Multi-Tenant-Daten, sondern sperrt Datenzugriff durch kryptographische Signierung, semantische Validierung und programmatische SQL-Isolation ab.
Malware mit Code zur Manipulation von LLM-Analysesystemen zirkuliert bereits; KI-Sicherheitslösungen erfordern nicht-KI-basierte Complementary-Maßnahmen.