Zum Inhalt springen

OpenAI entwickelt GPT-Red für automatisiertes Red-Teaming gegen Prompt Injections

Auf den Punkt: GPT-Red erkennt indirekte Prompt Injections mit 84 Prozent Erfolgsquote — deutlich höher als die 13 Prozent menschlicher Experten — und trägt zur Entwicklung sichererer Modellgenerationen bei.

OpenAI hat ein spezialisiertes KI-Modell namens GPT-Red veröffentlicht, das automatisiert Sicherheitslücken durch Prompt Injections und Angriffe auf die Instruktionshierarchie aufspürt. Das System simuliert gezielt neue Angriffsvarianten, um KI-Modelle vor ihrer Veröffentlichung robuster zu machen.

OpenAI setzt GPT-Red in einer kontrollierten Trainingsschleife als automatisiertes Angriffsmodell ein. Das System identifiziert zunächst Schwachstellen in zu prüfenden Modellen. Sobald diese bestehende Angriffsmuster erfolgreich blockieren, generiert GPT-Red gezielt neue, komplexere Varianten von Prompt Injections und Hierarchie-Angriffen. Die so generierten Angriffsdaten fließen direkt in das Training und die Sicherheitsvalidierung robusterer Modellgenerationen ein.

In internen Tests zu indirekten Prompt Injections erreichte GPT-Red eine Erfolgsquote von 84 Prozent bei der Aufdeckung von Sicherheitslücken. Zum Vergleich: Menschliche Sicherheitsexperten identifizierten in denselben Szenarien nur 13 Prozent der Lücken. Die durch GPT-Red generierten Angriffsmuster wurden unter anderem für die Entwicklung von GPT-5.6 Sol verwendet. Bei direkten Prompt Injections wies GPT-5.6 Sol in den anspruchsvollsten internen Testverfahren sechsmal weniger erfolgreiche Manipulationen auf als das stärkste Produktionsmodell vier Monate zuvor.

Der Bedarf für solche Sicherheitswerkzeuge wächst mit der Integration autonomer KI-Agenten in Produktivumgebungen. Diese Systeme können eigenständig auf Webbrowser, Anwendungen, E-Mails und lokale Dateien zugreifen — die potenzielle Angriffsfläche für manipulierte Befehle vergrößert sich dadurch erheblich. OpenAI betrachtet GPT-Red als Skalierungsinstrument zur Erhöhung von Umfang und Schwierigkeitsgrad der Sicherheitstests und setzt es als Ergänzung zu manuellen Überprüfungen durch externe Experten, mehrstufigen Sicherheitsbarrieren, Überwachungssystemen und Schwachstellen-Offenlegungsprogrammen ein.


Quelle: www.it-daily.net · Erschienen 17. Juli 2026
Lumi AI News — KI-assistierte Kuratierung gemaess Art. 50 EU AI Act. Paraphrase und Klassifikation durch Lumi News Pipeline v1.7.3.

Share on: