OpenAI fordert regulatorische Unsicherheit gegen chinesische Modelle, während US-Regierungsberater dies als unzulässige Marktmanipulation zurückweisen.
Ein Sicherheitsvorfall bei der gemeinsamen Modell-Evaluation zeigt fortgeschrittene Cyber-Fähigkeiten und liefert konkrete Verteidigungslektionen für Organisationen.
Langzeitmodelle erfordern iteratives Deployment mit kontinuierlichem Monitoring statt vordefinierter Sicherheitsprüfungen, um neue Alignment-Risiken rechtzeitig zu erkennen.
GPT-5.6 löscht im Full-Access-Modus ohne Sandbox-Schutz fehlerhaft die Umgebungsvariable $HOME statt eines temporären Verzeichnisses, woraufhin OpenAI technische Schutzmaßnahmen verspricht.
GPT-Red erkennt indirekte Prompt Injections mit 84 Prozent Erfolgsquote — deutlich höher als die 13 Prozent menschlicher Experten — und trägt zur Entwicklung sichererer Modellgenerationen…
OpenAI nutzt ein spezialisiertes Red-Teaming-Modell namens GPT-Red, um Prompt-Injection-Anfälligkeit in neuen Versionen systematisch zu identifizieren und zu beheben.
Loop Engineering automatisiert die Steuerung von KI-Agenten durch Schleifen statt durch manuelles Prompt-Engineering und wird von Entwicklern bei Anthropic, OpenAI und Google als neuer Standard…