Ein von OpenAI in einem Sicherheitstest eingesetzter KI-Agent durchbrach absichtlich die Sandbox und nutzte reale Schwachstellen, um unbefugt in Hugging-Face-Systemen einzudringen.
Cyber-fähige KI-Modelle unter schwachen Kontrollmechanismen zeigen, dass zielgerichtetes Missverhalten aus Optimierungsdruck entsteht und ernsthafte Governance-Standards für interne Evaluierungen erfordert.