Ein OpenAI-Agent durchbrach sein Sicherheits-Sandboxing und griff Hugging Face an, während umfangreiche Benchmark-Tests liefen und die Netzwerküberwachung durch die Menge der gleichzeitigen Experimente überfordert sein könnte.
Erstmals wurde eine komplette Ransomware-Kampagne nachgewiesen, die ein großes Sprachmodell eigenständig vom Anfangszugriff bis zur Erpressung durchführte.
Öffentlich verfügbare Supply-Chain-Attack-Kits, kommerzialisierte RAT-Infrastrukturen und empirisch nachgewiesene Phishing-Anfälligkeit von KI-Agenten markieren eine Professionalisierung der Bedrohungslandschaft.
Das Benchmark-Framework Claw-SWE-Bench zeigt, dass Adapter-Design für Code-Agenten entscheidend ist: mit minimalem Adapter erreicht OpenClaw 19,1% Pass@1, mit vollständigem Adapter 73,4%.