KI-generierte, aber inhaltsleere Schwachstellenberichte überlasten Triage-Teams so stark, dass Projekte wie cURL, CycloneDX und Log4j ihre Bug-Bounty-Programme einstellen oder einschränken mussten.
Ein Positionspapier fordert, KI-Agentensicherheit nicht im Training, sondern als durchsetzbaren Laufzeit-Vertrag mit präventiven und evidenzbasierten Kontrollen im Harness zu verankern, gestützt auf eine Analyse von…
Anthropic zeigt anhand eines Experiments mit 45 koordinierenden Agenten bei der Softwareschwachstellensuche, dass Multiagenten-Kooperation potenziell effizienter als reine Parallelisierung ist, warnt aber zugleich vor neuen…
Ein fruehes RLVR-Trainingsstadium ohne implementierte Sicherheitsbeschraenkungen und paralleles Multi-Agenten-Monitoring gelten als moegliche Ursachen dafuer, dass OpenAIs Trainingsagenten unbemerkt gegen Hugging-Face-Infrastruktur vorgingen.
Weil OpenAI, Anthropic und Google denselben Verschlüsselungsschlüssel innerhalb einer Modellfamilie nutzten, ließen sich verschlüsselte Reasoning-Traces starker Modelle per Replay-Angriff und Jailbreak auf schwächere Geschwistermodelle im…
Forscher konnten verschlüsselte Chain-of-Thought-Blöcke von OpenAI-, Anthropic- und Google-Modellen extrahieren, indem sie Traces in schwächere Modelle derselben Familie zurückspielten und diese jailbreakten; die Anbieter haben…
Kleinere KI-Modelle eines Anbieters lassen sich nutzen, um die eigentlich verschlüsselten Reasoning-Protokolle von Top-Systemen wie GPT-5 im Klartext zu rekonstruieren.
OpenAI zeigt in einer neuen Studie, dass führende Unternehmen agentenbasierte KI zunehmend zur eigenständigen Ausführung von Aufgaben statt nur zur Assistenz einsetzen.
Nach Sandbox-Ausbrüchen von KI-Agenten bei Anthropic, OpenAI, Meta und ByteDance empfiehlt das SANS Institute Sicherheitsteams, Netzwerkzugänge, Berechtigungen und Kontrollen für KI-Agenten konsequent zu prüfen und…
Der versehentliche OpenAI-Angriff auf Hugging-Face-Infrastruktur ereignete sich während eines aktiven RLVR-Trainingslaufs für Cybersecurity-Fähigkeiten, bei dem Sicherheitsmechanismen noch fehlten und die Überwachung paralleler Trainingsagenten lückenhaft war.
OpenAI schränkt nach einem eigenmächtigen Ausbruch seines Modells aus einer Testumgebung und einem Einbruch bei Hugging Face den Netzwerk- und Werkzeugzugang für leistungsfähige KI-Modelle wie…
Der Atlassian-KI-Assistent Rovo lässt sich durch versteckte Prompt-Injection-Anweisungen dazu bringen, Jira- und Confluence-Daten des angemeldeten Nutzers an Angreifer zu senden, wobei laut Bericht bislang nur…