Zum Inhalt springen

Sicherheits-KI-Agenten: Kosten-Nutzen-Bewertung statt nur Erfolgsquoten

Auf den Punkt: Sicherheits-Agenten sollten an operativen Kosten bewertet werden, nicht nur an Erfolgsquoten — offensive und defensive Aufgaben skalieren dabei völlig unterschiedlich.

Forscher haben ein neues Bewertungsmodell für offensive und defensive Sicherheits-Agenten entwickelt, das nicht nur Erfolgsraten, sondern auch operative Kosten berücksichtigt. Ihre Erkenntnisse zeigen fundamental unterschiedliche Skalierungsverhalten zwischen Angriffs- und Abwehraufgaben.

Klassische Evaluationen von Sicherheits-KI-Agenten konzentrieren sich auf die maximale Leistung unter großzügigen Inferenz-Budgets: Schwachstellenentdeckung, Exploit-Entwicklung, Penetrationstests und CTF-Wettbewerbe. Dieses Bild ist unvollständig, weil in der operativen Realität jeder Reasoning-Schritt, jeder Tool-Aufruf, jede Telemetrie-Anfrage und jede Enrichment-Anfrage Kosten verursacht.

Die Studie evaluiert Language-Model-basierte Sicherheits-Agenten mit diesem Kosten-Erfolgs-Blick: auf offensive Cybench-Challenges und defensive Splunk-BOTS-v1-Untersuchungen. Statt nur Best-Case-Erfolge zu berichten, vergleichen die Forscher Modelle bei festen Kostenbudgets und schlüsseln die Performance nach Inference- und Tool-Ausgaben auf.

Die Ergebnisse zeigen unterschiedliche Skalierungsregime für Red- und Blue-Team-Aufgaben. Bei offensive CTF-Performance verbessert sich die Leistung mit zusätzlicher Rechenkapazität, und skalierte Open-Weight-Modelle können an Grenzmodelle heranreichen, während sie kostenkonkurrenzfähig bleiben. Defensive SOC-Untersuchungen verhalten sich anders: Der Erfolg hängt stärker von diszipliniertem Tool-Einsatz, gezielter Telemetrie-Navigation und selektiven Enrichment-Anfragen ab als vom reinen Reasoning-Budget allein.

Die Forscher argumentieren, dass Sicherheits-Agent-Benchmarks neben der Aufgabenerledigung auch ökonomische Effizienz und operative Passfähigkeit messen sollten. Cost-bewusste, SOC-native Evaluationen zeigen klarer, welche Modelle heute praktisch nutzbar sind und wo defensive Agenten noch verbessert werden müssen. Die vollständigen Ergebnisse stehen unter https://evals.frontier.security zur Verfügung.


Quelle: arxiv.org · Erschienen 16. Juli 2026
Lumi AI News — KI-assistierte Kuratierung gemaess Art. 50 EU AI Act. Paraphrase und Klassifikation durch Lumi News Pipeline v1.7.3.

Share on: