Skip to content

Turbe-tehisintellektiagendid: kulude-tulude hindamine, mitte üksnes õnnestumismäär

Lühidalt: Turbeagente tuleks hinnata tegevuskulude, mitte ainult õnnestumismäära alusel — ründe- ja kaitseülesanded skaleeruvad seejuures täiesti erinevalt.

Teadlased on välja töötanud uue hindamismudeli ründavatele ja kaitsvatele turbeagentidele, mis võtab arvesse mitte üksnes õnnestumismäära, vaid ka tegevuskulusid. Nende tulemused näitavad, et ründe- ja kaitseülesannete skaleerumiskäitumine on põhimõtteliselt erinev.

Turbe-tehisintellektiagentide klassikalised hindamised keskenduvad maksimaalsele jõudlusele suurte järeldusarvutuse eelarvete juures: haavatavuste tuvastamine, rünnete arendamine, läbitungimistestid ja CTF-võistlused. See pilt on puudulik, sest tegelikus töökeskkonnas tekitab kulu igasugune arutlussamm, tööriistakutse, telemeetriapäring ja rikastuspäring.

Uuring hindab keelemudelitel põhinevaid turbeagente just sellisest kulu-tulu vaatenurgast: ründavatel Cybenchi väljakutsetel ja kaitsvatel Splunk BOTS v1 juurdlusülesannetel. Selle asemel, et esitada üksnes parimal juhul saavutatud tulemusi, võrdlevad teadlased mudeleid kindlate kulueelarvete juures ja jagavad jõudluse järelduskulude ja tööriistakulude vahel lahti.

Tulemused näitavad, et punase ja sinise meeskonna ülesannetel on erinev skaleerumisrežiim. Ründavate CTF-ülesannete puhul jõudlus paraneb koos suurema arvutusvõimsusega, ja skaleeritud avatud kaaludega mudelid võivad juhtivatele mudelitele järele jõuda, jäädes samal ajal kulude poolest konkurentsivõimeliseks. Kaitsvad SOC-juurdlused käituvad teisiti: õnnestumine sõltub rohkem distsiplineeritud tööriistade kasutamisest, sihipärasest telemeetrianavigeerimisest ja selektiivsetest rikastuspäringutest kui puhtalt arutlusressursi mahust.

Teadlased väidavad, et turbeagentide võrdlusalused peaksid mõõtma ülesande täitmise kõrval ka majanduslikku efektiivsust ja tegevusvõimekuse sobivust. Kulutundlikud, SOC-põhised hindamised näitavad selgemalt, milliseid mudeleid on praegu praktikas võimalik kasutada ja kus kaitsvad agendid veel arendamist vajavad. Täielikud tulemused on kättesaadavad aadressil https://evals.frontier.security.


Allikas: arxiv.org · Avaldatud 16. juulil 2026
Lumi AI News — tehisintellekti abil kureeritud vastavalt tehisintellektimääruse artiklile 50. Parafraseerimine ja klassifitseerimine Lumi News Pipeline v1.7.3 abil.

Share on: