Lühidalt: Struktureeritud hindamisprotokoll, mis kasutab mitut keerukat testkeskkonda ja LLM-põhist haavatavuste tuvastamist, võimaldab tehisintellekti pentestimisagentide senisest realistlikumat hindamist, mis ületab klassikalisi võrdlusstsenaariume.
Teadlased on esitanud uue hindamisprotokolli tehisintellektipõhiste pentestimissüsteemide jaoks, mis mõõdab nende toimivust keerukates reaalsetes ründestsenaariumides, mitte lihtsustatud võrdluskeskkondades. Protokoll võimaldab esmakordselt eri tehisintellekti pentestimisagentide operatiivselt asjakohast võrdlemist.
Senised tehisintellekti pentestimisagentide hindamised on keskendunud kindlaksmääratud sihtkategooriatele, nagu Capture-the-Flag, kaugkoodi käivitamine (Remote Code Execution) või ärakasutuskoodi (exploit) taasesitamine. Need lihtsustatud või kitsalt piiritletud testistsenaariumid näitavad küll piiratud tehnilisi võimeid, kuid ei kajasta tegelike läbistustestide keerukust: avatud uurimist, mitmeid ründepindu, mitmekesiseid haavatavusklasse ja strateegilist otsustamist ebakindluse tingimustes.
Uus hindamismeetod nihutab fookuse pelgalt ülesannete täitmiselt valideeritud haavatavuste tuvastamisele. Protokoll ühendab endas struktureeritud tõeväärtusandmed (ground truth, ekspertide poolt annoteeritud võrdlusteave), LLM-põhised semantilised sobitusmeetodid haavatavuste tuvastamiseks, bipartiitse sobitamise hindamiseks realistlike mitmetähenduslikkuste tingimustes, tõeväärtusandmete pideva ajakohastamise ning stohhastiliste agentide korduva ja kumulatiivse hindamise. Lisaks pakutakse tõhususe mõõdikuid ja optimeeritud testikomplekte, et võimaldada jätkusuutlikke eksperimente.
CISO-de jaoks tähendab see protokoll paremat alust tehisintellektipõhiste pentestimislahenduste hindamiseks enne nende kasutuselevõttu tootmiskeskkonnas. Selle asemel, et tugineda turundusväidetele, saavad turvameeskonnad nüüd otsustada realistliku keerukuse põhjal, milline agent sobib nende konkreetsele infrastruktuurile. See vähendab riski võtta kasutusele agentsed süsteemid, mille tegelik toimivus reaalsetes tingimustes on teadmata.
Teadlased on hindamisprotokolli, võrdluseks kasutatavad tõeväärtusandmed ja lähtekoodi teinud kättesaadavaks aadressil https://github.com/ethiack/ethibench, et võimaldada tulemuste korratavust ja edasisi uuringuid.
Allikas: arxiv.org · Avaldatud 13. juulil 2026
Lumi AI News — tehisintellekti abil kureeritud vastavalt EU tehisintellektimääruse art 50-le. Parafraseerimine ja klassifitseerimine Lumi News Pipeline v1.7.3 poolt.