Skip to content

Andmekvaliteet, mitte mudeli valik: mis tegelikult otsustab SOC-i edu üle

Lühidalt: Kontrollitud uuring, kus kasutati nelja võrguteleimeetria allikat ja mitut suurt keelemudelit, näitab, et kvaliteetsed ja protokollirikkad turvaandmed, näiteks Corelighti logid, parandavad põhilisi uurimismõõdikuid kaks kuni neli korda – sõltumata kasutatavast keelemudelist.

Kontrollitud uuring näitab: tehisintellektil põhinevate turbeoperatsioonide töövoogude edu määrab peamiselt mitte kasutatav suur keelemudel, vaid aluseks oleva võrguteleimeetria kvaliteet. Kvaliteetne võrgutõendusmaterjal parandab uuringu tulemuste kohaselt keskseid uurimismõõdikuid kaks kuni neli korda.

Kuigi tehisintellekt võtab turbeoperatsioonide keskustes (SOC) üha rohkem ülesandeid üle – näiteks ohtude triaaži, kompromissi indikaatorite (IoC) väljavõtmist või intsidentiraportite koostamist –, seisavad turbejuhid silmitsi põhiküsimusega: sõltub SOC-i tulemuslikkus rohkem kasutatavast suurest keelemudelist (LLM) või andmete kvaliteedist, mida see töötleb? Akadeemilised uuringud annavad selle kohta vastukäivaid vastuseid. Frontiers in Artificial Intelligence’s avaldatud artikkel rõhutab erinevusi täpsuses, asjakohasuses ja selguses selliste mudelite vahel nagu Claude 3.5 Sonnet, Gemini, ChatGPT 4o ja Mistral Large 2. Ajakirjas Information Systems avaldatud publikatsioon väidab seevastu, et usaldusväärsed tehisintellekti rakendused vajavad kvaliteetseid treening- ja testandmeid mitmes kvaliteedidimensioonis, nagu täpsus, täielikkus ja järjepidevus.

Uurimisprojekt „Provably Better Data” uuris seda küsimust kontrollitud testkeskkonnas. Selleks kasutati kahte operatiivset võrdlusalust: kaitke-lippu (capture-the-flag) stsenaariumit 44 küsimusega Volt Typhoon ründekampaania kohta ning intsidentidele reageerimise raporti koostamise ülesannet Salt Typhoon andmestiku põhjal. Andmekvaliteedi testimiseks isoleeritud muutujana töödeldi testülesehituses nelja erinevat võrguteleimeetria allikat identsetes tingimustes: rikastatud Corelighti logid, avatud lähtekoodiga nDPI tulemüürilogid, Snort 3 IDS-teavitused ning NetFlow’i ühenduse teleimeetria. Igat andmestikku käitati korduvalt OCSF (Open Cybersecurity Schema Framework) järgi normaliseeritud skeemi kaudu. Mudelitena kasutati Anthropicu Claude Opus 4.6, Google Gemini Pro 3.1 Preview ning mõlema pakkuja vanemaid mudeleid, kõikides testkordadus identsete käskudega. Hinnati täpsust CTF-küsimustele vastamisel ning intsidentidele reageerimise väidete osakaalu, mida olemasolev tõendusmaterjal kinnitas.

Tulemused näitavad automatiseeritud töövoogudes tõendite ülempiiri: tipptasemel mudelitel on arenenud arutlusvõime, kuid nende järelduste kvaliteet jääb piiratuks olemasolevate andmetega. Kui teleimeetriast puudub üksikasjalik kontekst protokolli tasandil, ei suuda tehisintellekti agendid tuletada seda, mida ei ole kunagi salvestatud. Konkreetne näide CTF-testist illustreerib seda: küsimusele IP-aadressi 10.110.154.113 NetBIOS-arvutinime kohta andsid Corelighti logid õige vastuse „FINANCE01″ – see leidus NTLM-logi väljal server_nb_computer_name, kuna Zeek oli parsinud NTLM Type 2 väljakutsesõnumi ja eraldanud serveri arvutinime. Tulemüürilogid tuvastasid küll NTLM-protokolli aktiivsust, kuid ei suutnud parsida NTLM väljakutse üksikuid välju ning jäid seetõttu õigest vastusest ilma.

Sellest tulenevad turbejuhtidele (CISO) otsesed operatiivsed järeldused: konkreetne ja rikastatud teleimeetria vähendab keskmist reageerimisaega (MTTR), piirab suurte keelemudelite töövoogude tokenite kulu ning seega kulusid, ja suurendab turbemeetmete tõendatavat investeeringutasuvust. Uuringu tulemused pakuvad seega argumentatsioonibaasi, mille alusel põhjendada juhtkonnale ja nõukogule investeeringuid kvaliteetsesse teleimeetria taristusse, vähendada häirete väsimusest (alert fatigue) tingitud analüütikute voolavust ning esitada usaldusväärseid turbenäitajaid. SOC-keskkondade arhitektuuri planeerimisel peaks andmeallikate valik ja rikastamine seega saama vähemalt niipalju tähelepanu kui kasutatava keelemudeli valik.


Allikas: www.csoonline.com · Avaldatud 17. augustil 2026
Lumi AI News — tehisintellekti abil kureeritud vastavalt tehisintellektimääruse art. 50-le. Parafraseerimine ja klassifitseerimine Lumi News Pipeline v1.8.3 poolt.

Share on: