Lühidalt: Sihipäraselt paigutatud promptid, mis käivitavad suurte keelemudelite sisuturvalisuse kaitsemehhanismid, vähendavad automatiseeritud tehisintellekti rünnakute õnnestumise määra kuni 90 protsenti.
Turvafirma Tracebit on välja töötanud kaitsetehnika automatiseeritud tehisintellekti juhitud küberrünnakute vastu, mis kasutab sihipäraselt promptidega varustatud peibutusfaile, et käivitada suurte keelemudelite turvareeglid ja katkestada rünnakute käik.
Ründajad kasutavad üha enam tehisintellekti agente, et automatiseerida küberrünnakute kõiki etappe. Uus kaitsestrateegia toimib sarnaselt küberturbes tuntud klassikaliste peibutuselementidega (canary) — petlikult ehedad, kuid sisutühjad ressursid, nagu võltsdokumendid, AWS-i juurdepääsuvõtmed või DNS-kirjed, mille eesmärk on ründajaid ligi meelitada. Erinevus seisneb selles, et niinimetatud „context bombing” ei piirdu ainult häire käivitamisega, vaid peab rünnaku aktiivselt peatama.
Tehnika kasutab ära suurte keelemudelite loomupärast haavatavust prompt-süstimise (prompt injection) suhtes. Pahatahtlikud promptid veebilehtedel, e-kirjades, dokumentides või koodikommentaarides võivad panna tehisintellekti agendid sooritama volitamata toiminguid. Tracebit on katsetanud selliste promptide sihipärast paigutamist — näiteks peidetuna peibutusliku salajase väärtuse (secret) või keskkonnamuutuja (environment variable) sisse. Kui ründav tehisintellekti agent selle sisu läbi loeb, käivitab see mudeli sisuturvalisuse kaitsemehhanismid. Mudel katkestab tegevuse ja keeldub jätkamast — rünnak jääb seisma.
AWS-i keskkonnas läbi viidud testides saavutasid tehisintellekti mudelid lähteolukorra stsenaariumides, kus context bomb’e ei kasutatud, 154 rünnakukatsest 54% juhtudest administraatori õigused ja 36% juhtudest täieliku kompromiteerimise (administraatori õigused + püsivus). Context bomb’ide kasutuselevõtuga langesid need näitajad vastavalt 5%-ni (administraatori õigused) ja 1%-ni (täielik kompromiteerimine). Keskmiselt suutsid agendid ilma kaitsemeetmeteta 91% katsetest edukalt läbi viia vähemalt ühe kümnest võimalikust ründeteest — context bomb’ide kasutamisel langes see näitaja 15%-ni.
Testiti mudeleid Claude Opus 4.8, Gemini 3.1 Pro, GLM 5.2, DeepSeek V4 Pro ja Kimi K2.6. Läänelikud mudelid (Opus, Gemini) saavutasid kõrgeimad õnnestumismäärad (vastavalt 93% ja 70% administraatoriõiguste puhul), kuid olid ka kõige tundlikumad context bomb’ide suhtes — mõlema puhul langes näitaja 0%-ni. Hiina mudelid näitasid madalamaid lähtemäärasid, mis viitab tugevamatele sisuturvalisuse kaitsemehhanismidele läänelikes versioonides. Samas erinesid tõhusad prompti-stringid mudelite lõikes, mis viitab context bomb’ide mudelipõhisele kohandamisele.
Allikas: www.csoonline.com · Avaldatud 21. juuli 2026
Lumi AI News — tehisintellekti abil kureeritud vastavalt tehisintellektimääruse artiklile 50. Parafraseerimine ja klassifitseerimine Lumi News Pipeline v1.7.3 abil.