Lühidalt: Kontrollitud testid tööriistaga AI-Infra-Guard näitavad, et DeepSeek Harnessi puhul ulatub kaudse viipasüsti edukus failikanalite, näiteks peidetud Unicode-teksti kaudu, kuni 25,5 protsendini.
Testraamistikuga AI-Infra-Guard (A.I.G) tehtud uuring näitab, et DeepSeek Harnessi (DSH) on võimalik kaudse viipasüsti abil mõõdetavas ulatuses manipuleerida. CISO-dele, kes kasutavad tööriistadele juurdepääsuga agendiraamistikke, pakub töö konkreetseid ründepindu ja edukuse näitajaid.
Teadlased viisid tööriistaga AI-Infra-Guard (A.I.G) läbi kokku 14 560 kontrollitud testkäiku DeepSeek Harnessi (DSH) vastu. Testid hõlmasid 16 kaudset sisukanalit, kahte edastusrežiimi (tekst ja fail), 35 kasuliku koorma sihtmärki, muutumatut lähtetaset ning 12 ründemeetodit. DSH agenditsükkel, tööriistaregister, mudeliadapter ja seansisündmuste rada jäid seejuures muutmata; lähtetööriistad ja tundlikud sihtkohad simuleeriti kohalike fikstuuridena, mistõttu proovitud tegevused logiti, kuid neid täideti ilma väliste mõjudeta.
Hindamine toimus kahe meetodiga: deterministliku reeglipõhise hindaja (RuleJudge) ja semantilise, LLM-põhise hindaja (LLMJudge) kaudu. Kõrgeimad täheldatud rünnaku edukuse näitajad olid 17,0 protsenti valefinalismi rünnaku puhul tekstirežiimis (RuleJudge), 25,5 protsenti peidetud Unicode-teksti puhul failirežiimis (RuleJudge) ning 16,0 protsenti Skills-kanali puhul failirežiimis (RuleJudge). Lisaks hindas LLMJudge oluliselt sagedamini olukorda vaid osalise reeglitele vastavusena kui RuleJudge (7,3 protsenti võrreldes 2,0 protsendiga).
Turbe eest vastutavatele isikutele, kes käitavad tootmises DeepSeekil põhinevaid või sarnaseid tööriistadele juurdepääsuga agendiraamistikke, tähistab uuring reaalset ründepinda: juba näiliselt kahjutute kanalite, näiteks failisisu, peidetud Unicode-märkide või tööriista tulemuste kaudu on võimalik agenti soovimatutele tegevustele suunata, ilma et otsest viipa oleks vaja manipuleerida. Autorid seostavad täheldatud haavatavused sellega, kuidas DSH käsitleb tööriista tulemusi, lisakonteksti ning tööriistakutsete tegevuspõhimõtete konksusid (policy hooks).
Sellest lähtuvalt sõnastab uuring kontrollpunktid, mis tuleks paigutada ebausaldusväärse sisu ja turvalisust mõjutavate tegevuste vahele, näiteks tööriista väljundi ja täitmisotsuse liidesesse. Vastav lähtekood on avalikult kättesaadav Tencenti AI-Infra-Guardi hoidlas, mis võimaldab teha ettevõtte enda kontekstis täiendavaid teste.
Allikas: arxiv.org · Avaldatud 17. augustil 2026
Lumi AI News — tehisintellekti abil kureeritud vastavalt tehisintellektimääruse artiklile 50. Parafraseerimine ja klassifitseerimine Lumi News Pipeline v1.8.3 kaudu.