Skip to content

PIMiner: agendipõhine punase meeskonna testimine paljastab kiipsüstisüstimise (prompt injection) rünnakute kõrge õnnestumise määra

Lühidalt: Agendipõhine punase meeskonna testsüsteem PIMiner saavutab ilma täiendava treeninguta kuni 86,7-protsendilise õnnestumise määra tänapäevaste suurte keelemudelite, nagu Gemini-2.5-Pro, GPT-5.1 ja Claude-Sonnet-4.5, vastu standardsete promptisüstimise võrdlusaluste põhjal.

Teadlased tutvustavad PIMinerit — agendipõhist süsteemi promptisüstimisrünnakute automatiseeritud punase meeskonna testimiseks, mis on uutele sihtmudelitele ülekantav ilma täiendava treeninguta. Testides saavutab see tänapäevaste mudelite, nagu Gemini-2.5-Pro, GPT-5.1 ja Claude-Sonnet-4.5, vastu kuni 86,7-protsendilise õnnestumise määra.

PIMiner on agendipõhine süsteem LLM-agentide vastu suunatud promptisüstimisrünnakute punase meeskonna testimiseks. Erinevalt olemasolevatest tipptasemel meetoditest, mis põhinevad tugevdusõppel (reinforcement learning) ja mille tulemusel tekivad ründajamudelid, mis kanduvad uutele sihtmudelitele halvasti üle, koostab PIMiner treenimise käigus andmestiku ja sihtmudeli paaride jada põhjal strateegiate kogu algusest peale. Testimise ajal saab seda kogu vahetult üle kanda varem tundmatule sihtmudelile, ilma et oleks vaja täiendavat treenimist. Iga testjuhtumi kohta vajab süsteem sihtagendile vaid vähe päringuid — autorite sõnul umbes kümme.

Mõõdetud õnnestumise määrad (Attack Success Rate, ASR) on turbevastutajate jaoks olulised, kuna need näitavad, et praegused tootmisele lähedased mudelid ei ole promptisüstimisrünnakute vastu piisavalt kaitstud. Võrdlusaluse IPIArena põhjal saavutab PIMiner Gemini-2.5-Pro vastu 76,2-protsendilise, GPT-5.1 vastu 61,9-protsendilise ja Claude-Sonnet-4.5 vastu 42,9-protsendilise ASR-i. AgentDojo puhul on näitajad Gemini-2.5-Pro vastu 86,7 protsenti, GPT-5.1 vastu 53,3 protsenti ja Claude-Sonnet-4.5 vastu 40,0 protsenti. Need arvud toovad ka esile erinevusi üksikute mudelite vastupidavuses süstimisrünnakute suhtes, kusjuures Claude-Sonnet-4.5-l on mõlemal võrdlusalusel ründaja jaoks madalaim õnnestumise määr.

CISO-dele, kes kasutavad või kavatsevad kasutada LLM-agente tootmiskeskkondades, annab töö konkreetse vahendi omaenda riskihindamiseks: ülekantav strateegiate kogu võimaldab agendipõhiseid juurutusi suhteliselt väikese vaevaga testida promptisüstimise vastu enne nende tootmisse viimist. Samal ajal annavad genereeritud rünnakuandmed treeningmaterjali kaitsemehhanismide täiustamiseks. Kes haldab LLM-agente, millel on juurdepääs välistele tööriistadele, failidele või API-dele, peaks kaaluma kirjeldatud metoodikat lähtepunktina omaenda punase meeskonna testimisprotsesside jaoks, kuna autorid rõhutavad, et iga testjuhtumi kohta vajaminevate päringute väike arv on praktiline korduvaks kasutamiseks muutuvate sihtmudelite vastu.


Allikas: arxiv.org · Avaldatud 4. august 2026
Lumi AI News — AI-toetatud kureerimine vastavalt EL tehisintellektimääruse art. 50-le. Parafraas ja klassifikatsioon Lumi News Pipeline v1.8.3 abil.

Share on: