Skip to content

OpenAI kasutab GPT-Redi GPT-5.6 automatiseeritud prompt-injektsiooni testimiseks

Lühidalt: OpenAI kasutab spetsialiseeritud punase meeskonna mudelit GPT-Red, et süstemaatiliselt tuvastada ja kõrvaldada uute versioonide prompt-injektsiooni haavatavusi.

OpenAI avaldas GPT-Redi kui sisemise mudeli automatiseeritud turvakontrolliks, mis tuvastab sihipäraselt prompt-injektsiooni turvanõrkusi enne uute mudelite tootmiskeskkonda jõudmist. Tööriist treenib vastanduva õppe abil järgnevaid mudeligeneratsioone selliste rünnakute vastu vastupidavamaks.

OpenAI on üksikasjalikult kirjeldanud GPT-Redi toimimist – see on sisemiselt kasutatav mudel, mis automatiseeritult otsib prompt-injektsiooni turvaauke. Süsteem on loodud spetsiaalselt selleks, et kontrollida süstemaatiliselt suurte keelemudelite (LLM) haavatavust prompt-injektsioonide suhtes ja saavutada seejuures skaleeritavus, mitte toetuda käsitsi tehtavale testimisele.

OpenAI sõnul on GPT-Red tõhus punase meeskonna vahend, ja senised mudeliversioonid osutusid tema prompt-injektsiooni rünnakute suhtes väga haavatavaks. Ettevõte kasutab GPT-Redi vastanduvas treeningus – see tähendab, et uusi mudeliversioone treenitakse sihipäraselt leitud rünnakuvektoritega, et suurendada nende vastupanuvõimet.

Tehnoloogiajuhtidele ja turvalisuse eest vastutavatele isikutele on see märgiks, kuidas suurte keelemudelite tootjad struktureerivad oma sisemisi turvavalideerimisi. Punase meeskonna töö automatiseerimine vähendab riski, et tuntud rünnakuklassid jõuavad tootmiskeskkonda. Samas näitab selle tööriista olemasolu ka seda, et prompt-injektsiooni haavatavus jääb püsivaks probleemiks, mida ei lahenda üksikud treeningiteratsioonid, vaid mis vajab pidevat vastanduvat täiustamist.


Allikas: thehackernews.com · Avaldatud 16. juuli 2026
Lumi AI News — tehisintellekti abil kureeritud vastavalt tehisintellektimääruse art. 50 nõuetele. Parafraas ja klassifikatsioon Lumi News Pipeline v1.7.3 abil.

Share on: