Sihipäraselt paigutatud promptid, mis käivitavad suurte keelemudelite sisuturvalisuse kaitsemehhanismid, vähendavad automatiseeritud tehisintellekti rünnakute õnnestumise määra kuni 90 protsenti.
GPT-Red tuvastab kaudseid süstepromptide rünnakuid 84-protsendilise edukusega — selgelt kõrgema tulemusega kui inimeksperdid, kelle näitaja on 13 protsenti — ning aitab kaasa turvalisemate mudeligeneratsioonide väljatöötamisele.
Tehisintellekti agente saab välistes andmeallikates leiduva manipuleeritud sisu abil meelitada soorimatuid toiminguid tegema, ilma et agenti ennast tuleks häkkida.
OpenAI kasutab spetsialiseeritud punase meeskonna mudelit GPT-Red, et süstemaatiliselt tuvastada ja kõrvaldada uute versioonide prompt-injektsiooni haavatavusi.
Pahatahtlikul veebisaidil kasutatud pesastatud linkide abil õnnestus Claude’i panna eksfiltreerima tundlikke kasutajaandmeid, nagu nimi, elukoht ja tööandja, URL-ide kaudu, hoolimata sellest, et Anthropic oli rakendanud…
Autonoomseid tehisintellekti koodiskannereid saab README-failides paikneva näiliselt legitiimse juhise abil ära petta pahavara käivitama, ilma et klassikalised turvakontrollid sekkuksid.
Tehisintellekti agendid ei tunne ära privaatsete ja avalike ressursside vahelisi usalduspiire ning muutuvad seetõttu tahtmatuks sillaks tundlike sisemiste süsteemide ja avaliku interneti vahel.