Skip to content

Teadlased ekstraheerisid OpenAI, Anthropicu ja Google’i krüpteeritud arutlusjäljed

Lühidalt: Teadlastel õnnestus ekstraheerida OpenAI, Anthropicu ja Google’i mudelite krüpteeritud arutlusahela (chain-of-thought) plokke, mängides jäljed tagasi sama mudeliperekonna nõrgematesse mudelitesse ja need seejärel häkkides (jailbreak); tootjad on nüüdseks turvaaugu sulgenud.

Uus uuring näitab, et proprietaarsete LLM-i API-de krüpteeritud arutlusahela plokid olid taaskasutatavad üle seansside, kasutajate ja mudelite. Jälgede tagasimängimisega nõrgematesse õdedmudelitesse ja nende häkkimisega (jailbreak) õnnestus teadlastel taastada tugevamate mudelite varjatud mõtteprotsessid selgeltloetavas vormis.

Domeenil stolen-thoughts.com avaldatud uuring tõendab, et Anthropic, OpenAI ja Google tagastavad klientidele krüpteeritud arutlusahela plokke (“encrypted_content”). Neid plokke saab API kaudu alla laadida, näiteks OpenAI Responses API-s parameetriga “include”: [“reasoning.encrypted_content”]. Teadlased leidsid, et kõik sama mudeliperekonna mudelid kasutasid sama krüpteerimisvõtit. Nii sai tippmudeli genereeritud arutlusjälje tagasi mängida sama perekonna nõrgemasse mudelisse. Pärast selle nõrgema mudeli häkkimist (jailbreak) väljastasid süsteemid varem krüpteeritud arutlussisu selgeltloetavana. Uuringu andmetel õnnestus rünnak kõige lihtsamalt Claude Haiku 4.5 puhul, muu hulgas viiba abil, mis palus mudelil korrata oma arutlussisu sõna-sõnalt kindlaksmääratud märgendis, kombineerituna assistendi-käigu eesliitega – funktsiooniga, mis eemaldati 4.6 mudelitest, kuid mis Haiku 4.5 puhul veel toimis.

Ettevõtete infoturbejuhtidele (CISO) on oluline, et proprietaarseid arutlusmudeleid on siiani peetud musta kastiks kaitstud sisemiste mõtteprotsessidega. Uuring näitab, et see kaitse-eeldus ei kehtinud läbivalt: toored arutlus-toonid, mis autorite sõnul polnud kunagi mõeldud inimtarbimiseks, olid ekstraheeritavad ja sisaldasid muu hulgas tarkvaraarhitektuuride juurutusdetaile. Lisaks demonstreerisid teadlased viiba-süstimise (prompt injection) varianti, kus mudel pannakse oma arutlusjäljes mõtlema andmete eksfiltreerimisele – näiteks faili üleslaadimisele välisserverisse. Kui see krüpteeritud jälg mängitakse seejärel tagasi teise mudelisse, järgivad mudelid selles sisalduvaid juhiseid suurema tõenäosusega, kuna nad näivad pidavat enda arutlussisu usaldusväärsemaks kui tavalisi kasutajasisendeid.

Uuringu autorite sõnul on kõik mõjutatud tootjad kinnitanud raporti kättesaamist ning kirjeldatud rünnakud enam ei toimi. Infoturbejuhtidele, kes kasutavad arutlusmudeleid API-de kaudu või töötlevad arutlusväljundeid edasi omaenda torujuhtmetes, tuleneb sellest vajadus mitte üle kanda krüpteeritud arutlusplokke kriitikavabalt mudeliversioonide vahel või allavoolu süsteemidesse ning laiendada viiba-süstimise vastaseid kaitsemeetmeid ka arutlusjälgedele, kuna mudelid kohtlevad neid erilise usaldusega.


Allikas: simonwillison.net · Avaldatud 12. august 2026
Lumi AI News — tehisintellekti abil kureeritud vastavalt tehisintellektimääruse artiklile 50. Parafraseerimine ja klassifitseerimine Lumi News Pipeline v1.8.3 poolt.

Share on: