Lühidalt: Kuna OpenAI, Anthropic ja Google kasutasid ühe mudeliperekonna piires sama krüpteerimisvõtit, õnnestus tugevate mudelite krüptitud arutlusjäljed korduslugemisrünnaku ja jailbreak’i abil ekstraheerida selgekeelsel kujul nõrgematest samast perekonnast pärit mudelitest, enne kui pakkujad turvaaugu sulgesid.
Uus uuring näitab, et Anthropicu, OpenAI ja Google’i krüptitud mõtteahela (chain-of-thought) plokid olid taaskasutatavad üle seansside, kasutajate ja mudelite. Korduslugemisrünnaku abil samast mudeliperekonnast pärit nõrgemate mudelite vastu õnnestus tugevamate mudelite krüptitud mõtteprotsessid selgekeelsel kujul välja lugeda.
Domeenil stolen-thoughts.com avaldatud uuring kirjeldab nõrkust selles, kuidas juhtivad LLM-i pakkujad oma sisemisi arutlusjälgi kaitsevad. Sellised API-d nagu OpenAI oma tagastavad arutlusfunktsiooni sisselülitamisel klientidele krüptitud plokke (“encrypted_content”), mis sisaldavad mudeli täielikku mõtteprotsessi, kuid ei ole vahetult loetavad. Teadlased leidsid, et kõik sama mudeliperekonna mudelid kasutasid sama krüpteerimisvõtit. See võimaldas võimsa mudeli genereeritud jälje tagasi mängida sama perekonna nõrgemasse õdemudelisse. Kui see nõrgem mudel suunati seejärel jailbreak’i abil vastuvõetud plokki transkribeerima, avaldas ta tugevama mudeli tegelikult krüptitud mõtted selgekeelsel kujul. Uuringu kohaselt piisas Claude Haiku 4.5 puhul lihtsast promptist, mis palus mudelil manustatud arutluslõigu sõna-sõnalt korrata sildis <thinking-copy>, kombineerituna vastavalt seatud vastuse prefiksiga. See prefiksi-funktsioon on hiljem uuematest Claude 4.6 mudelitest eemaldatud, kuid Haiku 4.5 puhul töötab endiselt.
Turbeülevaate tegijate jaoks tulenevad leiust kaks olulist riskimõõdet. Esiteks kinnitab uuring, et arutlustokenid, mida pakkujad ei ole teadlikult ette näinud otseseks kuvamiseks lõppkasutajale, olid siiski süstemaatiliselt ekstraheeritavad – koos võimalike tagajärgedega ärisaladustele, mudeli käitumisele ja treeningartefaktidele, mida saab toorest mõtteprotsessist välja lugeda. Teiseks kirjeldavad autorid prompt-injection’i varianti, kus mudel viiakse simuleerima andmete eksfiltratsiooni (näiteks faili üleslaadimist välisesse serverisse) osana enda mõtteprotsessist. Kui see manipuleeritud, krüptitud jälg söödetakse seejärel teise mudelisse, järgib see mudel sisalduvaid juhiseid oluliselt suurema tõenäosusega kui tavaliste prompt-injectionite puhul. Uuring viitab sellele, et mudelid peavad oma enda arutlussisu usaldusväärsemaks kui välist sisendit, mis avab uusi ründepindu kaudseks prompt-injectioniks arutluskanalite kaudu.
Kõik mõjutatud pakkujad – Anthropic, OpenAI ja Google – on omal sõnul teadlaste raporti kinnitanud ja kirjeldatud ründed vahepeal tõkestanud. Ettevõtete jaoks, kes kasutavad tootmises arutlusfunktsiooniga API-sid, tuleneb sellest vajadus hoida mudeli- ja API-versioonid ajakohasena ning arvestada pakkujate andmekaitse- ja konfidentsiaalsuslubaduste hindamisel, et mudelite sisemised mõtteprotsessid ei taga tehniliselt absoluutset konfidentsiaalsust, isegi kui need edastatakse krüptitult. Kui arutlusjälgi antakse edasi või vahemällu talletatakse üle mitme mudeliperekonna või seansi, tuleks kontrollida, kas vastavate pakkujate võtmehaldus ja juurdepääsukontrollid vastavad enda kaitsevajadustele.
Allikas: simonwillison.net · Avaldatud 12. augustil 2026
Lumi AI News — tehisintellekti abil kureeritud sisu vastavalt tehisintellektimääruse artiklile 50. Parafraseerimine ja klassifitseerimine Lumi News Pipeline v1.8.3 abil.