Lühidalt: Positsioonipaber nõuab, et tehisintellekti agentide turvalisus tuleks tagada mitte treenimise käigus, vaid jõustatava käitusaja lepinguna, mis sisaldab ennetavaid ja tõenduspõhiseid kontrolle täitmiskeskkonnas (harness), toetudes 52 turvaintsidendi analüüsile ja 8–12-kordsele avaldamistasakaalustamatusele treening- ja juurutusaegse turvalisuse vahel.
Uus positsioonipaber väidab, et autonoomsete tehisintellekti agentide turvalisust ei saa tagada ainuüksi treeningmeetoditega, nagu RLHF, DPO või Constitutional AI. Selle asemel tuleks turvalisus kinnistada jõustatava käitusaja lepinguna täitmiskeskkonnas (harness), kuna agendid käivitavad koodi, muudavad failisid, saadavad sõnumeid ja manipuleerivad andmebaase.
Aadressil arxiv.org/abs/2608.11274 avaldatud dokument kritiseerib valdavat paradigmat, mille kohaselt tehisintellekti turvalisus tekib peamiselt mudeli omadusena treenimise ajal. Autorid väidavad, et see lähenemine on autonoomsete agentide puhul struktuurselt ebapiisav, kuna need täidavad töö käigus reaalseid tegevusi, millel on tagajärjed. Selle asemel pakuvad nad välja kaheosalise käitusaja lepingu: ennetava osa, mis blokeerib ohtlikud tegevused juba ette liivakastide (sandbox), õiguste tõkendite (permission gates), väljundfiltrite ja trajektoori-monitooride abil, ning tõenduspõhise osa, mis nõuab enne ülesande lõpetamist usaldusväärset tõendust õnnestunud tegevuste kohta – näiteks testkäike, logikirjeid, failide erinevusi (diffe) või tsiteerimispõhist kinnistamist (citation grounding).
Väite kinnitamiseks toetub dokument neljale empiirilisele uuringule, mille toorandmed on esitatud kaasas olevates JSON-failides: tehisintellekti agentide ja suurte keelemudelite (LLM) 52 dokumenteeritud turvaintsidendi analüüsile, valeteadete (“false completions”) auditile, mis hõlmab 31 vaieldamatut põhijuhtumit ja üht vaidlusalust näidisjuhtumit, 12 avaliku agendisüsteemi ja täitmiskeskkonna trajektooride skeemiauditile, ning kõigi aastatel 2023–2025 konverentsidel NeurIPS, ICML ja ICLR vastu võetud 28 560 artikli pealkirjade analüüsile. Viimane näitab koondatud 8- kuni 12-kordset tasakaalustamatust treeningaegse turvalisuse ja juurutusaegse turvalisuse teemaliste publikatsioonide vahel.
Insenermeeskondadele, kes viivad agendisüsteeme tootmisse, pakub dokument konkreetseid ehitusplokke: formaliseeritud agendi trajektoori skeemi koos tõendusahelaga (evidence chain) ning kompositsioonilise lüüsimise (gating) väite, mis põhineb standardsel monitooride kombineerimisel. Autorid tõmbavad paralleele arvutiturbe ja eksperimentaalteadustega, mis mõlemad on ajalooliselt liikunud käitusaja lepingute suunas, mis sisaldavad ennetavaid ja tõenduspõhiseid elemente. Nende peamine väide on, et agendipõhise tehisintellekti puhul ei ole asjakohane turvaühik mudel ise, vaid trajektoor koos kontrollitava tõendusmaterjaliga – see on lähtepunkt täitmiskeskkonna arhitektuuride, seiretorustike ja vastuvõtukriteeriumide kujundamisel tootmises kasutatavates agendisüsteemides.
Allikas: arxiv.org · Avaldatud 10. augustil 2026
Lumi AI News — tehisintellekti abil kureeritud vastavalt tehisintellektimääruse artiklile 50. Parafraseerimine ja klassifitseerimine Lumi News Pipeline v1.8.3 abil.