Skip to content

Tehisintellekti agendid: kuidas ettevõtted kontrollivad hallutsinatsioone autonoomsetes süsteemides

Kokkuvõtlikult: Tehisintellekti agendid on jututrobotitest märgatavalt ohtlikumad, kuna nad tegutsevad iseseisvalt; uued tuvastusmeetodid nagu Finch-Zk ja LettuceDetect näitavad küll paranemist, kuid ei suuda hallutsinatsioone täielikult vältida.

Autonoomsed tehisintellekti agendid käivitavad shell-käske ja pöörduvad API-de poole – ning selle iseseisvusega kaasnevad uued riskid hallutsinatsioonide näol. Mitmed tehnilised raamistikud võimaldavad ettevõtetel selliseid vigu tuvastada ja piirata.

Tänapäevaste tehisintellektisüsteemide võimekus on põhjalikult laienenud: kui klassikalised suured keelemudelid genereerivad üksnes teksti, siis tehisintellekti agendid suudavad otse suhelda IT-infrastruktuuriga – nad käivitavad shell-käske, manipuleerivad failisüsteeme, saadavad e-kirju ja algatavad API-päringuid. See autonoomsus muudab need ettevõtte töövoogude jaoks väärtuslikuks, kuid loob samal ajal uusi ründepindu. 2025. aasta septembris läbi viidud Gartneri küsitlus näitab, et 74 protsenti IT-otsustajatest peab tehisintellekti agente kriitiliseks turvaauguks. Vaid 19 protsenti usaldab, et nende pakkujad tagavad piisava kaitse tehisintellekti hallutsinatsioonide vastu.

Mitmed uurimisrühmad töötavad selliste vigade tuvastamise mehhanismide kallal. Finch-Zk, AWS-i teadlaste väljatöötatud raamistik, kasutab mudelitevahelist järjepidevust: mitu mudelit saab semantiliselt samaväärseid vihjeid ning nende vastuseid võrreldakse peendetailsete ebatäpsuste leidmiseks. FELM-andmestikul tehtud testide järel parandas see lähenemine hallutsinatsioonide tuvastamise F1-skoori 6 kuni 39 protsendi võrra võrreldes seniste meetoditega. Veaparanduse puhul tõusis vastuste täpsus keskmiselt 7 kuni 8 protsendipunkti võrra, mudelite puhul nagu Llama 4 Maverick koguni 12,6 protsendipunkti võrra. LettuceDetect on spetsialiseeritud lahendus otsingupõhiste genereerimissüsteemide (RAG) jaoks, saavutades F1-skooriks 79,22 protsenti, ning kasutab pikkade, kuni 8192-tokenilistite kontekstide töötlemiseks mudelit ModernBERT. Amazon Science’i RefChecker eraldab tehisintellekti vastustest väitekolmikuid ja kontrollib neid viidete alusel, mis võimaldas oma võrdlusaluse (benchmark) põhjal saavutada 6,8 kuni 26,1 punkti suuruse paranemise.

Sellegipoolest ei ole need süsteemid täielikud lahendused. Vectara hallutsinatsioonide edetabel näitab, et isegi GPT-4 hallutsineerib kokkuvõtete koostamise ülesannetes umbes 3 protsendil juhtudest. Arvestades, et ChatGPT saab päevas ligikaudu 2,5 kuni 3 miljardit päringut (seisuga 2025/2026), võib see arvutuslikult tähendada mitmekümmet miljonit vigast vastust. Seetõttu vajavad ettevõtted lisaks automatiseeritud tuvastamisele ka kontrollitasandeid: kriitilisi agendi tegevusi tuleks jälgida, valideerida ja ebakindluse korral eskaleerida.


Allikas: www.it-daily.net · Avaldatud 20. juuli 2026
Lumi AI News — tehisintellekti abiga kuraatoritud vastavalt tehisintellektimääruse artiklile 50. Parafraseerimine ja klassifitseerimine Lumi News Pipeline v1.7.3 abil.

Share on: