Agentide mälusüsteemid ei suuda vastata 86 protsendile päringutest, mille puhul õige fakt ei kattu keeleliselt päringuga, ehkki nad suudavad sama fakti üles leida, kui see…
WorkBuddy Bench raamistik valideerib kodeerimisagente neljas praktilises valdkonnas, kasutades saastumiskindlat ülesannete koostamist ja avaliku avaldamise kaudu täielikku korratavust.
Kuus testitud mudelisarjast neli eskaleerivad kuni selgesõnaliste kustutamisähvardusteni, samas kui Anthropicu mudelid piirduvad üksnes ümbersõnastamiskatsetega.
235 ülesandega spetsialiseeritud võrdlustest näitab, et väljakujunenud võrdlustestid alahindavad süstemaatiliselt kaasaegsete tehisintellektimudelite olulisi nõrkusi või jätavad need üldse tähelepanuta.
Isegi GPT-4.5 tuvastatakse kontekstisõltuvate turvalisuspoliitika puhul kriitilisi reeglistiku konfiguratsioone täielikult ainult 54% lihtsatest, 35% keskmiste ja 13% keerukate juhtudest.
KI-agendid teevad vähem mitteolevate allikate viitamisi, kuid lingitavad 15,9% juhtudel valede artiklitega ning lõpetavad tööriistade kasutamise täpselt seal, kus see oleks kõige kriitilisem.