Lühidalt: 235 ülesandega spetsialiseeritud võrdlustest näitab, et väljakujunenud võrdlustestid alahindavad süstemaatiliselt kaasaegsete tehisintellektimudelite olulisi nõrkusi või jätavad need üldse tähelepanuta.
Teadlased on koostanud 235 ülesandega võrdlustesti, mis toob päevavalgele kaasaegsete tehisintellektimudelite nõrkused – näiteks täpselt nelja jalaga koera joonistamise või stringide manipuleerimise oskuse. Testid näitavad, et väljakujunenud võrdlustestid varjavad neid puudujääke süstemaatiliselt.
Blind-Spots-Bench pandi kokku ühe tehisintellekti kursuse üliõpilaste küsimuste põhjal, mis puhastati ja varustati struktureeritud etalonlahendustega. Ülesanded hõlmavad taksonoomiat ülesandetüüpidest, mis tunduvad inimestele triviaalsed, kuid jäävad praegustele tehisintellektisüsteemidele püsivalt keeruliseks – alates tekstilistest manipulatsioonidest kuni visuaalse mõistmise ja pilditekitamiseni.
Hindamiseks töötasid autorid välja automatiseeritud hindamistorustiku, mis testib laia valikut mudeleid: avatud kaaludega variante, suletud tipptasemel mudeleid ning keele-, nägemis-keele- ja pilditekitamissüsteeme. Tulemused paljastavad märkimisväärseid jõudluserinevusi: patenteeritud tipptasemel mudelid saavutasid kohati umbes 10 protsendipunkti kõrgemaid tulemusi kui võrreldavad avatud kaaludega alternatiivid, kuigi need näitavad väljakujunenud võrdlustestides sarnaseid näitajaid.
Täpsem analüüs näitab, et ükski üksik mudel ei domineeri järjekindlalt kõigi ülesandetüüpide lõikes. Mõned ülesanded jäävad kõigile hinnatud süsteemidele endiselt väljakutseks. Võrdlustest toimib sihipärase stressitestina, mis diagnoosib konkreetseid nõrkusi – kaugemale jõudlusmõõdikutest, mida kommertsvõrdlustestid regulaarselt neelavad või mille jaoks neid optimeeritakse.
Allikas: arxiv.org · Avaldatud 8. juuli 2026
Lumi AI News — tehisintellekti abil koostatud ülevaade vastavalt EL tehisintellektimääruse art 50-le. Parafraseerimine ja klassifitseerimine Lumi News torustiku v1.7.3 poolt.