Lühidalt: WorkBuddy Bench raamistik valideerib kodeerimisagente neljas praktilises valdkonnas, kasutades saastumiskindlat ülesannete koostamist ja avaliku avaldamise kaudu täielikku korratavust.
Tencent avaldas WorkBuddy Benchi, avatud hindamisraamistiku kodeerimisagentidele neljas töövaldkonnas: hoidlapõhine (repository) arendus, veebi esiotsa arendus, kontoritöövood ning turvalisus. Võrdlusalus on kaitstud andmete saastumise eest tänu sellele, et ülesanded on rekonstrueeritud tegelikest commit’idest ja pull request’idest ning muudetud uuteks päringuteks (prompt’ideks).
Ülesehitus ja metoodika: WorkBuddy Bench koosneb neljast sisuliselt erinevast alamosast: (1) hoidlapõhine arendus koodimuudatuste jaoks, (2) esiotsa arendus veebipõhiste ülesannete jaoks, (3) kontori- ja äritöövood, (4) punase ja sinise meeskonna stsenaariumid turvaülesannete jaoks. Iga ülesanne ei ole lihtsalt kohandatud avalikest probleemikirjeldustest (issue-tekstidest), vaid rekonstrueeritud tagurpidi tegelikest commit’idest, pull request’idest või ärilistest stsenaariumidest ning ümber sõnastatud lühikese ja kõnekeelse päringuna. Tänu sellele ei ole algset allikat võimalik veebiotsingu abil uuesti leida.
Saastumiskindlus läbipaistvuse kaudu: Selle asemel, et saavutada turvalisus salastatuse kaudu, tugineb võrdlusalus täielikule avalikustamisele: ülesannete kaustad, keskkonnatõmmised (environment images), hindamisraamistik (harness), testid ja etalonlahendused on avalikult kättesaadavad. Saastumiskindlus põhineb konstrueerimismeetodil koos selgesõnalise andmeversioonimisega. Nii muutub võrdlusalus tervikuna korratavaks ja otseselt kontrollitavaks – iga osapool saab ülesandeid uuesti käivitada ja sisu üle vaadata.
Hindamine ja tulemused: Raamistik töötab ühtse ja korratava protokolli alusel kahel agendiraamistikul: CodeBuddy Code ja Claude Code. Igal neljast alamosast on oma hindamisvahend, mistõttu ei ole tulemused eri valdkondade vahel otse võrreldavad. Võrdlusalus avaldab mudelitevahelise edetabeli mitme mudeliperekonna lõikes, kuid loobub teadlikult kogu komplekti hõlmavast keskmisest tulemusest.
Allikas: arxiv.org · Avaldatud 22. juulil 2026
Lumi AI News — tehisintellekti abil kureeritud vastavalt EU tehisintellektimääruse artiklile 50. Parafraseerimine ja klassifitseerimine Lumi News Pipeline v1.7.3 abil.