Skip to content

JetBrains praktikatestis: kuidas ettevõte hindab ja kasutab Claude Fable 5-t

JetBrains, mille toodete IntelliJ IDEA, PyCharm ja Kotlin kasutajaskond ületab 12,5 miljonit aktiivset kasutajat, avaldas Anthropicuga peetud vestluses, kuidas ettevõte uusi mudeleid hindab ja millal ta eelistab Claude Fable 5-t varasematele mudelitele. Tehnikajuhtidele pakub raport konkreetseid arve võrdlustestide tulemuste kohta ning struktureeritud lähenemist mudelite hindamiseks reaalsetes tootmiskeskkondades.

Vladislav Tankov, JetBrainsi tehnikajuht, kirjeldab aastate jooksul väljakujunenud keelemudelite hindamise protsessi. Ettevõte testib uusi mudeleid suurte, privaatsete hindamiskomplektide vastu, sealhulgas oma monorepositooriumi peal, et kontrollida, kas mudelid saavutavad reaalsetel ülesannetel samasuguseid tulemusi nagu avalikes võrdlustestides. Selleks peab JetBrains eraldi edetabeleid parima kvaliteedi, madalaima kulu ülesande kohta ja kiireima täitmise järgi.

Testides saavutas Claude Fable 5 Pythoni ülesannete läbimismääraks 44,3 protsenti, samas kui Opus 4.8 jäi 28,2 protsendi juurde – vahe on 16 protsendipunkti. Otsevõrdluses lahendas Claude Fable 5 18 Pythoni ülesannet, millega Opus 4.8 hakkama ei saanud, ning kaotas vastupidises suunas ainult kahel korral. Lisaks vajas mudel lahenduseni jõudmiseks umbes 22 protsenti vähem samme. Java ülesannete puhul üritas Opus 4.8 korduvalt kaasata väliseid ressursse, millest JetBrainsi keskkonnas suurt kasu ei ole, samas kui Claude Fable 5 töötas otse olemasoleva koodiga.

Tankovi sõnul tähendab see praktikas selget tööjaotust: Opus on usaldusväärne standardtööjõud ülesannete jaoks, mille lahenduskäik on juba teada. Claude Fable 5-t kasutatakse siis, kui vaja on sügavamat arutlusvõimet või kui lahenduskäik ise on ebaselge – näiteks keerulise rikkaliku tekstiredaktori komponendi väljatöötamisel, mida JetBrains oli aastate jooksul korduvalt tulutult proovinud ja mis õnnestus Claude Fable 5-ga peaaegu esimesel katsel. Teine kasutusjuhtum on pikaajaline agentne programmeerimine: agent saab teksti- ja pildikujul spetsifikatsioonid ning ehitab nende põhjal keerulisi IDE-taolisi rakendusi, kusjuures osa spetsifikatsioone genereerib agent ise olemasolevate rakenduste põhjal – meetod, mida JetBrains kasutab ka rakenduste porditamiseks eri käitusaegade, raamistike või programmeerimiskeelte vahel.

Turvalisuse ja andmete käitlemise teemal selgitab Tankov, et JetBrains toetub Anthropicu red-teaming’ule ja turvameetmetele, mitte ei tegele ise mudeli tasandiga. Ettevõtte enda panus seisneb mudeli ümber oleva infrastruktuuri ja kasutusraamistiku süstemaatilises turvamises. Turvalisus on ühtlasi üks olulisemaid Claude Fable 5 rakendusvaldkondi JetBrainsis: ettevõte teeb oma toodete vastu white-box-teste, et avastada haavatavusi.

Claude Fable 5 saavutas JetBrainsis Pythoni ülesannete läbimismääraks 44,3 protsenti, võrreldes Opus 4.8 tulemusega 28,2 protsenti, ning vajab lahenduseni jõudmiseks umbes 22 protsenti vähem samme, samas kui andmeturbe osas toetub JetBrains Anthropicu red-teaming’ule ja oma infrastruktuuri kaitsele.


Allikas: claude.com · Avaldatud 12. augustil 2026
Lumi AI News — tehisintellekti abil kureeritud sisu vastavalt tehisintellektimääruse artiklile 50. Parafraseerimine ja klassifikatsioon Lumi News Pipeline v1.8.3 abil.

Share on: