Kimi K3 on avatud tipptasemel mudel, millel on sisseehitatud visuaalne taju, miljoni tokeni suurune kontekstiaken ja K2-ga võrreldes 2,5 korda parem skaleerimistõhusus, ning kõik mudeli…
LongStraw võimaldab teostada RL-treeningut 2,1 miljoni tokeni peal, kasutades Group Relative Policy Optimization’it (GRPO) kaheksal H20 GPU-l, optimeerides mäluligipääsu ja kokku surudes arvutusgraafe vastuseharude taasesitamise…
Ise juhitud testiaegne treening (S-TTT) parandab pikakontekstiliste sisendite töötlemist, sest mudel tuvastab enne parameetrite kohandamist ise asjakohased tekstilõigud, mitte ei vali juhuslikke katkendeid.
Sparse Delta Memory suurendab lineaarsete RNN-ide oleku mahtuvust märkimisväärselt, ilma arvutuskulusid suurendamata, parandades sellega pika konteksti ja arutlusvõime jõudlust.
FlashMorph teisendab transformerid hübriid-attention-mudeliteks, tehes optimaalse valiku selle kohta, millised kihid vajavad täielikku attention’i ja millised saab asendada lineaarse attention’iga.
InfoKV ühendab tähelepanu-skoorid ebakindlusesignaalidega KV-vahemälu tihendamiseks, ületades puhta tähelepanu-põhise meetodid pikka järeldamist tehes mõõdetavate marjide võrra.