Lühidalt: LongStraw võimaldab teostada RL-treeningut 2,1 miljoni tokeni peal, kasutades Group Relative Policy Optimization’it (GRPO) kaheksal H20 GPU-l, optimeerides mäluligipääsu ja kokku surudes arvutusgraafe vastuseharude taasesitamise kaudu.
Teadlased on välja töötanud LongStraw’i — tugevdusõppe (RL) täitmisarhitektuuri, mis toetab kuni 2,1 miljoni tokeniga kontekste fikseeritud GPU-ressursside piires. Süsteem tegeleb kasvava lõhega järelduse (inference) pikkuste ja RL-järeltreenimise vahel, kus mudelid on seni piirdunud 256K tokeniga.
Kasvav erinevus järelduse kontekstipikkuste ja RL-järeltreenimise võimekuse vahel muutub AI-agentide jaoks kriitiliseks: järeldussüsteemid saavutavad juba miljoni tokeni pikkuseid kontekste, samal ajal kui järeltreenimise töökoormused jäävad tavaliselt 256K tokeni juurde või alla selle ning toetuvad kasutuselevõtul pikkuse üldistamisele. Agentide puhul kuhjuvad vaatlused, tööriistade väljundid, dokumendid ja varasemad otsused pikkade trajektooride vältel.
LongStraw on arhitektuuriteadlik täitmiskiht, mis realiseeritakse Group Relative Policy Optimization’i (GRPO) abil. Rakendus hindab jagatud prompti ilma autograd’i lisakuluta, säilitab ainult mudelispetsiifilised olekud järgnevate tokenite jaoks ning esitab vastuseharusid järjestikku uuesti — see vähendab aktiivset treeningugraafi, kuid nõuab lisaaega ümberarvutusteks. Meetod realiseeriti mudelitel Qwen3.6-27B (hübriidne korduv- ja täistähelepanu) ning GLM-5.2 (kokkusurutud tähelepanuga ekspertide segu).
Kaheksal H20 GPU-l teostab LongStraw skoorimise ja tagasilevi (backward pass) Qweni jaoks 2,1 miljoni positsiooni peal; grupi suuruse suurendamine 2-lt 8-le lisab tipp-mälukasutusele vaid 0,21 GB. Eraldi stressitest saavutab 4,46 miljonit positsiooni. 32 H20 GPU peal valideeriti täielik täitmistee 2,1 miljoni tokeniga prompti jaoks kõigi GLM-5.2 78 kihi ulatuses. Katsed tõendavad eelkõige täitmisvõimekust; talletatud prompti olek on eraldatud (detached) ning mõned hajutatud edasilevi ja gradiendi kombineerimise teed jäävad veel poolikuks.
Allikas: arxiv.org · Avaldatud 15. juulil 2026
Lumi AI News — tehisintellekti abil kureeritud vastavalt tehisintellektimääruse art 50-le. Parafraseerimine ja klassifitseerimine Lumi News Pipeline v1.7.3 kaudu.