LongStraw: tugevdusõpe miljonite tokenite peal fikseeritud GPU-eelarvega17. juuli 2026Tehisintellekti mudelidLongStraw võimaldab teostada RL-treeningut 2,1 miljoni tokeni peal, kasutades Group Relative Policy Optimization’it (GRPO) kaheksal H20 GPU-l, optimeerides mäluligipääsu ja kokku surudes arvutusgraafe vastuseharude taasesitamise kaudu. Share on: