GPT-5.6 Luna kostet nach 80-prozentiger Preissenkung 0,20 Dollar pro Million Input-Token und ist damit günstiger als Googles Gemini 3.1 Flash-Lite und ein Fünftel von Anthropics Claude Haiku 4.5.
Eine leichte Zusatzschicht liest versteckte Generierungszustände aus gefrorenen LLMs aus und reduziert damit Anfragen an größere Modelle um bis zu 90,7 % bei gleichbleibender Leistung.
SEVRA spart beim Inferenzen durch selektive Verifikation 26–91 Prozent Tokens ein, ohne die Genauigkeit zu beeinträchtigen, stellt aber längere initiale Lösungsversuche als teilweise kostengünstiger dar.
VaSE erreicht bei 4x KV-Cache-Kompression höhere Genauigkeit als bestehende Sparse-Attention-Methoden und reduziert damit den Speicher-Bottleneck von Reasoning-Modellen.