Sparse Delta Memory erhöht die State-Kapazität linearer RNNs deutlich, ohne die Rechenkosten zu erhöhen, und verbessert damit Long-Context und Reasoning-Performance.
CoT-Feintuning degradiert Long-Context-Retrieval in hybriden LLMs durch Verzerrung der Query-Key-Projektionen; QK-Restore behebt dies ohne zusätzliches Training.