Artikel:Kimi Team (Yu Zhang et al.)
Kimi Linear: Hybride lineare Attention-Architektur übertrifft Full Attention
Das Kimi-Team stellt Kimi Linear vor, eine hybride lineare Attention-Architektur, die Full Attention in Tests über kurze und lange Kontexte sowie im RL-Scaling übertrifft. Sie senkt den KV-Cache-Bedarf um bis zu 75 Prozent und steigert den Decoding-Durchsatz bei Kontexten von 1 Million Token um das bis zu Sechsfache.
Aus Video: AI Weekly Updates: Open-Source Model Surge, Agent Harnesses, and Meta's AI Reality Check