Kimi Linear: Hybride lineare Attention-Architektur übertrifft Full Attention

ArtikelKimi Team (Yu Zhang et al.)Forschung

Das Kimi-Team stellt Kimi Linear vor, eine hybride lineare Attention-Architektur, die Full Attention in Tests über kurze und lange Kontexte sowie im RL-Scaling übertrifft. Sie senkt den KV-Cache-Bedarf um bis zu 75 Prozent und steigert den Decoding-Durchsatz bei Kontexten von 1 Million Token um das bis zu Sechsfache.

Das Wichtigste

  1. Kombiniert Kimi Delta Attention (KDA) schichtweise mit Multi-Head Latent Attention (MLA).
  2. KDA erweitert Gated DeltaNet durch feinkörnigeres Gating für eine bessere Nutzung des endlichen RNN-Zustandsspeichers.
  3. Ein chunkweiser Algorithmus nutzt eine spezielle Variante von Diagonal-Plus-Low-Rank (DPLR) Übergangsmatrizen zur Rechenzeitreduktion.
  4. Ein vortrainiertes Modell mit 3 Milliarden aktivierten und 48 Milliarden Gesamtparametern übertraf reines MLA bei identischem Trainingsrezept deutlich.
  5. Bis zu 75 % weniger KV-Cache-Verbrauch und bis zu 6-facher Decoding-Durchsatz bei einem Kontextfenster von 1M Token.
  6. Der KDA-Kernel, vLLM-Implementierungen sowie vortrainierte und Instruction-getunte Checkpoints werden als Open Source veröffentlicht.

Warum das relevant ist

Klassische Transformer mit voller Attention stoßen bei extrem langen Kontexten an Speicher- und Effizienzgrenzen. Kimi Linear liefert eine praxistaugliche Drop-in-Alternative, die ohne Leistungsverluste drastisch weniger KV-Cache benötigt und vLLM-Unterstützung direkt mitbringt.

Einordnung

Lineare Attention-Ansätze litten in der Vergangenheit oft unter spürbaren Qualitätsverlusten gegenüber herkömmlichen Full-Attention-Modellen. Die Autoren von Kimi Linear begegnen diesem Problem durch die Kopplung von KDA und MLA sowie einer maßgeschneiderten DPLR-Formulierung. Die Ergebnisse zeigen deutliche Effizienzgewinne insbesondere bei langen Kontexten, ohne Einbußen bei kurzer Kontextlänge oder beim Reinforcement Learning hinnehmen zu müssen.

Gefunden in

Zusammenfassung von KI erstellt (Gemini 3.8 Flash, 27. September 2026). Sie kann Fehler enthalten – maßgeblich ist die Originalquelle.

Inhaltlich ähnlich, ermittelt über die KI-Suche.

  • Artikel:Albert Gu, Tri Dao

    Mamba: Lineare Sequenzmodellierung mit selektiven Zustandsräumen

    Albert Gu und Tri Dao stellen mit Mamba eine Architektur vor, die auf selektiven State Space Models (SSMs) basiert. Das Modell skaliert linear mit der Sequenzlänge, verzichtet auf Attention-Mechanismen sowie MLP-Blöcke und übertrifft vergleichbare Transformer bei fünffachem Inferenzdurchsatz.

    KI & AI· Forschung

  • Link:Subquadratic Inc.

    Subquadratic stellt SubQ vor: LLM-Architektur für Multi-Millionen-Token-Kontexte

    Das KI-Forschungsunternehmen Subquadratic hat mit SubQ ein Modell vorgestellt, das für die Verarbeitung von mehreren Millionen Tokens ausgelegt ist. Die Architektur nutzt ein proprietäres Verfahren namens Subquadratic Sparse Attention (SSA), um den Rechenaufwand bei sehr langen Kontexten im Vergleich zu herkömmlichen Transformer-Modellen drastisch zu reduzieren.

    KI & AI· Ankündigung

  • Artikel:Opher Lieber, Barak Lenz, Hofit Bata et al.

    Jamba: Hybrides Sprachmodell aus Transformer, Mamba und Mixture-of-Experts

    Ein Forschungsteam stellt Jamba vor, ein großes Basis-Sprachmodell mit einer neuartigen Hybrid-Architektur. Das Modell verzahnt Transformer- und Mamba-Schichten und ergänzt diese teilweise durch Mixture-of-Experts (MoE). Die vorgestellte Konfiguration passt auf eine einzelne 80-GB-GPU und unterstützt Kontextlängen von bis zu 256.000 Token.

    KI & AI· Forschung

  • Link:inclusionAI

    Ling-3.0-tiny: Leichtes hybrides Reasoning-MoE-Modell von inclusionAI

    inclusionAI hat Ling-3.0-tiny veröffentlicht, ein leichtgewichtiges MoE-Modell mit 7,9 Milliarden Gesamtparametern, das pro Token nur 1,3 Milliarden Parameter aktiviert. Das Modell setzt auf eine hybride Architektur aus linearen Aufmerksamkeits- und Latent-Attention-Schichten und zielt auf recheneffizientes Reasoning sowie Agenten-Aufgaben auf lokaler Hardware ab.

    KI & AI· Tool

  • Link:Qwen

    Qwen3.8-27B: Multimodales 27B-Modell mit Hybrid-Architektur und Denkmodus

    Das Qwen-Team hat mit Qwen3.8-27B ein kompaktes, dichtes Vision-Language-Modell unter der Apache-2.0-Lizenz veröffentlicht. Das 27-Milliarden-Parameter-Modell kombiniert Gated DeltaNet mit regulärer Attention, versteht Bilder sowie Videos und bietet flexible Steuerungsmöglichkeiten für Denkprozesse.

    KI & AI· Sammlung

Lassen Sie uns über Ihr Projekt sprechen

Standorte

  • Mattersburg
    Johann Nepomuk Bergerstraße 7/2/14
    7210 Mattersburg, Austria
  • Wien
    Ungargasse 64-66/3/404
    1030 Wien, Austria

Dieser Inhalt wurde teilweise mithilfe von KI erstellt.