Mamba: Lineare Sequenzmodellierung mit selektiven Zustandsräumen

ArtikelAlbert Gu, Tri DaoForschung

Albert Gu und Tri Dao stellen mit Mamba eine Architektur vor, die auf selektiven State Space Models (SSMs) basiert. Das Modell skaliert linear mit der Sequenzlänge, verzichtet auf Attention-Mechanismen sowie MLP-Blöcke und übertrifft vergleichbare Transformer bei fünffachem Inferenzdurchsatz.

Das Wichtigste

  1. Bisherige subquadratische Modelle scheiterten bei Sprachaufgaben oft an der fehlenden Fähigkeit zu inhaltsbasiertem Schließen.
  2. Mamba macht SSM-Parameter eingangsabhängig, wodurch das Modell Informationen tokenbasiert selektiv speichern oder verwerfen kann.
  3. Ein hardwareoptimierter paralleler Algorithmus im Rekurrent-Modus gleicht den Wegfall effizienter Faltungsoperationen aus.
  4. Die vereinfachte End-to-End-Architektur kommt ohne Attention-Module und ohne MLP-Blöcke aus.
  5. Mamba-3B übertrifft gleich große Transformer und erreicht bei Sprachmodellierung die Leistung doppelt so großer Transformer-Modelle.
  6. Das Modell erzielt Spitzenwerte in Sprache, Audio und Genomik und skaliert auf reale Sequenzen mit bis zu einer Million Tokens.

Warum das relevant ist

Klassische Transformer erfordern bei langen Kontexten einen quadratischen Rechenaufwand. Mamba bietet eine lineare Alternative mit hoher Inferenzgeschwindigkeit, die auch bei extrem langen Sequenzen leistungsfähig bleibt.

Einordnung

Die Autoren identifizieren das fehlende inhaltsbasierte Filtern als Kernproblem bisheriger SSMs und subquadratischer Ansätze. Indem Mamba Selektivität direkt in die Zustandsräume integriert und dies mit hardwarenaher Parallelisierung koppelt, zeigt die Arbeit, dass rekurrente Zustandsraummodelle bei komplexen Sprachaufgaben gleichwertig oder überlegen zu Attention-Architekturen sein können.

Gefunden in

Zusammenfassung von KI erstellt (Gemini 3.8 Flash, 27. September 2026). Sie kann Fehler enthalten – maßgeblich ist die Originalquelle.

Inhaltlich ähnlich, ermittelt über die KI-Suche.

  • Artikel:Opher Lieber, Barak Lenz, Hofit Bata et al.

    Jamba: Hybrides Sprachmodell aus Transformer, Mamba und Mixture-of-Experts

    Ein Forschungsteam stellt Jamba vor, ein großes Basis-Sprachmodell mit einer neuartigen Hybrid-Architektur. Das Modell verzahnt Transformer- und Mamba-Schichten und ergänzt diese teilweise durch Mixture-of-Experts (MoE). Die vorgestellte Konfiguration passt auf eine einzelne 80-GB-GPU und unterstützt Kontextlängen von bis zu 256.000 Token.

    KI & AI· Forschung

  • Artikel:Maximilian Beck, Korbinian Pöppel, Markus Spanring, Andreas Auer, Oleksandra Prudnikova, Michael Kopp, Günter Klambauer, Johannes Brandstetter, Sepp Hochreiter

    xLSTM: Extended Long Short-Term Memory

    Ein Forschungsteam um Sepp Hochreiter stellt xLSTM vor, eine Weiterentwicklung der klassischen Long Short-Term Memory-Architektur für moderne Large Language Models. Die Erweiterung behebt bisherige Skalierungs- und Parallelisierungsgrenzen von LSTMs und erzielt vergleichbare Ergebnisse zu Transformer- und State-Space-Modellen.

    KI & AI· Forschung

  • Artikel:Kimi Team (Yu Zhang et al.)

    Kimi Linear: Hybride lineare Attention-Architektur übertrifft Full Attention

    Das Kimi-Team stellt Kimi Linear vor, eine hybride lineare Attention-Architektur, die Full Attention in Tests über kurze und lange Kontexte sowie im RL-Scaling übertrifft. Sie senkt den KV-Cache-Bedarf um bis zu 75 Prozent und steigert den Decoding-Durchsatz bei Kontexten von 1 Million Token um das bis zu Sechsfache.

    KI & AI· Forschung

  • Link:Subquadratic Inc.

    Subquadratic stellt SubQ vor: LLM-Architektur für Multi-Millionen-Token-Kontexte

    Das KI-Forschungsunternehmen Subquadratic hat mit SubQ ein Modell vorgestellt, das für die Verarbeitung von mehreren Millionen Tokens ausgelegt ist. Die Architektur nutzt ein proprietäres Verfahren namens Subquadratic Sparse Attention (SSA), um den Rechenaufwand bei sehr langen Kontexten im Vergleich zu herkömmlichen Transformer-Modellen drastisch zu reduzieren.

    KI & AI· Ankündigung

  • Artikel:Ashish Vaswani, Noam Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan N. Gomez, Lukasz Kaiser, Illia Polosukhin

    Attention Is All You Need: Die Transformer-Architektur

    Die Autoren stellen mit dem Transformer eine Netzwerkarchitektur vor, die vollständig auf Rekurrenz und Faltungen verzichtet und stattdessen ausschließlich auf Aufmerksamkeitsmechanismen setzt.

    KI & AI· Forschung

  • Artikel:Wikipedia contributors

    Transformer-Architektur: Grundlagen und historische Entwicklung im Deep Learning

    Der Wikipedia-Artikel fasst den Aufbau und die historische Entstehung von Transformer-Modellen zusammen. Die Architektur basiert auf Multi-Head-Attention und verzichtet vollständig auf rekurrente Schichten, was paralleles Training auf Grafikprozessoren ermöglicht.

    KI & AI· Sammlung

Lassen Sie uns über Ihr Projekt sprechen

Standorte

  • Mattersburg
    Johann Nepomuk Bergerstraße 7/2/14
    7210 Mattersburg, Austria
  • Wien
    Ungargasse 64-66/3/404
    1030 Wien, Austria

Dieser Inhalt wurde teilweise mithilfe von KI erstellt.