Jamba: Hybrides Sprachmodell aus Transformer, Mamba und Mixture-of-Experts

ArtikelOpher Lieber, Barak Lenz, Hofit Bata et al.Forschung

Ein Forschungsteam stellt Jamba vor, ein großes Basis-Sprachmodell mit einer neuartigen Hybrid-Architektur. Das Modell verzahnt Transformer- und Mamba-Schichten und ergänzt diese teilweise durch Mixture-of-Experts (MoE). Die vorgestellte Konfiguration passt auf eine einzelne 80-GB-GPU und unterstützt Kontextlängen von bis zu 256.000 Token.

Das Wichtigste

  1. Jamba kombiniert Transformer- und Mamba-Schichten abwechselnd in einer gemeinsamen Architektur.
  2. Mixture-of-Experts (MoE) in einzelnen Layern erhöht die Gesamtkapazität bei kontrollierter Anzahl aktiver Parameter.
  3. Die konkrete Referenzimplementierung lässt sich auf einer einzelnen 80-GB-GPU betreiben.
  4. Bietet im Vergleich zu reinen Transformer-Modellen höheren Durchsatz und einen kleineren Speicherbedarf.
  5. Erreicht starke Resultate bei langen Kontexten bis zu 256K Token.
  6. Modellgewichte werden unter einer permissiven Lizenz öffentlich zur Verfügung gestellt.

Warum das relevant ist

Klassische Transformer-Modelle stoßen bei langen Kontexten an speicher- und rechenintensive Grenzen. Durch die Kopplung linear skalierender Mamba-Zellen mit Attention-Mechanismen und MoE zeigt Jamba, wie extrem lange Kontexte ressourceneffizient auf Standard-Enterprise-GPUs verarbeitet werden können.

Einordnung

Das Forschungsteam untersucht systematisch, wie Transformer- und Mamba-Ebenen optimal verschachtelt und Expertenmodule integriert werden müssen. Die Ergebnisse belegen, dass die Hybrid-Architektur die Stärken beider Paradigmen vereint: hohe Benchmark-Leistung und Aufmerksamkeitsfähigkeit bei drastisch reduziertem KV-Cache- und Speicherbedarf. Die Veröffentlichung unter permissiver Lizenz sowie geplante Ablation-Checkpoints ermöglichen unabhängige Verifikation und Weiterentwicklung.

Gefunden in

Zusammenfassung von KI erstellt (Gemini 3.8 Flash, 27. September 2026). Sie kann Fehler enthalten – maßgeblich ist die Originalquelle.

Inhaltlich ähnlich, ermittelt über die KI-Suche.

  • Artikel:Albert Gu, Tri Dao

    Mamba: Lineare Sequenzmodellierung mit selektiven Zustandsräumen

    Albert Gu und Tri Dao stellen mit Mamba eine Architektur vor, die auf selektiven State Space Models (SSMs) basiert. Das Modell skaliert linear mit der Sequenzlänge, verzichtet auf Attention-Mechanismen sowie MLP-Blöcke und übertrifft vergleichbare Transformer bei fünffachem Inferenzdurchsatz.

    KI & AI· Forschung

  • Artikel:Kimi Team (Yu Zhang et al.)

    Kimi Linear: Hybride lineare Attention-Architektur übertrifft Full Attention

    Das Kimi-Team stellt Kimi Linear vor, eine hybride lineare Attention-Architektur, die Full Attention in Tests über kurze und lange Kontexte sowie im RL-Scaling übertrifft. Sie senkt den KV-Cache-Bedarf um bis zu 75 Prozent und steigert den Decoding-Durchsatz bei Kontexten von 1 Million Token um das bis zu Sechsfache.

    KI & AI· Forschung

  • Repository:inclusionAI/Ling

    Ling: Open-Source Mixture-of-Experts-Sprachmodelle von InclusionAI

    InclusionAI stellt mit Ling eine Open-Source-Modellfamilie auf Basis einer Mixture-of-Experts-Architektur (MoE) bereit. Die Modelle erscheinen in zwei Größen: Ling-lite (16,8 Milliarden Gesamtparameter, 2,75 Milliarden aktivierte Parameter) und Ling-plus (290 Milliarden Gesamtparameter, 28,8 Milliarden aktivierte Parameter).

    267SternePython

    KI & AI· Sammlung

  • Artikel:Maximilian Beck, Korbinian Pöppel, Markus Spanring, Andreas Auer, Oleksandra Prudnikova, Michael Kopp, Günter Klambauer, Johannes Brandstetter, Sepp Hochreiter

    xLSTM: Extended Long Short-Term Memory

    Ein Forschungsteam um Sepp Hochreiter stellt xLSTM vor, eine Weiterentwicklung der klassischen Long Short-Term Memory-Architektur für moderne Large Language Models. Die Erweiterung behebt bisherige Skalierungs- und Parallelisierungsgrenzen von LSTMs und erzielt vergleichbare Ergebnisse zu Transformer- und State-Space-Modellen.

    KI & AI· Forschung

  • Artikel:Nikita Pavlichenko

    JetBrains veröffentlicht Mellum2: 12B Mixture-of-Experts-Modell für Code und Text

    JetBrains hat Mellum2 vorgestellt, ein von Grund auf trainiertes Mixture-of-Experts-Modell mit insgesamt 12 Milliarden Parametern. Das Modell aktiviert pro Token lediglich 2,5 Milliarden Parameter, läuft unter der Apache-2.0-Lizenz und zielt auf latenzkritische Aufgaben in Entwicklungs- und KI-Pipelines ab.

    KI & AI· Ankündigung

  • Link:drumih

    TurboFieldfare: Gemma 4 26B mit nur 2 GB RAM auf Apple Silicon betreiben

    TurboFieldfare ist eine in Swift und Metal geschriebene Open-Source-Inference-Engine, die das 4-Bit-quantisierte Modell Gemma 4 26B-A4B-IT auf Apple M-Series Macs mit rund 2 GB Arbeitsspeicher ausführt. Da die Gewichte etwa 14 GB SSD-Speicher belegen, werden nur der gemeinsame Modellkern und der KV-Cache im RAM gehalten, während benötigte Experten pro Token direkt per Streaming von der SSD nachgeladen werden.

    KI & AI· Tool

Lassen Sie uns über Ihr Projekt sprechen

Standorte

  • Mattersburg
    Johann Nepomuk Bergerstraße 7/2/14
    7210 Mattersburg, Austria
  • Wien
    Ungargasse 64-66/3/404
    1030 Wien, Austria

Dieser Inhalt wurde teilweise mithilfe von KI erstellt.