xLSTM: Extended Long Short-Term Memory

ArtikelMaximilian Beck, Korbinian Pöppel, Markus Spanring, Andreas Auer, Oleksandra Prudnikova, Michael Kopp, Günter Klambauer, Johannes Brandstetter, Sepp HochreiterForschung

Ein Forschungsteam um Sepp Hochreiter stellt xLSTM vor, eine Weiterentwicklung der klassischen Long Short-Term Memory-Architektur für moderne Large Language Models. Die Erweiterung behebt bisherige Skalierungs- und Parallelisierungsgrenzen von LSTMs und erzielt vergleichbare Ergebnisse zu Transformer- und State-Space-Modellen.

Das Wichtigste

  1. Einführung von exponentiellem Gating samt Normalisierungs- und Stabilisierungstechniken.
  2. Entwicklung von sLSTM mit skalarem Speicher, skalarer Aktualisierung und neuem Memory Mixing.
  3. Entwicklung von mLSTM mit Matrixspeicher und Kovarianz-Update-Regel, wodurch vollständige Parallelisierbarkeit erreicht wird.
  4. Integration in Residual-Blöcke (xLSTM-Blöcke), die sich zu xLSTM-Architekturen stapeln lassen.
  5. Skalierung auf Milliarden von Parametern bei konkurrenzfähiger Performance im Vergleich zu modernen Transformern und State Space Models.

Warum das relevant ist

Die Transformer-Architektur dominiert moderne Sprachmodelle vor allem durch ihre einfache Parallelisierbarkeit beim Training. xLSTM zeigt, dass rekurrente Architekturen durch Matrixspeicher und exponentielles Gating wettbewerbsfähig skaliert werden können und eine valide Alternative zu Transformern und SSMs darstellen.

Einordnung

Das Papier greift die Kernschwächen historischer LSTMs auf: mangelnde Parallelisierbarkeit und begrenzte Speicherkapazität im Hidden State. Durch den Matrixspeicher in mLSTM und exponentielles Gating gelingt der Schritt zu modernen Milliarden-Parameter-Modellen. Die Autoren behaupten, damit sowohl bei Skalierungseigenschaften als auch bei der Inferenzleistung mit aktuellen Architekturen Schritt zu halten.

Gefunden in

Zusammenfassung von KI erstellt (Gemini 3.8 Flash, 27. September 2026). Sie kann Fehler enthalten – maßgeblich ist die Originalquelle.

Inhaltlich ähnlich, ermittelt über die KI-Suche.

  • Artikel:Albert Gu, Tri Dao

    Mamba: Lineare Sequenzmodellierung mit selektiven Zustandsräumen

    Albert Gu und Tri Dao stellen mit Mamba eine Architektur vor, die auf selektiven State Space Models (SSMs) basiert. Das Modell skaliert linear mit der Sequenzlänge, verzichtet auf Attention-Mechanismen sowie MLP-Blöcke und übertrifft vergleichbare Transformer bei fünffachem Inferenzdurchsatz.

    KI & AI· Forschung

  • Artikel:Wikipedia contributors

    Transformer-Architektur: Grundlagen und historische Entwicklung im Deep Learning

    Der Wikipedia-Artikel fasst den Aufbau und die historische Entstehung von Transformer-Modellen zusammen. Die Architektur basiert auf Multi-Head-Attention und verzichtet vollständig auf rekurrente Schichten, was paralleles Training auf Grafikprozessoren ermöglicht.

    KI & AI· Sammlung

  • Artikel:Opher Lieber, Barak Lenz, Hofit Bata et al.

    Jamba: Hybrides Sprachmodell aus Transformer, Mamba und Mixture-of-Experts

    Ein Forschungsteam stellt Jamba vor, ein großes Basis-Sprachmodell mit einer neuartigen Hybrid-Architektur. Das Modell verzahnt Transformer- und Mamba-Schichten und ergänzt diese teilweise durch Mixture-of-Experts (MoE). Die vorgestellte Konfiguration passt auf eine einzelne 80-GB-GPU und unterstützt Kontextlängen von bis zu 256.000 Token.

    KI & AI· Forschung

  • Repository:test-time-training/e2e

    End-to-End Test-Time Training (TTT) für lange Kontexte in JAX

    Dieses Repository enthält die offizielle JAX-Implementierung für End-to-End Test-Time Training (TTT) für lange Kontexte. Der Ansatz modelliert die Verarbeitung langer Kontexte als Continual-Learning-Problem: Ein Standard-Transformer mit Sliding-Window-Attention passt seine Gewichte zur Testzeit via Next-Token-Prediction an und komprimiert den Kontext direkt in die Parameter.

    693SternePython

    KI & AI· Forschung

  • Artikel:Kimi Team (Yu Zhang et al.)

    Kimi Linear: Hybride lineare Attention-Architektur übertrifft Full Attention

    Das Kimi-Team stellt Kimi Linear vor, eine hybride lineare Attention-Architektur, die Full Attention in Tests über kurze und lange Kontexte sowie im RL-Scaling übertrifft. Sie senkt den KV-Cache-Bedarf um bis zu 75 Prozent und steigert den Decoding-Durchsatz bei Kontexten von 1 Million Token um das bis zu Sechsfache.

    KI & AI· Forschung

  • Artikel:Ashish Vaswani, Noam Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan N. Gomez, Lukasz Kaiser, Illia Polosukhin

    Attention Is All You Need: Die Transformer-Architektur

    Die Autoren stellen mit dem Transformer eine Netzwerkarchitektur vor, die vollständig auf Rekurrenz und Faltungen verzichtet und stattdessen ausschließlich auf Aufmerksamkeitsmechanismen setzt.

    KI & AI· Forschung

Lassen Sie uns über Ihr Projekt sprechen

Standorte

  • Mattersburg
    Johann Nepomuk Bergerstraße 7/2/14
    7210 Mattersburg, Austria
  • Wien
    Ungargasse 64-66/3/404
    1030 Wien, Austria

Dieser Inhalt wurde teilweise mithilfe von KI erstellt.