End-to-End Test-Time Training (TTT) für lange Kontexte in JAX

Repositorytest-time-training/e2eForschung

Dieses Repository enthält die offizielle JAX-Implementierung für End-to-End Test-Time Training (TTT) für lange Kontexte. Der Ansatz modelliert die Verarbeitung langer Kontexte als Continual-Learning-Problem: Ein Standard-Transformer mit Sliding-Window-Attention passt seine Gewichte zur Testzeit via Next-Token-Prediction an und komprimiert den Kontext direkt in die Parameter.

Das Wichtigste

  1. Formulierung von Long-Context-Modellierung als Continual Learning statt als reine Architekturänderung.
  2. Verwendung einer Standard-Transformer-Architektur mit Sliding-Window-Attention.
  3. Kontextkompression zur Testzeit durch Next-Token-Prediction auf dem vorliegenden Kontext.
  4. Meta-Learning während der Trainingsphase optimiert die Initialisierung für das Test-Time Training.
  5. Vollständige Implementierung in JAX mit Paketmanagement über uv und Experimentverwaltung über Hydra.

Warum das relevant ist

Anstatt Kontextfenster über immer größere Attention-Matrizen oder spezialisierte Architekturen zu erweitern, zeigt dieses Verfahren, wie Modelle Informationen zur Inferenzzeit dynamisch in ihre Gewichte schreiben können. Das verbindet Meta-Learning mit praktischer Kontexterweiterung.

Einordnung

Das Projekt adressiert die Skalierung von Sprachmodellen auf lange Kontexte. Statt neuer Architekturen wird Continual Learning genutzt: Das Modell lernt zur Testzeit end-to-end über Next-Token-Prediction weiter. Die Codebasis setzt auf JAX, Python (verwaltet mit uv), Hydra für Konfigurationen, Weights & Biases für Metriken sowie Slurm/Submitit für Multi-Node-Cluster. Als Datensätze dienen Llama-3-tokenisierte Daten (z. B. dclm-filter-8k und books3). Die Zielgruppe sind Forschende und ML-Engineers im Bereich LLM-Architekturen und Test-Time Adaptation. Der Reifegrad entspricht einer universitären Forschungs-Codebasis zur Reproduktion der Paper-Ergebnisse (inklusive 125M-Modell-Konfigurationen); eine explizite Open-Source-Lizenz ist nicht angegeben.

Gefunden in

Zusammenfassung von KI erstellt (Gemini 3.8 Flash, 27. September 2026). Sie kann Fehler enthalten – maßgeblich ist die Originalquelle.

Inhaltlich ähnlich, ermittelt über die KI-Suche.

  • Artikel:Maximilian Beck, Korbinian Pöppel, Markus Spanring, Andreas Auer, Oleksandra Prudnikova, Michael Kopp, Günter Klambauer, Johannes Brandstetter, Sepp Hochreiter

    xLSTM: Extended Long Short-Term Memory

    Ein Forschungsteam um Sepp Hochreiter stellt xLSTM vor, eine Weiterentwicklung der klassischen Long Short-Term Memory-Architektur für moderne Large Language Models. Die Erweiterung behebt bisherige Skalierungs- und Parallelisierungsgrenzen von LSTMs und erzielt vergleichbare Ergebnisse zu Transformer- und State-Space-Modellen.

    KI & AI· Forschung

  • Repository:hhhuang/CAG

    Cache-Augmented Generation (CAG): Alternative zu RAG über KV-Caching

    Das Open-Source-Repository CAG stellt Cache-Augmented Generation als schlanke Alternative zu Retrieval-Augmented Generation (RAG) vor. Statt Dokumente zur Laufzeit über Vektordatenbanken abzurufen, wird der gesamte Wissensbestand vorab in das Kontextfenster geladen und als KV-Cache vorgehalten.

    1540SternePython

    KI & AI· Sammlung

  • Artikel:Opher Lieber, Barak Lenz, Hofit Bata et al.

    Jamba: Hybrides Sprachmodell aus Transformer, Mamba und Mixture-of-Experts

    Ein Forschungsteam stellt Jamba vor, ein großes Basis-Sprachmodell mit einer neuartigen Hybrid-Architektur. Das Modell verzahnt Transformer- und Mamba-Schichten und ergänzt diese teilweise durch Mixture-of-Experts (MoE). Die vorgestellte Konfiguration passt auf eine einzelne 80-GB-GPU und unterstützt Kontextlängen von bis zu 256.000 Token.

    KI & AI· Forschung

  • Repository:drumih/turbo-fieldfare

    TurboFieldfare: Gemma 4 26B-A4B mit 2 GB RAM auf Apple Silicon

    TurboFieldfare ist eine spezialisierte Swift- und Metal-Laufzeitumgebung, die das Sprachmodell Gemma 4 26B-A4B auf Apple-Silicon-Macs mit nur etwa 2 GB RAM ausführt. Statt das gesamte 14,3 GB große Modell im Arbeitsspeicher zu halten, verbleiben nur der 1,35 GB große Kern sowie der KV-Cache im RAM, während benötigte Experten-Layer dynamisch per SSD-Streaming nachgeladen werden.

    6609SterneSwift

    KI & AI· Tool

  • Link:Z.ai

    Z.ai veröffentlicht GLM-5.2 mit 1M-Kontext und MIT-Lizenz

    Z.ai hat das Flaggschiff-Modell GLM-5.2 auf Hugging Face unter der freien MIT-Lizenz bereitgestellt. Das Modell zielt auf komplexe Coding- und Agentic-Workflows ab und bietet ein stabiles Kontextfenster von einer Million Tokens. Durch Architekturverbesserungen wie IndexShare und einen optimierten MTP-Layer wurden Rechenaufwand gesenkt und Inferenzzeiten verkürzt.

    KI & AI· Sammlung

  • Repository:OSU-NLP-Group/HippoRAG

    HippoRAG 2: Neurobiologisch inspiriertes Gedächtnis-Framework für LLMs

    HippoRAG (mittlerweile in Version 2) ist ein Open-Source-Framework für Large Language Models, das durch Wissensgraphen und Personalized PageRank Verbindungen zwischen externen Dokumenten knüpft und an das menschliche Langzeitgedächtnis angelehnt ist.

    3980SternePython

    KI & AI· Forschung

Lassen Sie uns über Ihr Projekt sprechen

Standorte

  • Mattersburg
    Johann Nepomuk Bergerstraße 7/2/14
    7210 Mattersburg, Austria
  • Wien
    Ungargasse 64-66/3/404
    1030 Wien, Austria

Dieser Inhalt wurde teilweise mithilfe von KI erstellt.