Subquadratic stellt SubQ vor: LLM-Architektur für Multi-Millionen-Token-Kontexte

LinkSubquadratic Inc.Ankündigung

Das KI-Forschungsunternehmen Subquadratic hat mit SubQ ein Modell vorgestellt, das für die Verarbeitung von mehreren Millionen Tokens ausgelegt ist. Die Architektur nutzt ein proprietäres Verfahren namens Subquadratic Sparse Attention (SSA), um den Rechenaufwand bei sehr langen Kontexten im Vergleich zu herkömmlichen Transformer-Modellen drastisch zu reduzieren.

Das Wichtigste

  1. Subquadratic Sparse Attention (SSA) isoliert relevante Beziehungen zwischen Tokens und verbraucht laut Anbieter bei 2 Millionen Tokens 128-mal weniger Rechenleistung als bisherige Frontier-Modelle.
  2. Das Modell zielt auf Anwendungsfälle wie vollständige Code-Repositories, mehrjährige Finanzberichte und Vertragsarchive ab, ohne dass Chunking oder Vektordatenbanken erforderlich sind.
  3. Im RULER-Benchmark (128K) erzielt SubQ 99,12 % und erreicht in Needle-in-a-Haystack-Tests bei 1 bis 2 Millionen Tokens 100 % sowie bei 6 bis 12 Millionen Tokens 98 %.
  4. Im Modellvergleich positioniert Subquadratic sein SubQ 1.1 Small auf GPQA Diamond (85,4 %), AutomationBench (13 %) und LiveCodeBench v6 (89,7 %).

Warum das relevant ist

Große Kontextfenster führten bei traditionellen Transformer-Modellen bisher zu extrem steigenden Rechen- und Betriebskosten oder erforderten fehleranfällige Vorverarbeitungsschritte wie Chunking und Vektorsuchen. Subquadratische Aufmerksamkeitsmechanismen könnten es ermöglichen, gesamte Codebasen oder umfangreiche Dokumentensammlungen in einer einzigen Eingabe stabil zu analysieren.

Einordnung

Subquadratic adressiert die strukturellen Nachteile klassischer quadratischer Aufmerksamkeitsmechanismen in LLMs. Anstatt auf inkrementelle Anpassungen bestehender Architekturen zu setzen, soll SSA Rechen- und Speichereffizienz bei extrem langen Sequenzen sicherstellen. Ob die theoretischen Einsparungen und Benchmarkergebnisse in komplexen Produktivumgebungen standhalten, muss sich nach der Vergabe des derzeitigen Early-Access-Zugangs in der Praxis zeigen.

Gefunden in

Zusammenfassung von KI erstellt (Gemini 3.8 Flash, 27. September 2026). Sie kann Fehler enthalten – maßgeblich ist die Originalquelle.

Inhaltlich ähnlich, ermittelt über die KI-Suche.

  • Artikel:Kimi Team (Yu Zhang et al.)

    Kimi Linear: Hybride lineare Attention-Architektur übertrifft Full Attention

    Das Kimi-Team stellt Kimi Linear vor, eine hybride lineare Attention-Architektur, die Full Attention in Tests über kurze und lange Kontexte sowie im RL-Scaling übertrifft. Sie senkt den KV-Cache-Bedarf um bis zu 75 Prozent und steigert den Decoding-Durchsatz bei Kontexten von 1 Million Token um das bis zu Sechsfache.

    KI & AI· Forschung

  • Artikel:Albert Gu, Tri Dao

    Mamba: Lineare Sequenzmodellierung mit selektiven Zustandsräumen

    Albert Gu und Tri Dao stellen mit Mamba eine Architektur vor, die auf selektiven State Space Models (SSMs) basiert. Das Modell skaliert linear mit der Sequenzlänge, verzichtet auf Attention-Mechanismen sowie MLP-Blöcke und übertrifft vergleichbare Transformer bei fünffachem Inferenzdurchsatz.

    KI & AI· Forschung

  • Link:Z.ai

    Z.ai veröffentlicht GLM-5.2 mit 1M-Kontext und MIT-Lizenz

    Z.ai hat das Flaggschiff-Modell GLM-5.2 auf Hugging Face unter der freien MIT-Lizenz bereitgestellt. Das Modell zielt auf komplexe Coding- und Agentic-Workflows ab und bietet ein stabiles Kontextfenster von einer Million Tokens. Durch Architekturverbesserungen wie IndexShare und einen optimierten MTP-Layer wurden Rechenaufwand gesenkt und Inferenzzeiten verkürzt.

    KI & AI· Sammlung

  • Link:Qwen

    Qwen3.8-27B: Multimodales 27B-Modell mit Hybrid-Architektur und Denkmodus

    Das Qwen-Team hat mit Qwen3.8-27B ein kompaktes, dichtes Vision-Language-Modell unter der Apache-2.0-Lizenz veröffentlicht. Das 27-Milliarden-Parameter-Modell kombiniert Gated DeltaNet mit regulärer Attention, versteht Bilder sowie Videos und bietet flexible Steuerungsmöglichkeiten für Denkprozesse.

    KI & AI· Sammlung

  • Link:Together AI

    Together AI stellt Qwen3.7-Max mit 1M Kontextfenster per API bereit

    Together AI bietet das proprietäre Flaggschiff-Modell Qwen3.7-Max über seine API an. Das Modell verfügt über ein Kontextfenster von einer Million Token und wurde speziell für autonome Agenten, Softwareentwicklung und lange Ausführungszeiten trainiert.

    KI & AI· Ankündigung

Lassen Sie uns über Ihr Projekt sprechen

Standorte

  • Mattersburg
    Johann Nepomuk Bergerstraße 7/2/14
    7210 Mattersburg, Austria
  • Wien
    Ungargasse 64-66/3/404
    1030 Wien, Austria

Dieser Inhalt wurde teilweise mithilfe von KI erstellt.