Von GPT-2 zu Kimi K3: Analyse der Architektur-Evolution hinter 2,8 Billionen Parametern

X-PostAYiDiskussion

Ein viraler Thread analysiert den technischen Werdegang von GPT-2 bis zum Open-Source-Modell Kimi K3 von Moonshot AI. Die Gegenüberstellung zeigt, wie Innovationen von linearer Attention bis zu DeltaNet konkrete Flaschenhälse klassischer Transformer lösen.

Das Wichtigste

  1. Kimi K3 umfasst rund 2,8 Billionen Parameter und entspricht rechnerisch etwa 22.580 GPT-2-Modellen (124M aus 2019).
  2. Baseten-Ingenieur Ali rekonstruierte die Architektur-Evolution: Standard-Softmax, Linear Attention, DeltaNet, Gated DeltaNet bis hin zur KDA-Attention von Kimi.
  3. Klassische Transformer kämpfen mit exponentiellem KV-Cache-Wachstum und Speicherbandbreiten-Engpässen beim autoregressiven Decoding.
  4. Linear Attention reduziert die Komplexität durch feature-basiertes Zusammenfassen in feste Zustände, leidet aber unter Informationsüberlagerung.
  5. DeltaNet löst dieses Problem durch selektives Löschen und Überschreiben bestehender Assoziationen anstelle rein additiver Updates.
  6. AYi hebt hervor, dass die Veröffentlichung des Codes es der Community ermöglicht, komplexe Architekturdetails sofort transparent aufzuschlüsseln.

Warum das relevant ist

Die Modellentwicklung über sieben Jahre hinweg beruht nicht nur auf schierer Skalierung, sondern auf der schrittweisen Behebung fundamentaler Speicher- und Berechnungsengpässe in Transformer-Architekturen. Open-Source-Veröffentlichungen großer Spitzenmodelle beschleunigen das kollektive Verständnis dieser Mechanismen drastisch.

Einordnung

Die Untersuchung verdeutlicht den Übergang von rein skalierten Decodern zu modernen Hybrid- und Recurrence-Architekturen. Während GPT-2 auf Standard-Attention mit quadratischer Komplexität und stark wachsendem KV-Cache setzte, adressiert K3 die Speicherbegrenzungen durch fortgeschrittene Rekurrenz- und Aufmerksamkeitsmuster. DeltaNet und KDA-Mechanismen zeigen, wie finite Speichermatrizen dynamisch aktualisiert werden können, um Assoziationen gezielt zu verwalten, ohne den Rechenaufwand unkontrolliert anwachsen zu lassen.

Original-Post

AYi

@AYi_AInotes · 28. Juli 2026

这是@Kimi_Moonshot K3开源后我见过最狠的帖子。 一个Baseten的工程师,@waterloo_intern 老哥花48小时喝了40罐气泡水,把K3的建模代码扒了个底朝天。 128万浏览,6000多收藏, 最后得出一个结论, 一个K3里能塞下22580个2019年的GPT-2, 七年时间参数涨了两万两千多倍, 但这根本不是堆参数堆出来的。 t.co/x6c4RidO8z t.co/zOO0KonyjD

2263 Likes58 Antworten1878 Lesezeichen401.994 Aufrufe

Auf X ansehen

Zusammenfassung von KI erstellt (Gemini 3.8 Flash, 27. September 2026). Sie kann Fehler enthalten – maßgeblich ist die Originalquelle.

Inhaltlich ähnlich, ermittelt über die KI-Suche.

  • Artikel:Kimi Team (Yu Zhang et al.)

    Kimi Linear: Hybride lineare Attention-Architektur übertrifft Full Attention

    Das Kimi-Team stellt Kimi Linear vor, eine hybride lineare Attention-Architektur, die Full Attention in Tests über kurze und lange Kontexte sowie im RL-Scaling übertrifft. Sie senkt den KV-Cache-Bedarf um bis zu 75 Prozent und steigert den Decoding-Durchsatz bei Kontexten von 1 Million Token um das bis zu Sechsfache.

    KI & AI· Forschung

  • Repository:PipeNetwork/kimi-k3-mlx

    kimi-k3-mlx: Portierung des 2,78-Billionen-Parameter-MoE-Modells für Apple Silicon

    kimi-k3-mlx portiert Moonshots multimodales Kimi-K3-MoE-Modell (2,78 Billionen Parameter) auf Apples MLX-Framework. Da das Modell selbst im komprimierten Zustand zu groß für handelsübliche Apple-Silicon-Rechner ist, liefert das Projekt neben den Modell- und Vision-Wrappern einen Streaming-Konverter sowie Werkzeuge zum Pruning von Experten.

    337SternePython

    KI & AI· Tool

  • Artikel:Ju-yeong Ji, Ravin Kumar

    Gemma 3: Architektur, Multimodalität und Neuerungen im Detail

    Google erklärt die Neuerungen in Gemma 3. Die Modellreihe bringt Vision-Language-Funktionen, längere Kontextfenster, einen überarbeiteten Tokenizer sowie architektonische Anpassungen für effizientere KV-Cache-Nutzung.

    KI & AI· Sammlung

  • X-Post:wast3

    Memory Engineering: Warum Kontextfenster kein Gedächtnis sind

    Ein Entwickler stellt eine speicherbasierte Architektur für Kimi K3 vor, die Vektordatenbanken und riesige Kontextfenster durch ein Vier-Knoten-Modell mit automatischem Verfall ersetzt. Statt Informationen unbegrenzt aufzubewahren, müssen Fakten ihre Relevanz durch tatsächliche Weiternutzung verdienen.

    697Lesezeichen67.060Aufrufe

    KI & AI· Meinung

  • Artikel:Wikipedia contributors

    Transformer-Architektur: Grundlagen und historische Entwicklung im Deep Learning

    Der Wikipedia-Artikel fasst den Aufbau und die historische Entstehung von Transformer-Modellen zusammen. Die Architektur basiert auf Multi-Head-Attention und verzichtet vollständig auf rekurrente Schichten, was paralleles Training auf Grafikprozessoren ermöglicht.

    KI & AI· Sammlung

  • Repository:studio-dots-ai/dots3-note-prev

    dots3-note preview: Open-Weight MoE-Modell mit 280B Parametern und 512K Kontext

    Dots Studio hat mit dots3-note preview das erste Open-Weight-Modell der dots3-Reihe veröffentlicht. Die Mixture-of-Experts-Architektur kombiniert 280 Milliarden Gesamtparameter mit 16 Milliarden aktivierten Parametern und unterstützt multimodale Eingaben sowie bis zu 512.000 Kontext-Token.

    123Sterne

    KI & AI· Ankündigung

Lassen Sie uns über Ihr Projekt sprechen

Standorte

  • Mattersburg
    Johann Nepomuk Bergerstraße 7/2/14
    7210 Mattersburg, Austria
  • Wien
    Ungargasse 64-66/3/404
    1030 Wien, Austria

Dieser Inhalt wurde teilweise mithilfe von KI erstellt.