Transformer-Architektur: Grundlagen und historische Entwicklung im Deep Learning

ArtikelWikipedia contributorsSammlung

Der Wikipedia-Artikel fasst den Aufbau und die historische Entstehung von Transformer-Modellen zusammen. Die Architektur basiert auf Multi-Head-Attention und verzichtet vollständig auf rekurrente Schichten, was paralleles Training auf Grafikprozessoren ermöglicht.

Das Wichtigste

  1. Eingabedaten (Text, Bild, Audio) werden in Tokens zerlegt, über Embeddings in Vektoren überführt und mittels Positionskodierungen ergänzt, da Self-Attention permutationsinvariant ist.
  2. Die Multi-Head-Attention berechnet Abhängigkeiten aller Tokens innerhalb des Kontextfensters parallel, skaliert jedoch quadratisch zur Kontextlänge.
  3. Im Vergleich zu RNNs und LSTMs entfällt die sequentielle Abarbeitung, was den Trainingsaufwand drastisch reduziert.
  4. Historisch bauten Transformer auf Konzepten wie LSTMs, Fast-Weight-Controllern und Seq2seq-Modellen mit Aufmerksamkeitsmechanismen auf, bevor Google 2017 'Attention Is All You Need' veröffentlichte.
  5. Moderne Architekturen unterteilen sich typischerweise in Encoder-Only, Decoder-Only und Encoder-Decoder-Varianten.

Warum das relevant ist

Transformer bilden das fundamentale Gerüst moderner KI-Systeme, darunter Large Language Models wie GPT und BERT sowie Vision- und Audio-Modelle. Das Verständnis ihrer Funktionsweise und Ursprünge ist essenziell für die Bewertung moderner KI-Technologien.

Einordnung

Der Text zeichnet den Übergang von schwer parallelisierbaren, sequentiellen Rekurrenzen (RNN, LSTM) hin zu rein aufmerksamkeitsbasierten Netzen nach. Während frühe Seq2seq-Ansätze an Bottlenecks fester Vektoren litten, lösten Aufmerksamkeitsmechanismen diesen Flaschenhals, behielten aber zunächst rekurrente Strukturen bei. Erst das vollständige Ersetzen von Rekurrenz durch parallele Self-Attention ermöglichte das Skalieren auf moderne Modellgrößen, bringt jedoch quadratische Rechenkosten bezüglich des Kontextfensters mit sich.

Gefunden in

Zusammenfassung von KI erstellt (Gemini 3.8 Flash, 27. September 2026). Sie kann Fehler enthalten – maßgeblich ist die Originalquelle.

Inhaltlich ähnlich, ermittelt über die KI-Suche.

  • Artikel:Ashish Vaswani, Noam Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan N. Gomez, Lukasz Kaiser, Illia Polosukhin

    Attention Is All You Need: Die Transformer-Architektur

    Die Autoren stellen mit dem Transformer eine Netzwerkarchitektur vor, die vollständig auf Rekurrenz und Faltungen verzichtet und stattdessen ausschließlich auf Aufmerksamkeitsmechanismen setzt.

    KI & AI· Forschung

  • Artikel:Maximilian Beck, Korbinian Pöppel, Markus Spanring, Andreas Auer, Oleksandra Prudnikova, Michael Kopp, Günter Klambauer, Johannes Brandstetter, Sepp Hochreiter

    xLSTM: Extended Long Short-Term Memory

    Ein Forschungsteam um Sepp Hochreiter stellt xLSTM vor, eine Weiterentwicklung der klassischen Long Short-Term Memory-Architektur für moderne Large Language Models. Die Erweiterung behebt bisherige Skalierungs- und Parallelisierungsgrenzen von LSTMs und erzielt vergleichbare Ergebnisse zu Transformer- und State-Space-Modellen.

    KI & AI· Forschung

  • Video

    Video:CURT

    Funktionsweise von LLMs von Grund auf: Neuronale Netze, Tokenisierung und Transformer

    In einer detaillierten Übersicht mit begleitenden Codebeispielen erklärt CJ die Funktionsweise moderner Sprachmodelle. Er zeichnet die Entwicklung von regelbasierten Chatbots bis hin zu Transformern nach und demonstriert schrittweise Neuronale Netze, Byte Pair Encoding sowie Vektor-Embeddings.

    KI & AI· Anleitung

  • Artikel:Albert Gu, Tri Dao

    Mamba: Lineare Sequenzmodellierung mit selektiven Zustandsräumen

    Albert Gu und Tri Dao stellen mit Mamba eine Architektur vor, die auf selektiven State Space Models (SSMs) basiert. Das Modell skaliert linear mit der Sequenzlänge, verzichtet auf Attention-Mechanismen sowie MLP-Blöcke und übertrifft vergleichbare Transformer bei fünffachem Inferenzdurchsatz.

    KI & AI· Forschung

  • Artikel:Wikipedia contributors

    Byte-Pair Encoding: Von der Datenkompression zur LLM-Tokenisierung

    Byte-Pair Encoding (BPE), ursprünglich 1994 von Philip Gage als Algorithmus zur Datenkompression vorgestellt, bildet in modifizierter Form das Fundament moderner Tokenizer für große Sprachmodelle (LLMs). Anstelle maximaler Kompression erzeugt die LLM-Variante ein fest definiertes Token-Vokabular durch schrittweises Zusammenführen häufiger n-Gramme.

    KI & AI· Sammlung

  • Link:Subquadratic Inc.

    Subquadratic stellt SubQ vor: LLM-Architektur für Multi-Millionen-Token-Kontexte

    Das KI-Forschungsunternehmen Subquadratic hat mit SubQ ein Modell vorgestellt, das für die Verarbeitung von mehreren Millionen Tokens ausgelegt ist. Die Architektur nutzt ein proprietäres Verfahren namens Subquadratic Sparse Attention (SSA), um den Rechenaufwand bei sehr langen Kontexten im Vergleich zu herkömmlichen Transformer-Modellen drastisch zu reduzieren.

    KI & AI· Ankündigung

Lassen Sie uns über Ihr Projekt sprechen

Standorte

  • Mattersburg
    Johann Nepomuk Bergerstraße 7/2/14
    7210 Mattersburg, Austria
  • Wien
    Ungargasse 64-66/3/404
    1030 Wien, Austria

Dieser Inhalt wurde teilweise mithilfe von KI erstellt.