John Rupert Firth: Der Linguist hinter den Grundlagen moderner Word Embeddings

ArtikelWikipedia contributorsSammlung

Der britische Sprachwissenschaftler J. R. Firth (1890–1960) prägte die moderne Sprachverarbeitung maßgeblich mit dem Satz: „You shall know a word by the company it keeps“. Seine distributionssemantischen Konzepte bilden das theoretische Fundament für Vektordarstellungen wie Word2vec und GloVe im Natural Language Processing.

Das Wichtigste

  1. Firth war in den 1950er-Jahren die prägende Figur der britischen Linguistik und Begründer der sogenannten „London School“ an der SOAS.
  2. Sein Lehrsatz „You shall know a word by the company it keeps“ betonte die Abhängigkeit sprachlicher Bedeutung vom situativen Kontext und kollokationalen Nachbarschaften.
  3. Die Arbeiten zur Distributionssemantik inspirierten moderne Techniken des maschinellen Lernens, insbesondere dichte Vektoren (Word Embeddings wie Word2vec und GloVe).
  4. In der Phonologie verzichtete er auf reine Phonemmodelle zugunsten der Prosodieanalyse, einem Vorläufer der autosegmentalen Phonologie.
  5. Im Zweiten Weltkrieg entwickelte er Intensivtrainingsprogramme für das Abhören und Übersetzen japanischer Militärkommunikation für die RAF und Bletchley Park.

Warum das relevant ist

Moderne KI-Sprachmodelle basieren grundlegend auf der numerischen Repräsentation von Wörtern anhand ihrer statistischen Nachbarschaft. Firths linguistische Arbeiten aus den 1950er-Jahren lieferten die theoretische Basis für das Verständnis, wie Algorithmen semantische Zusammenhänge rein aus Kontextbeziehungen erfassen können.

Einordnung

Firths Ansatz des Polysystematismus und der Kontextgebundenheit brach mit rein formalistischen, linearen Sprachanalysen. Anstatt Wörter als isolierte logische Einheiten zu betrachten, definierte er Bedeutung über das Auftreten im Kontext. Diese Idee der Distributionssemantik schlug Jahrzehnte später die Brücke von der traditionellen Sprachwissenschaft zur modernen Informationstechnologie: Algorithmen wie Word2vec und moderne Transformer greifen genau dieses Prinzip auf, um semantische Räume zu spannen.

Gefunden in

Zusammenfassung von KI erstellt (Gemini 3.8 Flash, 27. September 2026). Sie kann Fehler enthalten – maßgeblich ist die Originalquelle.

Inhaltlich ähnlich, ermittelt über die KI-Suche.

  • Artikel:Tomas Mikolov, Kai Chen, Greg Corrado, Jeffrey Dean

    Effiziente Berechnung von Wortvektoren in großen Datensätzen

    Ein Forschungsteam um Tomas Mikolov stellt zwei neue Modellarchitekturen vor, um kontinuierliche Vektor-Repräsentationen von Wörtern aus sehr großen Textmengen effizient zu berechnen. Der Ansatz erzielt höhere Genauigkeit bei deutlich reduziertem Rechenaufwand im Vergleich zu früheren neuronalen Netzen.

    KI & AI· Forschung

  • Artikel:Wikipedia contributors

    Das Kontextprinzip in der Sprachphilosophie

    Das Kontextprinzip besagt, dass die Bedeutung eines Wortes niemals isoliert, sondern nur im Kontext eines Satzes bestimmt werden darf. Das von Gottlob Frege formulierte Prinzip zählt zu den Grundpfeilern der Sprachphilosophie und beeinflusste unter anderem Bertrand Russell und Ludwig Wittgenstein.

    Bildung· Sammlung

  • Artikel:Wikipedia contributors

    Byte-Pair Encoding: Von der Datenkompression zur LLM-Tokenisierung

    Byte-Pair Encoding (BPE), ursprünglich 1994 von Philip Gage als Algorithmus zur Datenkompression vorgestellt, bildet in modifizierter Form das Fundament moderner Tokenizer für große Sprachmodelle (LLMs). Anstelle maximaler Kompression erzeugt die LLM-Variante ein fest definiertes Token-Vokabular durch schrittweises Zusammenführen häufiger n-Gramme.

    KI & AI· Sammlung

  • Video

    Video:CURT

    Funktionsweise von LLMs von Grund auf: Neuronale Netze, Tokenisierung und Transformer

    In einer detaillierten Übersicht mit begleitenden Codebeispielen erklärt CJ die Funktionsweise moderner Sprachmodelle. Er zeichnet die Entwicklung von regelbasierten Chatbots bis hin zu Transformern nach und demonstriert schrittweise Neuronale Netze, Byte Pair Encoding sowie Vektor-Embeddings.

    KI & AI· Anleitung

  • Artikel:Rico Sennrich, Barry Haddow, Alexandra Birch

    Neuronale maschinelle Übersetzung seltener Wörter mittels Subword-Einheiten

    Rico Sennrich, Barry Haddow und Alexandra Birch stellen eine Methode vor, mit der neuronale Übersetzungssysteme seltene und unbekannte Wörter durch Subword-Einheiten verarbeiten können. Statt auf ein festes Vokabular mit Wörterbuch-Rückfallebene zu setzen, nutzt das Verfahren Segmentierungen wie Byte Pair Encoding (BPE), um ein offenes Vokabular zu ermöglichen.

    KI & AI· Forschung

  • Link:Melanie Lefkowitz

    Frank Rosenblatts Perzeptron: Wie ein Cornell-Forscher die Grundlagen moderner KI schuf

    Ein Rückblick der Cornell University beleuchtet das Leben und Werk von Frank Rosenblatt, der 1958 mit dem Perzeptron das erste künstliche neuronale Netzwerk vorstellte. Trotz heftiger Kritik seiner Zeitgenossen und des darauffolgenden KI-Winters bilden seine Algorithmen das Fundament moderner Deep-Learning-Systeme.

    KI & AI· News

Lassen Sie uns über Ihr Projekt sprechen

Standorte

  • Mattersburg
    Johann Nepomuk Bergerstraße 7/2/14
    7210 Mattersburg, Austria
  • Wien
    Ungargasse 64-66/3/404
    1030 Wien, Austria

Dieser Inhalt wurde teilweise mithilfe von KI erstellt.