Neuronale maschinelle Übersetzung seltener Wörter mittels Subword-Einheiten

ArtikelRico Sennrich, Barry Haddow, Alexandra BirchForschung

Rico Sennrich, Barry Haddow und Alexandra Birch stellen eine Methode vor, mit der neuronale Übersetzungssysteme seltene und unbekannte Wörter durch Subword-Einheiten verarbeiten können. Statt auf ein festes Vokabular mit Wörterbuch-Rückfallebene zu setzen, nutzt das Verfahren Segmentierungen wie Byte Pair Encoding (BPE), um ein offenes Vokabular zu ermöglichen.

Das Wichtigste

  1. Herkömmliche NMT-Modelle nutzen feste Vokabulare und greifen bei unbekannten Wörtern meist auf Wörterbücher zurück.
  2. Die Autoren zerlegen seltene und unbekannte Wörter in Folgen kleinerer Einheiten (Subwords).
  3. Grundlage ist die Beobachtung, dass Namen, Wortzusammensetzungen, Lehnwörter und Kognaten über kleinere Einheiten wie Morpheme oder Zeichenfolgen übersetzbar sind.
  4. Untersucht werden Segmentierungstechniken wie Zeichen-N-Gramme und der Kompressionsalgorithmus Byte Pair Encoding (BPE).
  5. Auf den WMT-15-Datensätzen übertrifft der Subword-Ansatz das Wörterbuch-Fallback um 1,1 BLEU (Englisch-Deutsch) und 1,3 BLEU (Englisch-Russisch).

Warum das relevant ist

Die Zerlegung von Wörtern in Subword-Einheiten via Byte Pair Encoding löst das Problem von Out-of-Vocabulary-Wörtern elegant und bildet das methodische Fundament moderner Tokenizer in der Computerlinguistik und bei Sprachmodellen.

Einordnung

Das Paper zeigt, dass die Repräsentation von Sprache nicht an starren Wortgrenzen festhalten muss, um semantische und morphologische Strukturen korrekt zu erfassen. Die Autoren weisen nach, dass BPE empirisch messbare Qualitätssteigerungen liefert, ohne zusätzliche externe Ressourcen wie Nachschlagewerke zu benötigen.

Gefunden in

Zusammenfassung von KI erstellt (Gemini 3.8 Flash, 27. September 2026). Sie kann Fehler enthalten – maßgeblich ist die Originalquelle.

Inhaltlich ähnlich, ermittelt über die KI-Suche.

  • Artikel:Wikipedia contributors

    Byte-Pair Encoding: Von der Datenkompression zur LLM-Tokenisierung

    Byte-Pair Encoding (BPE), ursprünglich 1994 von Philip Gage als Algorithmus zur Datenkompression vorgestellt, bildet in modifizierter Form das Fundament moderner Tokenizer für große Sprachmodelle (LLMs). Anstelle maximaler Kompression erzeugt die LLM-Variante ein fest definiertes Token-Vokabular durch schrittweises Zusammenführen häufiger n-Gramme.

    KI & AI· Sammlung

  • Artikel:Yonghui Wu, Mike Schuster, Zhifeng Chen, et al.

    Google stellt GNMT vor: Neuronale maschinelle Übersetzung für den Produktiveinsatz

    In einer Forschungsarbeit beschreiben Forschende von Google das neuronale Übersetzungssystem GNMT (Google's Neural Machine Translation). Es adressiert zentrale Nachteile bisheriger NMT-Modelle wie hohen Rechenaufwand im Training, langsame Inferenz und Schwächen bei seltenen Wörtern.

    KI & AI· Forschung

  • Artikel:Tomas Mikolov, Kai Chen, Greg Corrado, Jeffrey Dean

    Effiziente Berechnung von Wortvektoren in großen Datensätzen

    Ein Forschungsteam um Tomas Mikolov stellt zwei neue Modellarchitekturen vor, um kontinuierliche Vektor-Repräsentationen von Wörtern aus sehr großen Textmengen effizient zu berechnen. Der Ansatz erzielt höhere Genauigkeit bei deutlich reduziertem Rechenaufwand im Vergleich zu früheren neuronalen Netzen.

    KI & AI· Forschung

  • Artikel:Ashish Vaswani, Noam Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan N. Gomez, Lukasz Kaiser, Illia Polosukhin

    Attention Is All You Need: Die Transformer-Architektur

    Die Autoren stellen mit dem Transformer eine Netzwerkarchitektur vor, die vollständig auf Rekurrenz und Faltungen verzichtet und stattdessen ausschließlich auf Aufmerksamkeitsmechanismen setzt.

    KI & AI· Forschung

  • Artikel:Tomas Mikolov, Ilya Sutskever, Kai Chen, Greg Corrado, Jeffrey Dean

    Erweiterungen des Skip-Gram-Modells für Wörter und Phrasen

    Die Autoren stellen Erweiterungen für das kontinuierliche Skip-Gram-Modell vor, um Trainingsgeschwindigkeit und Vektorqualität zu optimieren. Vorgestellt werden das Subsampling häufiger Wörter, Negative Sampling als Alternative zu Hierarchical Softmax sowie eine Methode zur Vektordarstellung idiomatrischer Phrasen.

    KI & AI· Forschung

Lassen Sie uns über Ihr Projekt sprechen

Standorte

  • Mattersburg
    Johann Nepomuk Bergerstraße 7/2/14
    7210 Mattersburg, Austria
  • Wien
    Ungargasse 64-66/3/404
    1030 Wien, Austria

Dieser Inhalt wurde teilweise mithilfe von KI erstellt.