Artikel:Wikipedia contributors
Transformer-Architektur: Grundlagen und historische Entwicklung im Deep Learning
Der Wikipedia-Artikel fasst den Aufbau und die historische Entstehung von Transformer-Modellen zusammen. Die Architektur basiert auf Multi-Head-Attention und verzichtet vollständig auf rekurrente Schichten, was paralleles Training auf Grafikprozessoren ermöglicht.