Link:Xavier Glorot, Yoshua Bengio
Analyse der Trainingsschwierigkeiten bei tiefen Feedforward-Netzen
Die Forschungsarbeit von Xavier Glorot und Yoshua Bengio untersucht, warum herkömmlicher Gradientenabstieg bei zufälliger Initialisierung in tiefen neuronalen Netzen oft scheitert. Die Autoren analysieren den Einfluss von Aktivierungsfunktionen und der Dynamik von Gradienten über verschiedene Schichten hinweg und stellen ein neues Initialisierungsverfahren für deutlich schnellere Konvergenz vor.
Aus Video: Building an LLM from Scratch: Neural Networks, Tokenization, and Transformers
