Analyse der Trainingsschwierigkeiten bei tiefen Feedforward-Netzen

LinkXavier Glorot, Yoshua BengioForschung

Die Forschungsarbeit von Xavier Glorot und Yoshua Bengio untersucht, warum herkömmlicher Gradientenabstieg bei zufälliger Initialisierung in tiefen neuronalen Netzen oft scheitert. Die Autoren analysieren den Einfluss von Aktivierungsfunktionen und der Dynamik von Gradienten über verschiedene Schichten hinweg und stellen ein neues Initialisierungsverfahren für deutlich schnellere Konvergenz vor.

Das Wichtigste

  1. Klassische logistische Sigmoid-Aktivierungen sind für tiefe Netze mit Zufallsinitialisierung ungeeignet, da ihr Mittelwert vor allem oberste verdeckte Schichten in die Sättigung treibt.
  2. Gesättigte Einheiten können die Sättigung zwar selbstständig wieder verlassen, dies geschieht jedoch sehr langsam und erklärt typische Trainingsplateaus.
  3. Weniger stark sättigende Nichtlinearitäten wirken sich positiv auf den Trainingsverlauf aus.
  4. Das Training wird erschwert, wenn die Singulärwerte der Jacobimatrix der einzelnen Schichten stark von 1 abweichen.
  5. Ein neues, auf diesen Erkenntnissen basierendes Initialisierungsschema ermöglicht eine wesentlich schnellere Konvergenz.

Warum das relevant ist

Die Untersuchung liefert die mathematische und empirische Erklärung für das Scheitern früherer Trainingsansätze in tiefen Architekturen. Das daraus abgeleitete Verfahren, bekannt als Glorot- bzw. Xavier-Initialisierung, bildet ein grundlegendes Standardverfahren für das Training tiefer neuronaler Netze.

Einordnung

Glorot und Bengio verknüpfen theoretische Eigenschaften der Schichtenübertragung mit praktischen Beobachtungen des Gradientenflusses. Der Fokus auf das Verhalten der Jacobimatrix und die Vermeidung von Sättigungseffekten löste eines der zentralen Blockadeprobleme beim Training mehrschichtiger Feedforward-Netzwerke.

Gefunden in

Zusammenfassung von KI erstellt (Gemini 3.8 Flash, 27. September 2026). Sie kann Fehler enthalten – maßgeblich ist die Originalquelle.

Inhaltlich ähnlich, ermittelt über die KI-Suche.

  • Artikel:David E. Rumelhart, Geoffrey E. Hinton & Ronald J. Williams

    Klassische Arbeit zu Backpropagation: Repräsentationen durch Fehlerrückführung lernen

    Die Forschungsarbeit von David E. Rumelhart, Geoffrey E. Hinton und Ronald J. Williams stellt das Backpropagation-Verfahren für neuronale Netze vor. Der Algorithmus passt Verbindungsgewichte schrittweise an, um Abweichungen zwischen Soll- und Ist-Ausgaben zu minimieren.

    KI & AI· Forschung

  • Artikel:Kaiming He, Xiangyu Zhang, Shaoqing Ren, Jian Sun

    Deep Residual Learning for Image Recognition: Das ResNet-Framework

    Das Forschungsteam um Kaiming He stellt ein Residual-Learning-Framework vor, das das Training extrem tiefer neuronaler Netze erleichtert. Schichten lernen dabei Residualfunktionen bezogen auf die Eingaben statt unreferenzierter Funktionen.

    KI & AI· Forschung

  • Artikel:Kaiming He, Xiangyu Zhang, Shaoqing Ren, Jian Sun

    Identity Mappings in Deep Residual Networks

    Die Autoren analysieren die Signalweiterleitung in tiefen Residual-Netzen (ResNet) und zeigen, dass Forward- und Backward-Signale direkt durch das Netz fließen können, wenn Skip-Connections und Aktivierungen nach der Addition als reine Identitätsabbildungen ausgelegt sind. Auf Basis dieser Erkenntnis schlagen sie eine modifizierte Residual-Einheit vor, die das Training erleichtert und die Generalisierung verbessert.

    KI & AI· Forschung

  • Artikel:Warren Sturgis McCulloch and Walter Pitts

    A Logical Calculus of the Ideas Immanent in Nervous Activity (1943)

    Das historische Papier von Warren Sturgis McCulloch und Walter Pitts aus dem Jahr 1943 begründete das Konzept künstlicher neuronaler Netze. Es beschreibt das Nervensystem als ein Netzwerk einfacher logischer Elemente, die Eingaben summieren und ab einem Schwellenwert ein Signal ausgeben. Die Autoren zeigten die Äquivalenz dieser Netze zu logischen Aussagen und zu Turing-Maschinen auf.

    KI & AI· Forschung

  • Repository:josch14/double-descent

    Double-Descent-Phänomen bei Fully Connected Neural Networks auf MNIST

    Ein Forschungsprojekt der Universität Ulm untersucht das Double-Descent-Phänomen bei zweischichtigen Fully Connected Neural Networks (FCNN) auf dem MNIST-Datensatz. Die Arbeit reproduziert und erweitert Erkenntnisse von Belkin et al. (2019) und analysiert den Einfluss von Label Noise sowie Regularisierungsmethoden.

    15SternePython

    KI & AI· Forschung

Lassen Sie uns über Ihr Projekt sprechen

Standorte

  • Mattersburg
    Johann Nepomuk Bergerstraße 7/2/14
    7210 Mattersburg, Austria
  • Wien
    Ungargasse 64-66/3/404
    1030 Wien, Austria

Dieser Inhalt wurde teilweise mithilfe von KI erstellt.