Identity Mappings in Deep Residual Networks

ArtikelKaiming He, Xiangyu Zhang, Shaoqing Ren, Jian SunForschung

Die Autoren analysieren die Signalweiterleitung in tiefen Residual-Netzen (ResNet) und zeigen, dass Forward- und Backward-Signale direkt durch das Netz fließen können, wenn Skip-Connections und Aktivierungen nach der Addition als reine Identitätsabbildungen ausgelegt sind. Auf Basis dieser Erkenntnis schlagen sie eine modifizierte Residual-Einheit vor, die das Training erleichtert und die Generalisierung verbessert.

Das Wichtigste

  1. Analyse der Ausbreitungsformeln zeigt direkte Signalweiterleitung zwischen beliebigen Blöcken bei Nutzung von Identity Mappings.
  2. Ablation-Experimente belegen die zentrale Bedeutung von unveränderten Skip-Connections.
  3. Neues Design der Residual-Einheit (Pre-Activation) erleichtert das Training sehr tiefer Netze.
  4. Erfolgreicher Einsatz bei Modellen mit bis zu 1001 Schichten auf CIFAR-10 (4,62 % Fehlerrate) und CIFAR-100 sowie 200 Schichten auf ImageNet.

Warum das relevant ist

Die Arbeit liefert das theoretische und architektonische Fundament für ResNet v2 und zeigt, wie selbst Netze mit über 1000 Schichten ohne Signalverlust stabil trainiert werden können.

Einordnung

Durch das Beibehalten von reinen Identitätsabbildungen auf dem Bypass-Pfad wird der Informationsfluss im Vorwärts- wie im Rückwärtspfad ununterbrochen aufrechterhalten. Die Arbeit etabliert das Prinzip der Voraktivierung (Pre-Activation) vor den Faltungsschichten statt nach der Addition.

Gefunden in

Zusammenfassung von KI erstellt (Gemini 3.8 Flash, 27. September 2026). Sie kann Fehler enthalten – maßgeblich ist die Originalquelle.

Inhaltlich ähnlich, ermittelt über die KI-Suche.

  • Artikel:Kaiming He, Xiangyu Zhang, Shaoqing Ren, Jian Sun

    Deep Residual Learning for Image Recognition: Das ResNet-Framework

    Das Forschungsteam um Kaiming He stellt ein Residual-Learning-Framework vor, das das Training extrem tiefer neuronaler Netze erleichtert. Schichten lernen dabei Residualfunktionen bezogen auf die Eingaben statt unreferenzierter Funktionen.

    KI & AI· Forschung

  • Link:Xavier Glorot, Yoshua Bengio

    Analyse der Trainingsschwierigkeiten bei tiefen Feedforward-Netzen

    Die Forschungsarbeit von Xavier Glorot und Yoshua Bengio untersucht, warum herkömmlicher Gradientenabstieg bei zufälliger Initialisierung in tiefen neuronalen Netzen oft scheitert. Die Autoren analysieren den Einfluss von Aktivierungsfunktionen und der Dynamik von Gradienten über verschiedene Schichten hinweg und stellen ein neues Initialisierungsverfahren für deutlich schnellere Konvergenz vor.

    KI & AI· Forschung

  • Artikel:Maximilian Beck, Korbinian Pöppel, Markus Spanring, Andreas Auer, Oleksandra Prudnikova, Michael Kopp, Günter Klambauer, Johannes Brandstetter, Sepp Hochreiter

    xLSTM: Extended Long Short-Term Memory

    Ein Forschungsteam um Sepp Hochreiter stellt xLSTM vor, eine Weiterentwicklung der klassischen Long Short-Term Memory-Architektur für moderne Large Language Models. Die Erweiterung behebt bisherige Skalierungs- und Parallelisierungsgrenzen von LSTMs und erzielt vergleichbare Ergebnisse zu Transformer- und State-Space-Modellen.

    KI & AI· Forschung

  • Repository:josch14/double-descent

    Double-Descent-Phänomen bei Fully Connected Neural Networks auf MNIST

    Ein Forschungsprojekt der Universität Ulm untersucht das Double-Descent-Phänomen bei zweischichtigen Fully Connected Neural Networks (FCNN) auf dem MNIST-Datensatz. Die Arbeit reproduziert und erweitert Erkenntnisse von Belkin et al. (2019) und analysiert den Einfluss von Label Noise sowie Regularisierungsmethoden.

    15SternePython

    KI & AI· Forschung

  • Artikel:David E. Rumelhart, Geoffrey E. Hinton & Ronald J. Williams

    Klassische Arbeit zu Backpropagation: Repräsentationen durch Fehlerrückführung lernen

    Die Forschungsarbeit von David E. Rumelhart, Geoffrey E. Hinton und Ronald J. Williams stellt das Backpropagation-Verfahren für neuronale Netze vor. Der Algorithmus passt Verbindungsgewichte schrittweise an, um Abweichungen zwischen Soll- und Ist-Ausgaben zu minimieren.

    KI & AI· Forschung

  • Artikel:Mikhail Belkin, Daniel Hsu, Siyuan Ma, Soumik Mandal

    Double Descent: Vereinbarkeit von moderner Machine-Learning-Praxis und Bias-Variance-Trade-off

    Ein Forschungsteam um Mikhail Belkin löst den scheinbaren Widerspruch zwischen klassischer Lerntheorie und modernen überparametrisierten Modellen auf. Die Autoren führen eine verallgemeinerte Leistungskurve mit sogenanntem Double Descent ein, die erklärt, warum Modelle nach dem Erreichen des Interpolationspunkts bei weiter steigender Kapazität wieder besser generalisieren.

    KI & AI· Forschung

Lassen Sie uns über Ihr Projekt sprechen

Standorte

  • Mattersburg
    Johann Nepomuk Bergerstraße 7/2/14
    7210 Mattersburg, Austria
  • Wien
    Ungargasse 64-66/3/404
    1030 Wien, Austria

Dieser Inhalt wurde teilweise mithilfe von KI erstellt.