Double-Descent-Phänomen bei Fully Connected Neural Networks auf MNIST

Repositoryjosch14/double-descentForschung

Ein Forschungsprojekt der Universität Ulm untersucht das Double-Descent-Phänomen bei zweischichtigen Fully Connected Neural Networks (FCNN) auf dem MNIST-Datensatz. Die Arbeit reproduziert und erweitert Erkenntnisse von Belkin et al. (2019) und analysiert den Einfluss von Label Noise sowie Regularisierungsmethoden.

Das Wichtigste

  1. Untersuchung des Double Descent, bei dem sich Modellfehler mit steigender Modellgröße erst verbessern, dann verschlechtern und schließlich wieder verbessern.
  2. Reproduktion und Erweiterung der Forschungsarbeit von Belkin et al. (2019) für zweischichtige FCNNs.
  3. Label Noise erweist sich als wirksame Methode, um das Double-Descent-Verhalten im Vergleich zu Weight-Reuse-Ansätzen deutlich sichtbar zu machen.
  4. Regularisierungsmethoden wie Dropout und L2-Regularisierung dämpfen das Auftreten des Phänomens effektiv ab.
  5. Das Repository enthält lauffähige Skripte, Logdaten, Plots und einen vollständigen Bericht im PDF-Format.

Warum das relevant ist

Das Phänomen des Double Descent verbindet klassische statistische Annahmen (größere Modelle neigen zu Überanpassung) mit modernen Deep-Learning-Beobachtungen (überparametrisierte Modelle generalisieren oft besser). Die Arbeit liefert empirische Einblicke in Mechanismen, die diesen Übergang steuern.

Einordnung

Das Projekt basiert auf Python 3.10 und PyTorch (2.0.1) zusammen mit scikit-learn und Matplotlib. Es richtet sich primär an Forschende und Studierende im Bereich maschinelles Lernen, die theoretische Grundlagen von Überparametrisierung verstehen wollen. Bei einem Entwicklungsstand als Universitätsprojekt mit wenigen Sternen und Forks handelt es sich um eine akademische Referenz- und Reproduktionsarbeit, nicht um eine produktionsreife Bibliothek.

Gefunden in

Zusammenfassung von KI erstellt (Gemini 3.8 Flash, 27. September 2026). Sie kann Fehler enthalten – maßgeblich ist die Originalquelle.

Inhaltlich ähnlich, ermittelt über die KI-Suche.

  • Artikel:Mikhail Belkin, Daniel Hsu, Siyuan Ma, Soumik Mandal

    Double Descent: Vereinbarkeit von moderner Machine-Learning-Praxis und Bias-Variance-Trade-off

    Ein Forschungsteam um Mikhail Belkin löst den scheinbaren Widerspruch zwischen klassischer Lerntheorie und modernen überparametrisierten Modellen auf. Die Autoren führen eine verallgemeinerte Leistungskurve mit sogenanntem Double Descent ein, die erklärt, warum Modelle nach dem Erreichen des Interpolationspunkts bei weiter steigender Kapazität wieder besser generalisieren.

    KI & AI· Forschung

  • Repository:karpathy/nanoGPT

    nanoGPT: Minimalistisches Repository zum Trainieren und Finetunen von GPTs

    nanoGPT von Andrej Karpathy ist eine schlanke und schnelle Codebasis zum Trainieren und Finetunen mittelgroßer GPT-Modelle in PyTorch. Das Repository wurde als Nachfolger von minGPT konzipiert und reproduziert unter anderem GPT-2 (124M). Seit November 2025 stuft der Autor das Projekt als veraltet ein und verweist auf nanochat.

    62.776SternePython

    KI & AI· Sammlung

  • Repository:test-time-training/e2e

    End-to-End Test-Time Training (TTT) für lange Kontexte in JAX

    Dieses Repository enthält die offizielle JAX-Implementierung für End-to-End Test-Time Training (TTT) für lange Kontexte. Der Ansatz modelliert die Verarbeitung langer Kontexte als Continual-Learning-Problem: Ein Standard-Transformer mit Sliding-Window-Attention passt seine Gewichte zur Testzeit via Next-Token-Prediction an und komprimiert den Kontext direkt in die Parameter.

    693SternePython

    KI & AI· Forschung

  • Link:Xavier Glorot, Yoshua Bengio

    Analyse der Trainingsschwierigkeiten bei tiefen Feedforward-Netzen

    Die Forschungsarbeit von Xavier Glorot und Yoshua Bengio untersucht, warum herkömmlicher Gradientenabstieg bei zufälliger Initialisierung in tiefen neuronalen Netzen oft scheitert. Die Autoren analysieren den Einfluss von Aktivierungsfunktionen und der Dynamik von Gradienten über verschiedene Schichten hinweg und stellen ein neues Initialisierungsverfahren für deutlich schnellere Konvergenz vor.

    KI & AI· Forschung

Lassen Sie uns über Ihr Projekt sprechen

Standorte

  • Mattersburg
    Johann Nepomuk Bergerstraße 7/2/14
    7210 Mattersburg, Austria
  • Wien
    Ungargasse 64-66/3/404
    1030 Wien, Austria

Dieser Inhalt wurde teilweise mithilfe von KI erstellt.