nanoGPT: Minimalistisches Repository zum Trainieren und Finetunen von GPTs

Repositorykarpathy/nanoGPTSammlung

nanoGPT von Andrej Karpathy ist eine schlanke und schnelle Codebasis zum Trainieren und Finetunen mittelgroßer GPT-Modelle in PyTorch. Das Repository wurde als Nachfolger von minGPT konzipiert und reproduziert unter anderem GPT-2 (124M). Seit November 2025 stuft der Autor das Projekt als veraltet ein und verweist auf nanochat.

Das Wichtigste

  1. Kompakter Code: Sowohl die Trainingsschleife (train.py) als auch die Modellarchitektur (model.py) umfassen jeweils nur rund 300 Zeilen.
  2. Reproduzierbarkeit: Reproduziert GPT-2 (124M) auf OpenWebText auf einem System mit acht A100-GPUs (40 GB) in etwa vier Tagen.
  3. Flexibilität: Eignet sich sowohl für das Training von Grund auf als auch für das Finetuning bestehender Checkpoints wie GPT-2 1.3B.
  4. Technologie-Stack: Basiert auf Python, PyTorch, NumPy, Hugging Face Transformers und Datasets, tiktoken, wandb sowie tqdm.
  5. Status: Seit November 2025 offiziell als veraltet eingestuft; Karpathy empfiehlt stattdessen die Nutzung des Nachfolgeprojekts nanochat.

Warum das relevant ist

Das Repository reduzierte komplexe Transformer-Architekturen und Training-Pipelines auf ein überschaubares Minimum von wenigen hundert Zeilen verständlichem Python-Code. Dadurch diente es Entwicklern und Forschenden als praktische Referenz zum Verständnis und zur Modifikation moderner Sprachmodelle.

Einordnung

Das Projekt richtet sich an Entwickler und ML-Praktiker, die Transformer-Modelle ohne den Ballast umfangreicher Frameworks verstehen, anpassen oder trainieren möchten. Hinsichtlich der Reife galt die Codebasis mit über 62.000 Sternen als extrem populär und stabil, befindet sich nun aber am Ende ihres Lebenszyklus. Mit der offiziellen Einstufung als veraltet im November 2025 wird sie vom Autor nur noch für Archivzwecke bereitgestellt, während für neue Vorhaben auf nanochat verwiesen wird.

Gefunden in

Zusammenfassung von KI erstellt (Gemini 3.8 Flash, 27. September 2026). Sie kann Fehler enthalten – maßgeblich ist die Originalquelle.

Inhaltlich ähnlich, ermittelt über die KI-Suche.

  • X-Post:0xSero

    Wochenendprojekt: Ein Sprachmodell auf GPT-2-Niveau trainieren

    In einem X-Beitrag empfiehlt 0xSero ein praxisorientiertes Wochenendprojekt zum Training eines Sprachmodells auf GPT-2-Niveau mit Python. Nach seinen Angaben beansprucht das Projekt etwa 4 bis 8 Stunden Zeit bei Rechenkosten von rund 50 US-Dollar. Zur Vertiefung verweist er auf Andrej Karpathys nanoGPT-Repository und dessen YouTube-Reihe.

    1233Lesezeichen69.092Aufrufe

    KI & AI· Sammlung

  • Repository:josch14/double-descent

    Double-Descent-Phänomen bei Fully Connected Neural Networks auf MNIST

    Ein Forschungsprojekt der Universität Ulm untersucht das Double-Descent-Phänomen bei zweischichtigen Fully Connected Neural Networks (FCNN) auf dem MNIST-Datensatz. Die Arbeit reproduziert und erweitert Erkenntnisse von Belkin et al. (2019) und analysiert den Einfluss von Label Noise sowie Regularisierungsmethoden.

    15SternePython

    KI & AI· Forschung

  • Repository:deepseek-ai/DeepSpec

    DeepSpec: Full-Stack-Framework für spekulative Dekodierung von DeepSeek

    DeepSpec ist eine Open-Source-Codebasis von DeepSeek zum Trainieren und Evaluieren von Draft-Modellen für spekulatives Dekodieren. Die Suite deckt die gesamte Pipeline ab: Datenvorbereitung, Modelltraining auf Multi-GPU-Knoten und Benchmarking.

    7081SternePython

    KI & AI· Tool

  • Repository:parthsarthi03/raptor

    RAPTOR: Rekursive Baumstrukturen für Retrieval-Augmented Generation

    RAPTOR (Recursive Abstractive Processing for Tree-Organized Retrieval) ist die offizielle Python-Implementierung eines RAG-Ansatzes, der Dokumente in rekursiven Baumstrukturen organisiert. Dadurch wird kontextbezogenes Retrieval über lange Texte hinweg ermöglicht.

    1752SternePython

    KI & AI· Forschung

  • Video

    Video:AIProgrammingHardware

    Software-Ökosystem und GitHub-Repositories für den NVIDIA DGX Spark

    Das Video stellt wichtige Open-Source-Repositories und Workflows für den Desktop-KI-Supercomputer NVIDIA DGX Spark vor. Das auf dem GB10 Grace-Blackwell-Superchip basierende System verfügt über 128 GB Unified Memory und zielt auf lokale LLM-Inferenz, Training und Multi-Agenten-Systeme ohne Cloud-Abhängigkeit ab.

    KI & AI· Sammlung

Lassen Sie uns über Ihr Projekt sprechen

Standorte

  • Mattersburg
    Johann Nepomuk Bergerstraße 7/2/14
    7210 Mattersburg, Austria
  • Wien
    Ungargasse 64-66/3/404
    1030 Wien, Austria

Dieser Inhalt wurde teilweise mithilfe von KI erstellt.