LLM-Pretraining in 4-Bit: NVIDIA stellt NVFP4-Trainingsansatz vor

ArtikelNVIDIA et al.Forschung

Ein Forschungsteam von NVIDIA hat eine Methode vorgestellt, um Large Language Models stabil und akkurat im 4-Bit-Gleitkommaformat NVFP4 vorzutrainieren. Zur Validierung trainierten die Forscher ein Modell mit 12 Milliarden Parametern auf 10 Billionen Tokens – laut Autoren der bisher längste dokumentierte Trainingslauf in 4-Bit-Präzision. Die Ergebnisse zeigen vergleichbare Trainingsverluste und Genauigkeiten wie bei einer FP8-Baseline.

Das Wichtigste

  1. Der Trainingsansatz nutzt Random Hadamard Transforms (RHT), um Ausreißer auf Blockebene zu begrenzen.
  2. Ein zweidimensionales Quantisierungsschema sorgt für konsistente Repräsentationen im Forward- und Backward-Pass.
  3. Stochastic Rounding wird eingesetzt, um Gradienten unverzerrt zu schätzen.
  4. Einzelne Layer werden selektiv in höherer Präzision ausgeführt, um Stabilität und Konvergenz sicherzustellen.
  5. Ein 12-Milliarden-Parameter-Modell erreichte nach 10 Billionen Tokens ähnliche Resultate wie eine FP8-Baseline.

Warum das relevant ist

Das Training moderner Frontier-Modelle verschlingt enorme Rechenleistung und Energie im Bereich von Dutzenden bis Hunderten Yottaflops. Während FP8 bereits etabliert ist, verspricht der Wechsel auf FP4 weitere Effizienzgewinne bei Geschwindigkeit und Hardware-Auslastung, ohne dass Qualitätseinbußen hingenommen werden müssen.

Einordnung

4-Bit-Quantisierung war bislang primär für Inferenz oder Feinabstimmung verbreitet, während das vollständige Vortraining großer Modelle wegen numerischer Instabilitäten als Hürde galt. NVIDIA demonstriert mit mathematischen Anpassungen wie RHT und stochastischem Runden, dass auch ein langes Pretraining über 10 Billionen Tokens stabil bleibt. Sollte sich der Ansatz in der Praxis etablieren, könnte dies die Trainingskosten künftiger Modellgenerationen deutlich senken.

Zusammenfassung von KI erstellt (Gemini 3.8 Flash, 27. September 2026). Sie kann Fehler enthalten – maßgeblich ist die Originalquelle.

Inhaltlich ähnlich, ermittelt über die KI-Suche.

  • Artikel:unsloth.ai

    Unsloth Benchmarks: Höhere Geschwindigkeit und verringerter VRAM-Bedarf bei QLoRA

    Die Dokumentation von Unsloth präsentiert Benchmark-Ergebnisse für das Finetuning von LLMs auf NVIDIA-GPUs. Im Vergleich zur Kombination aus Hugging Face und FlashAttention-2 erreicht Unsloth bei Modellen wie Llama 3.1 und Llama 3.3 eine Verdopplung der Geschwindigkeit, spart über 70 Prozent VRAM ein und ermöglicht deutlich längere Kontextfenster.

    KI & AI· Sammlung

  • Artikel:Chris Alexiuk and Chintan Patel

    NVIDIA Nemotron 3.5 Lightning: Kompaktes MoE-Modell für Agenten-Workflows

    NVIDIA hat Nemotron 3.5 Lightning vorgestellt, ein offenes Mixture-of-Experts-Modell (MoE) mit 30 Milliarden Gesamt- und 3 Milliarden aktiven Parametern. Es wurde speziell für die Ausführungsebene langlebiger KI-Agenten optimiert, um Routineaufgaben wie Tool-Aufrufe und Ergebnisvalidierung schnell und kostengünstig zu bewältigen.

    KI & AI· Ankündigung

  • Link:Unsloth AI

    Unsloth veröffentlicht Dynamic-V3.0-GGUF-Quantisierungen für Qwen3.8-27B

    Unsloth AI hat quantisierte GGUF-Versionen des neuen Modells Qwen3.8-27B unter der Apache-2.0-Lizenz bereitgestellt. Die Quantisierungen nutzen das neue Verfahren Dynamic V3.0, das gegenüber anderen Anbietern eine höhere Genauigkeit bei gleicher Dateigröße erzielen soll. Qwen3.8-27B ist ein 27 Milliarden Parameter starkes Vision-Language-Modell mit nativer Bild- und Videoverarbeitung, hybridem DeltaNet- und Attention-Aufbau sowie flexibler Steuerung von Denkprozessen.

    KI & AI· Tool

Lassen Sie uns über Ihr Projekt sprechen

Standorte

  • Mattersburg
    Johann Nepomuk Bergerstraße 7/2/14
    7210 Mattersburg, Austria
  • Wien
    Ungargasse 64-66/3/404
    1030 Wien, Austria

Dieser Inhalt wurde teilweise mithilfe von KI erstellt.