Artikel:NVIDIA et al.
LLM-Pretraining in 4-Bit: NVIDIA stellt NVFP4-Trainingsansatz vor
Ein Forschungsteam von NVIDIA hat eine Methode vorgestellt, um Large Language Models stabil und akkurat im 4-Bit-Gleitkommaformat NVFP4 vorzutrainieren. Zur Validierung trainierten die Forscher ein Modell mit 12 Milliarden Parametern auf 10 Billionen Tokens – laut Autoren der bisher längste dokumentierte Trainingslauf in 4-Bit-Präzision. Die Ergebnisse zeigen vergleichbare Trainingsverluste und Genauigkeiten wie bei einer FP8-Baseline.