Unsloth Benchmarks: Höhere Geschwindigkeit und verringerter VRAM-Bedarf bei QLoRA

ArtikelSammlung

Die Dokumentation von Unsloth präsentiert Benchmark-Ergebnisse für das Finetuning von LLMs auf NVIDIA-GPUs. Im Vergleich zur Kombination aus Hugging Face und FlashAttention-2 erreicht Unsloth bei Modellen wie Llama 3.1 und Llama 3.3 eine Verdopplung der Geschwindigkeit, spart über 70 Prozent VRAM ein und ermöglicht deutlich längere Kontextfenster.

Das Wichtigste

  1. Tests auf NVIDIA H100- und Blackwell-GPUs zeigen bei Llama 3.1 (8B) und Llama 3.3 (70B) eine 2-fache Geschwindigkeit und über 70 bis 75 Prozent VRAM-Reduktion.
  2. Die unterstützte Kontextlänge steigt dank eines eigenen Gradient-Checkpointing-Algorithmus und Apples CCE-Algorithmus um das 12- bis 13-Fache.
  3. Bei Llama 3.1 (8B) mit 80 GB VRAM erreicht Unsloth eine Kontextlänge von bis zu 342.733 Token, während Hugging Face mit FlashAttention-2 bei 28.454 Token liegt.
  4. Auf kleineren GPUs (z. B. 8 GB VRAM) ermöglicht Unsloth bei Llama 3.1 (8B) rund 2.972 Token Kontext, während die Vergleichslösung einen Out-of-Memory-Fehler (OOM) meldet.
  5. Ein initialer Warm-up von torch.compile kann fünf Minuten oder länger dauern, weshalb Durchsatzmessungen erst nach vollständiger Kompilierung erfolgen sollten.

Warum das relevant ist

Finetuning großer Sprachmodelle scheitert in der Praxis oft an teuren VRAM-Grenzen. Durch die starke Reduktion des Speicherbedarfs erlaubt Unsloth das Training langer Kontexte selbst auf Consumer- und kleineren Enterprise-GPUs, was die Infrastrukturkosten für KI-Teams drastisch senkt.

Einordnung

Unsloths Kombination aus speicheroptimiertem Gradient Checkpointing und Apples CCE-Verfahren setzt gezielt an den Engpässen von QLoRA an. Besonders bemerkenswert ist die Skalierung bei langen Sequenzen: Weil der VRAM-Bedarf pro zusätzlichem Token langsamer wächst, werden Kontexte von mehreren hunderttausend Token auf Standardhardware realisierbar. Die Vorlaufzeit für die torch.compile-Kompilierung muss jedoch in kurzen Trainingsläufen einkalkuliert werden.

Gefunden in

Zusammenfassung von KI erstellt (Gemini 3.8 Flash, 27. September 2026). Sie kann Fehler enthalten – maßgeblich ist die Originalquelle.

Inhaltlich ähnlich, ermittelt über die KI-Suche.

  • Link:Unsloth AI

    Unsloth veröffentlicht Dynamic-V3.0-GGUF-Quantisierungen für Qwen3.8-27B

    Unsloth AI hat quantisierte GGUF-Versionen des neuen Modells Qwen3.8-27B unter der Apache-2.0-Lizenz bereitgestellt. Die Quantisierungen nutzen das neue Verfahren Dynamic V3.0, das gegenüber anderen Anbietern eine höhere Genauigkeit bei gleicher Dateigröße erzielen soll. Qwen3.8-27B ist ein 27 Milliarden Parameter starkes Vision-Language-Modell mit nativer Bild- und Videoverarbeitung, hybridem DeltaNet- und Attention-Aufbau sowie flexibler Steuerung von Denkprozessen.

    KI & AI· Tool

  • Link:Unsloth AI

    Unsloth veröffentlicht Qwen3.6-27B-MTP im GGUF-Format

    Unsloth AI stellt mit Qwen3.6-27B-MTP-GGUF quantisierte Versionen des ersten Open-Weight-Modells aus der Qwen3.6-Reihe bereit. Das multimodale 27-Milliarden-Parameter-Modell nutzt Multi-Token Prediction (MTP) für schnellere Inferenz und bringt Verbesserungen bei Agentic Coding sowie Tool Calling mit.

    KI & AI· Sammlung

  • Artikel:PyTorch Ecosystem Working Group

    PyTorch-Ecosystem nimmt PhysicsNeMo, Unsloth, ONNX und KTransformers auf

    Die PyTorch Ecosystem Working Group erweitert ihre offizielle Landscape um vier bedeutende Open-Source-Projekte: NVIDIAs Physik-Framework PhysicsNeMo, die Optimierungs- und Fine-Tuning-Suite Unsloth, den offenen Standard ONNX und das Offloading-Projekt KTransformers.

    KI & AI· Ankündigung

Lassen Sie uns über Ihr Projekt sprechen

Standorte

  • Mattersburg
    Johann Nepomuk Bergerstraße 7/2/14
    7210 Mattersburg, Austria
  • Wien
    Ungargasse 64-66/3/404
    1030 Wien, Austria

Dieser Inhalt wurde teilweise mithilfe von KI erstellt.