vLLM auf NVIDIA DGX Spark: Architektur, Konfiguration und lokales Serving

ArtikelInferactAnleitung

Der Leitfaden erläutert den Betrieb von vLLM auf NVIDIAs Desk-Side-System DGX Spark (GB10). Durch den gemeinsamen 128-GB-Unified-Memory-Pool eignet sich das System besonders für lokale Inferenz mit NVFP4-MoE-Modellen wie Nemotron-3-Super.

Das Wichtigste

  1. DGX Spark basiert auf dem GB10-SoC (sm_121 Blackwell-Architektur) mit 128 GB Unified Memory, den sich CPU, GPU, Betriebssystem und Container teilen.
  2. Optimiert ist das System für NVFP4-Mixture-of-Experts-Modelle (ca. 10–15 Mrd. aktive Parameter), etwa Nemotron-3-Super-120B-A12B-NVFP4.
  3. Laufzeitparameter wie --gpu-memory-utilization müssen zwingend Headroom für das Betriebssystem und Cache-Wachstum im geteilten Speicher freihalten.
  4. DGX Spark ist primär für lokale Single-User- oder Small-Batch-Szenarien ausgelegt, weshalb --max-num-seqs niedrig gehalten werden sollte.
  5. vLLM stellt eine OpenAI-kompatible Schnittstelle bereit; Streaming und Paged KV Cache sichern geringe wahrgenommene Latenz im interaktiven Einsatz.
  6. Für sm_121 werden offizielle vLLM-Images (z. B. vllm/vllm-openai:cu130-nightly) sowie vorab heruntergeladene Modellgewichte (Host-Mount) empfohlen.

Warum das relevant ist

Das DGX-Spark-System schließt die Lücke zwischen lokalen Entwickler-Laptops und Rechenzentren. Durch vLLM und NVFP4-Quantisierung können Entwickler große Modelle mit über 100 Milliarden Parametern direkt am Schreibtisch betreiben, ohne auf Cloud-APIs angewiesen zu sein.

Einordnung

Die technische Herausforderung auf dem DGX Spark liegt im einheitlichen Speicher: Da CPU und GPU denselben 128-GB-Pool nutzen, führen aggressive Standardeinstellungen von Inferenz-Engines schnell zu Out-of-Memory-Fehlern. Der Artikel zeigt praxisnah, dass vLLM mit Paged KV Cache und CUDA-Graphs eine tragfähige Basis für Desktop-Inferenz bietet, der Fokus jedoch klar auf kleinen Batch-Größen und MoE-Architekturen liegt statt auf hochparallelem Durchsatz.

Gefunden in

Zusammenfassung von KI erstellt (Gemini 3.8 Flash, 27. September 2026). Sie kann Fehler enthalten – maßgeblich ist die Originalquelle.

Inhaltlich ähnlich, ermittelt über die KI-Suche.

  • Video

    Video:Heavy Metal Cloud

    Nvidia DGX Spark im Praxistest: Setup, vLLM-Serving und Vergleich mit dem Mac Studio

    Heavy Metal Cloud testet die DGX-Spark-Varianten von Gigabyte und ASUS mit Grace-Blackwell-Architektur für lokales KI-Inference und Medien-Rendering. Neben einer Schritt-für-Schritt-Anleitung für Docker, vLLM und ComfyUI zeigt das Video Vor- und Nachteile gegenüber Apples Mac Studio.

    KI & AI· Anleitung

  • Repository:eugr/spark-vllm-docker

    spark-vllm-docker: Optimierte vLLM-Docker-Setups für DGX Spark

    spark-vllm-docker ist ein Open-Source-Projekt, das Docker-Konfigurationen und Startskripte bereitstellt, um das LLM-Inferenz-Framework vLLM auf NVIDIA DGX Spark-Systemen auszuführen. Es unterstützt Einzelknoten sowie Multi-Node-Cluster über Ray oder vLLMs nativen PyTorch-Distributed-Modus.

    2222SterneShell

    KI & AI· Tool

  • Link:NVIDIA

    NVIDIA DGX Spark: Desktop-KI-Supercomputer mit Grace-Blackwell-Chip

    NVIDIA stellt mit dem DGX Spark einen kompakten Desktop-Supercomputer vor, der speziell auf lokale autonome Agenten und generative KI-Workloads ausgelegt ist. Das System basiert auf dem GB10 Grace Blackwell Superchip und bietet 128 GB kohärenten Unified Memory.

    KI & AI· Tool

  • Artikel:Elite Test Engineering

    DeepSeek V4 Flash auf zwei DGX-Spark-Nodes im Produktivbetrieb

    Ein Erfahrungsbericht dokumentiert das Aufsetzen des Modells DeepSeek-V4-Flash (284B MoE) über zwei DGX-Spark-Nodes mit Grace-Blackwell-Architektur mittels Ray und vLLM. Neben Hardware-Eigenheiten wie Unified Memory und NCCL-Bugs zeigt der Bericht, wie Multi-Token Prediction die Geschwindigkeit um 45 Prozent steigerte.

    KI & AI· Anleitung

  • Repository:MiaAI-Lab/DeepSeek-v4-Flash-One-DGX-Spark

    DeepSeek-v4-Flash auf einer einzelnen DGX Spark betreiben

    Ein Open-Source-Launcher und Docker-Setup, mit dem DeepSeek V4 Flash 0731 (EXL3) auf einer einzelnen NVIDIA DGX Spark mit 128 GiB Unified Memory ausgeführt werden kann.

    328SternePython

    KI & AI· Tool

  • Video

    Video:AIProgrammingHardware

    Software-Ökosystem und GitHub-Repositories für den NVIDIA DGX Spark

    Das Video stellt wichtige Open-Source-Repositories und Workflows für den Desktop-KI-Supercomputer NVIDIA DGX Spark vor. Das auf dem GB10 Grace-Blackwell-Superchip basierende System verfügt über 128 GB Unified Memory und zielt auf lokale LLM-Inferenz, Training und Multi-Agenten-Systeme ohne Cloud-Abhängigkeit ab.

    KI & AI· Sammlung

Lassen Sie uns über Ihr Projekt sprechen

Standorte

  • Mattersburg
    Johann Nepomuk Bergerstraße 7/2/14
    7210 Mattersburg, Austria
  • Wien
    Ungargasse 64-66/3/404
    1030 Wien, Austria

Dieser Inhalt wurde teilweise mithilfe von KI erstellt.