DeepSeek-v4-Flash auf einer einzelnen DGX Spark betreiben

RepositoryMiaAI-Lab/DeepSeek-v4-Flash-One-DGX-SparkTool

Ein Open-Source-Launcher und Docker-Setup, mit dem DeepSeek V4 Flash 0731 (EXL3) auf einer einzelnen NVIDIA DGX Spark mit 128 GiB Unified Memory ausgeführt werden kann.

Das Wichtigste

  1. Ermöglicht den Betrieb auf einer einzelnen DGX Spark (Tensor-Parallel 1), wodurch kein zweiter Node wie beim offiziellen FP4-Build (TP2) nötig ist.
  2. Nutzt den 3.0-bpw-EXL3-Build (0xSero/deepseek-v4-flash-0731-spark) zusammen mit dem sparkinfer-Kernel-Stack.
  3. Setzt auf DSpark-K5-spekulative Decodierung mit K64-Draft-Modell sowie nvfp4_ds_mla-komprimierten KV-Cache mit B12X_MLA_SPARSE.
  4. Erreicht bei Tests 44 bis 47 Token/s Decodegeschwindigkeit und verwaltet einen KV-Pool von bis zu 439.622 Tokens bei bis zu 384k Kontextlänge.
  5. Beinhaltet Schutz vor Decode-Starvation bei langen Prefills und spielt zwei Upstream-Kernel-Backports via Bind-Mounts ein.

Warum das relevant ist

Große Sprachmodelle mit sehr langen Kontextfenstern erfordern im Standard-Deployment oft teure Multi-Node-Hardware. Durch gezielte Quantisierung und Kernel-Tuning demonstriert das Projekt, wie sich extrem große Modelle auf einer einzelnen Workstation-Klasse-GPU betreiben lassen.

Einordnung

Das Repository löst ein konkretes Infrastrukturproblem: Statt zwei DGX-Spark-Knoten im TP2-Verbund zu benötigen, bündelt es EXL3-Quantisierung (3.0 bpw), angepasste CUDA-Graphen und speculative Decoding in einem Docker-Container für ein Einzelsystem. Zielgruppe sind ML-Engineers und Betreiber mit Zugriff auf NVIDIA-DGX-Spark-Hardware (GB10, SM121). Hinsichtlich des Reifegrads wirkt das Projekt wie ein hochgradig spezialisiertes, gut dokumentiertes Community-Skript: Es enthält detaillierte Benchmarks, Stress-Tests bis 370k Kontext und Kernel-Workarounds, ist jedoch stark hardware-spezifisch zugeschnitten.

Gefunden in

Zusammenfassung von KI erstellt (Gemini 3.8 Flash, 27. September 2026). Sie kann Fehler enthalten – maßgeblich ist die Originalquelle.

Inhaltlich ähnlich, ermittelt über die KI-Suche.

  • Repository:MiaAI-Lab/GLM-5.3-Flash-EXL3-2x-DGX-Sparks

    GLM-5.3 Flash EXL3 auf 2x NVIDIA DGX Spark Kits

    Das GitHub-Repository von Mia's AI Lab bietet eine optimierte vLLM-Serving-Konfiguration für GLM-5.3-Flash mit 4-bpw-EXL3-Quantisierung auf zwei NVIDIA GB10 Systemen.

    431SternePython

    KI & AI· Tool

  • X-Post:Mia

    Inkling-Small auf zwei NVIDIA DGX Spark mit 1M Kontext

    Mia (@MiaAI_lab) berichtet über den Betrieb von Inkling-Small auf zwei NVIDIA DGX Spark mit einem Kontextfenster von einer Million Tokens via SGLang und dspark Speculative Drafts.

    106Lesezeichen9536Aufrufe

    KI & AI· Ankündigung

  • Repository:eugr/spark-vllm-docker

    spark-vllm-docker: Optimierte vLLM-Docker-Setups für DGX Spark

    spark-vllm-docker ist ein Open-Source-Projekt, das Docker-Konfigurationen und Startskripte bereitstellt, um das LLM-Inferenz-Framework vLLM auf NVIDIA DGX Spark-Systemen auszuführen. Es unterstützt Einzelknoten sowie Multi-Node-Cluster über Ray oder vLLMs nativen PyTorch-Distributed-Modus.

    2222SterneShell

    KI & AI· Tool

  • Artikel:Elite Test Engineering

    DeepSeek V4 Flash auf zwei DGX-Spark-Nodes im Produktivbetrieb

    Ein Erfahrungsbericht dokumentiert das Aufsetzen des Modells DeepSeek-V4-Flash (284B MoE) über zwei DGX-Spark-Nodes mit Grace-Blackwell-Architektur mittels Ray und vLLM. Neben Hardware-Eigenheiten wie Unified Memory und NCCL-Bugs zeigt der Bericht, wie Multi-Token Prediction die Geschwindigkeit um 45 Prozent steigerte.

    KI & AI· Anleitung

Lassen Sie uns über Ihr Projekt sprechen

Standorte

  • Mattersburg
    Johann Nepomuk Bergerstraße 7/2/14
    7210 Mattersburg, Austria
  • Wien
    Ungargasse 64-66/3/404
    1030 Wien, Austria

Dieser Inhalt wurde teilweise mithilfe von KI erstellt.