DeepSeek v4 Flash auf einer einzelnen NVIDIA DGX Spark betreiben

X-PostMiaTool

MiaAI-Lab hat ein Open-Source-Setup veröffentlicht, um DeepSeek V4 Flash 0731 (EXL3) auf einer einzelnen NVIDIA DGX Spark ohne Multi-Node-Cluster auszuführen.

Das Wichtigste

  1. Ermöglicht den Betrieb des Modells DeepSeek V4 Flash 0731 (EXL3, 3.0 bpw) auf einer einzelnen NVIDIA DGX Spark (GB10, 128 GiB Unified Memory) mit Tensor-Parallel 1 (TP1).
  2. Nutzt den Kernel-Stack sparkinfer (ehemals b12x) mit DSpark K5 Speculative Decoding und einem K64-Draft-Modell.
  3. Unterstützt extrem lange Kontexte bis zu 384.000 Token dank komprimiertem NVFP4-KV-Cache (nvfp4_ds_mla).
  4. In Tests wurden Kontexte von 320k und 370k Token mit exakter Needle-in-a-Haystack-Trefferquote und 0 Preemptions validiert.
  5. Erreicht eine strukturierte Decode-Geschwindigkeit von 44 bis 47 Token pro Sekunde bei 384k Kontextlänge.
  6. Liefert vorkonfigurierte Docker-Skripte und Kernel-Backports, die vorherige Fehler beim NVFP4-Dual-Cache-Prefill beheben.

Warum das relevant ist

Das offizielle FP4-Build von DeepSeek V4 Flash erforderte bisher mindestens zwei DGX-Spark-Knoten (TP2). Dieses Repository reduziert die Hardware-Anforderungen für lokale Long-Context-Inferenz auf ein einziges Gerät.

Einordnung

Das Projekt optimiert die Speicherauslastung auf rund 94 Prozent des 128-GiB-Unified-Memory der DGX Spark. Durch Kernel-Patches für den NVFP4-Dual-Cache und optimierte CUDA-Graph-Captures bleibt die Inferenz auch bei Kontexten über 300.000 Token stabil. Die Prefill-Performance sinkt zwar mit steigender Tiefe (von ~1.024 tok/s auf ~350–614 tok/s jenseits von 300k), ermöglicht aber die vollständige Verarbeitung riesiger Prompts ohne Speicherüberlauf.

Original-Post

Mia

@MiaAI_lab · 3. August 2026

Run DeepSeek v4 Flash on single DGX Spark: t.co/dEO6LAray2

66 Likes5 Antworten71 Lesezeichen9777 Aufrufe

Auf X ansehen

Links und Tools aus diesem Beitrag

Zusammenfassung von KI erstellt (Gemini 3.8 Flash, 27. September 2026). Sie kann Fehler enthalten – maßgeblich ist die Originalquelle.

Inhaltlich ähnlich, ermittelt über die KI-Suche.

  • Repository:MiaAI-Lab/DeepSeek-v4-Flash-One-DGX-Spark

    DeepSeek-v4-Flash auf einer einzelnen DGX Spark betreiben

    Ein Open-Source-Launcher und Docker-Setup, mit dem DeepSeek V4 Flash 0731 (EXL3) auf einer einzelnen NVIDIA DGX Spark mit 128 GiB Unified Memory ausgeführt werden kann.

    328SternePython

    KI & AI· Tool

  • X-Post:Mia

    Inkling-Small auf zwei NVIDIA DGX Spark mit 1M Kontext

    Mia (@MiaAI_lab) berichtet über den Betrieb von Inkling-Small auf zwei NVIDIA DGX Spark mit einem Kontextfenster von einer Million Tokens via SGLang und dspark Speculative Drafts.

    106Lesezeichen9536Aufrufe

    KI & AI· Ankündigung

  • Artikel:Elite Test Engineering

    DeepSeek V4 Flash auf zwei DGX-Spark-Nodes im Produktivbetrieb

    Ein Erfahrungsbericht dokumentiert das Aufsetzen des Modells DeepSeek-V4-Flash (284B MoE) über zwei DGX-Spark-Nodes mit Grace-Blackwell-Architektur mittels Ray und vLLM. Neben Hardware-Eigenheiten wie Unified Memory und NCCL-Bugs zeigt der Bericht, wie Multi-Token Prediction die Geschwindigkeit um 45 Prozent steigerte.

    KI & AI· Anleitung

  • Repository:MiaAI-Lab/GLM-5.3-Flash-EXL3-2x-DGX-Sparks

    GLM-5.3 Flash EXL3 auf 2x NVIDIA DGX Spark Kits

    Das GitHub-Repository von Mia's AI Lab bietet eine optimierte vLLM-Serving-Konfiguration für GLM-5.3-Flash mit 4-bpw-EXL3-Quantisierung auf zwei NVIDIA GB10 Systemen.

    431SternePython

    KI & AI· Tool

  • Link:deepseek-ai

    DeepSeek veröffentlicht DeepSeek-V4-Pro-DSpark mit spekulativer Dekodierung

    DeepSeek hat die Modelldokumentation und Gewichte für DeepSeek-V4-Pro-DSpark auf Hugging Face bereitgestellt. Es handelt sich um das MoE-Modell DeepSeek-V4-Pro mit einem integrierten Modul für spekulative Dekodierung (DSpark) zur Beschleunigung der Inferenz.

    KI & AI· Sammlung

  • X-Post:Mike Gannotti

    Qwen3.8-Flash-Next auf einzelner NVIDIA DGX Spark übertrifft Dual-Spark-Setup im Benchmark

    Ein Testbericht von SMF Clearinghouse zeigt, dass das Modell Qwen3.8-Flash-Next (NVFP4) auf einer einzelnen NVIDIA DGX Spark (GB10) im Benchmark 'smf-bench Official A' 87,3 % erreicht hat. Damit übertrifft die Einzel-Node-Konfiguration das bisherige Dual-Spark-Setup von DeepSeek V4 Vision-Exp bei der Ausgabequalität, insbesondere im Bereich Coding.

    17Lesezeichen2254Aufrufe

    KI & AI· News

Lassen Sie uns über Ihr Projekt sprechen

Standorte

  • Mattersburg
    Johann Nepomuk Bergerstraße 7/2/14
    7210 Mattersburg, Austria
  • Wien
    Ungargasse 64-66/3/404
    1030 Wien, Austria

Dieser Inhalt wurde teilweise mithilfe von KI erstellt.