Qwen3.8-Flash-Next auf einzelner NVIDIA DGX Spark übertrifft Dual-Spark-Setup im Benchmark

X-PostMike GannottiNews

Ein Testbericht von SMF Clearinghouse zeigt, dass das Modell Qwen3.8-Flash-Next (NVFP4) auf einer einzelnen NVIDIA DGX Spark (GB10) im Benchmark 'smf-bench Official A' 87,3 % erreicht hat. Damit übertrifft die Einzel-Node-Konfiguration das bisherige Dual-Spark-Setup von DeepSeek V4 Vision-Exp bei der Ausgabequalität, insbesondere im Bereich Coding.

Das Wichtigste

  1. Qwen3.8-Flash-Next NVFP4 erzielte auf einer einzelnen DGX Spark (TP=1, 262k Kontext, MTP=3) 137 von 157 Punkten (87,3 %) im Official-A-Benchmark bei deaktiviertem Thinking-Modus.
  2. Im Bereich Coding erreichte das Modell ein fehlerfreies Ergebnis von 30/30 Punkten ohne Syntaxfehler, verglichen mit 22/30 bei DeepSeek V4 (DSV4).
  3. Gegenüber dem Dual-Spark-Setup von DSV4 Vision-Exp (117/157 bzw. 74,5 %) liefert Qwen eine höhere Trefferquote, liegt beim Durchsatz mit rund 31,1 Tokens/s (c=1) jedoch unter den 68,5 Tokens/s von DSV4.
  4. Für einen stabilen Start auf 128 GB UMA empfiehlt der Bericht einen sauberen Host-Swap (<5 GiB) sowie KV_TARGET_GIB=16 statt 22 GiB, um Out-of-Memory-Abbrüche zu vermeiden.

Warum das relevant ist

Für Entwickler und IT-Teams, die lokale Sprachmodelle auf eigener Hardware betreiben, zeigt der Test, dass moderne FP4-Quantisierungen und Architekturen selbst auf einzelnen Beschleunigerknoten hohe Reasoning- und Coding-Qualität ohne externe Cloud-API-Kosten liefern können.

Einordnung

Der Bericht von Nemo (SMF Works) dokumentiert einen klaren Trade-off zwischen Durchsatz und Ergebnisqualität: Während DeepSeek V4 über zwei Nodes hinweg deutlich schneller generiert, schneidet Qwen3.8-Flash-Next bei logischen Aufgaben und Code robuster ab. Die Konfiguration erfordert jedoch striktes Speichermanagement beim Host-Swap und den KV-Cache-Zielen, um auf dem GB10-System stabil im vLLM-Container zu laufen.

Original-Post

Mike Gannotti

@MichaelGannotti · 5. September 2026

Qwen3.8 Flash from @MiaAI_lab running on a single @NVIDIAAI DGX Spark crushed it this morning. Full report here t.co/zDImTHkMJi t.co/jTtMSYcdL9

37 Likes0 Antworten17 Lesezeichen2254 Aufrufe

Auf X ansehen

Links und Tools aus diesem Beitrag

Zusammenfassung von KI erstellt (Gemini 3.8 Flash, 27. September 2026). Sie kann Fehler enthalten – maßgeblich ist die Originalquelle.

Inhaltlich ähnlich, ermittelt über die KI-Suche.

  • Artikel:Nemo, DGX Spark & Local Inference Engineer

    Qwen3.8-Flash-Next erreicht 87,3 % auf einer einzelnen DGX Spark

    Ein lokaler Test von Qwen3.8-Flash-Next NVFP4 auf einem einzelnen NVIDIA DGX Spark (GB10) erzielt im smf-bench Official A 87,3 % und übertrifft damit frühere Ergebnisse eines Dual-Spark-Setups mit DeepSeek V4.

    KI & AI· Forschung

  • X-Post:Mia

    Performance-Update für Qwen3.8 Flash Next auf DGX Spark

    Mia (@MiaAI_lab) hat ein Performance-Update für das Modell Qwen3.8 Flash Next auf einem einzelnen DGX Spark vorgestellt. Die Aktualisierung steigert die Generierungsrate auf bis zu 108 Tokens pro Sekunde bei mehreren Streams und erweitert den KV-Cache auf 1M.

    520Lesezeichen75.709Aufrufe

    KI & AI· Ankündigung

  • Repository:MiaAI-Lab/DeepSeek-v4-Flash-One-DGX-Spark

    DeepSeek-v4-Flash auf einer einzelnen DGX Spark betreiben

    Ein Open-Source-Launcher und Docker-Setup, mit dem DeepSeek V4 Flash 0731 (EXL3) auf einer einzelnen NVIDIA DGX Spark mit 128 GiB Unified Memory ausgeführt werden kann.

    328SternePython

    KI & AI· Tool

  • X-Post:Mia

    Inkling-Small auf zwei NVIDIA DGX Spark mit 1M Kontext

    Mia (@MiaAI_lab) berichtet über den Betrieb von Inkling-Small auf zwei NVIDIA DGX Spark mit einem Kontextfenster von einer Million Tokens via SGLang und dspark Speculative Drafts.

    106Lesezeichen9536Aufrufe

    KI & AI· Ankündigung

  • Artikel:Elite Test Engineering

    DeepSeek V4 Flash auf zwei DGX-Spark-Nodes im Produktivbetrieb

    Ein Erfahrungsbericht dokumentiert das Aufsetzen des Modells DeepSeek-V4-Flash (284B MoE) über zwei DGX-Spark-Nodes mit Grace-Blackwell-Architektur mittels Ray und vLLM. Neben Hardware-Eigenheiten wie Unified Memory und NCCL-Bugs zeigt der Bericht, wie Multi-Token Prediction die Geschwindigkeit um 45 Prozent steigerte.

    KI & AI· Anleitung

Lassen Sie uns über Ihr Projekt sprechen

Standorte

  • Mattersburg
    Johann Nepomuk Bergerstraße 7/2/14
    7210 Mattersburg, Austria
  • Wien
    Ungargasse 64-66/3/404
    1030 Wien, Austria

Dieser Inhalt wurde teilweise mithilfe von KI erstellt.