Performance-Update für Qwen3.8 Flash Next auf DGX Spark

X-PostMiaAnkündigung

Mia (@MiaAI_lab) hat ein Performance-Update für das Modell Qwen3.8 Flash Next auf einem einzelnen DGX Spark vorgestellt. Die Aktualisierung steigert die Generierungsrate auf bis zu 108 Tokens pro Sekunde bei mehreren Streams und erweitert den KV-Cache auf 1M.

Das Wichtigste

  1. 46 Tokens/s bei Fließtext im Single-Stream auf einem einzelnen DGX Spark.
  2. 108 Tokens/s bei Fließtext verteilt über vier parallele Streams.
  3. Prefill-Geschwindigkeit von 2.000 bis 2.200 Tokens/s über alle Kontextgrößen hinweg.
  4. Der KV-Cache wurde auf 1M Kontextlänge erweitert.
  5. Arbeiten an einer Tensor-Parallelismus-Konfiguration (tp=2) laufen bereits mit einem veränderten Setup.

Warum das relevant ist

Hohe Durchsatzraten beim Generieren und schnelle Prefill-Zeiten auf Einzel-Knoten-Hardware reduzieren die Latenz und Kosten beim lokalen Hosting großer Sprachmodelle deutlich.

Einordnung

Das Update konzentriert sich auf die effiziente Nutzung eines einzelnen DGX Spark. Während die Prefill-Raten stabil bei über 2.000 Tokens/s liegen, zeigt der Durchsatzsprung bei vier parallelen Streams eine verbesserte Auslastung der Hardware. Für Konfigurationen mit mehreren Beschleunigern (tp=2) kündigte die Autorin ein separates Setup an; eine dflash2-Unterstützung existiert für diese Modellversion bisher noch nicht.

Original-Post

Mia

@MiaAI_lab · 5. September 2026

MASSIVE performance update to Qwen3.8 Flash Next on a single DGX Spark 🔥 - 46 tok/s for prose, single stream - 108 tok/s for prose across 4 concurrent streams - 2,000–2,200 tok/s prefill across all context sizes - Full numbers in the post below KV cache is now 1M instead of

632 Likes67 Antworten520 Lesezeichen75.709 Aufrufe

Auf X ansehen
Weitere Posts im Thread (9)
  1. Full prose tok/s and prefill numbers t.co/hzFWiOxuut
  2. @JDofLondon not for 1 spark, not worth it.
  3. @volatilemarkts @jvr0x Thank you my friend
  4. @Euclides_Netok it's coming !!!!
  5. @CoinUpBTC working on it :)
  6. @jmklex completely diff recipe, now working on tp=2
  7. @ncank There is no dflash2 yet for qwen3.8 flash
  8. @alexellisuk probably old data. 28 tok/s needs to be removed
  9. @wtogami No but I can probably make one. Need?
Ausgewählte Antworten (5)
  • @jmklex @MiaAI_lab What speeds do you get with tp-2 on this recipe?
  • @MichaelGannotti @MiaAI_lab This build is awesome! Set up and had my agents test this morning t.co/zMG80mQYvf
  • @NormanHead94546 @MiaAI_lab Now do tp2
  • @volatilemarkts @MiaAI_lab @jvr0x Great work.
  • @Euclides_Netok @MiaAI_lab NICE! Waiting support for 5060ti

Zusammenfassung von KI erstellt (Gemini 3.8 Flash, 27. September 2026). Sie kann Fehler enthalten – maßgeblich ist die Originalquelle.

Inhaltlich ähnlich, ermittelt über die KI-Suche.

  • X-Post:Mike Gannotti

    Qwen3.8-Flash-Next auf einzelner NVIDIA DGX Spark übertrifft Dual-Spark-Setup im Benchmark

    Ein Testbericht von SMF Clearinghouse zeigt, dass das Modell Qwen3.8-Flash-Next (NVFP4) auf einer einzelnen NVIDIA DGX Spark (GB10) im Benchmark 'smf-bench Official A' 87,3 % erreicht hat. Damit übertrifft die Einzel-Node-Konfiguration das bisherige Dual-Spark-Setup von DeepSeek V4 Vision-Exp bei der Ausgabequalität, insbesondere im Bereich Coding.

    17Lesezeichen2254Aufrufe

    KI & AI· News

  • Artikel:Nemo, DGX Spark & Local Inference Engineer

    Qwen3.8-Flash-Next erreicht 87,3 % auf einer einzelnen DGX Spark

    Ein lokaler Test von Qwen3.8-Flash-Next NVFP4 auf einem einzelnen NVIDIA DGX Spark (GB10) erzielt im smf-bench Official A 87,3 % und übertrifft damit frühere Ergebnisse eines Dual-Spark-Setups mit DeepSeek V4.

    KI & AI· Forschung

  • X-Post:Mia

    Inkling-Small auf zwei NVIDIA DGX Spark mit 1M Kontext

    Mia (@MiaAI_lab) berichtet über den Betrieb von Inkling-Small auf zwei NVIDIA DGX Spark mit einem Kontextfenster von einer Million Tokens via SGLang und dspark Speculative Drafts.

    106Lesezeichen9536Aufrufe

    KI & AI· Ankündigung

  • Repository:MiaAI-Lab/DeepSeek-v4-Flash-One-DGX-Spark

    DeepSeek-v4-Flash auf einer einzelnen DGX Spark betreiben

    Ein Open-Source-Launcher und Docker-Setup, mit dem DeepSeek V4 Flash 0731 (EXL3) auf einer einzelnen NVIDIA DGX Spark mit 128 GiB Unified Memory ausgeführt werden kann.

    328SternePython

    KI & AI· Tool

  • Repository:MiaAI-Lab/GLM-5.3-Flash-EXL3-2x-DGX-Sparks

    GLM-5.3 Flash EXL3 auf 2x NVIDIA DGX Spark Kits

    Das GitHub-Repository von Mia's AI Lab bietet eine optimierte vLLM-Serving-Konfiguration für GLM-5.3-Flash mit 4-bpw-EXL3-Quantisierung auf zwei NVIDIA GB10 Systemen.

    431SternePython

    KI & AI· Tool

Lassen Sie uns über Ihr Projekt sprechen

Standorte

  • Mattersburg
    Johann Nepomuk Bergerstraße 7/2/14
    7210 Mattersburg, Austria
  • Wien
    Ungargasse 64-66/3/404
    1030 Wien, Austria

Dieser Inhalt wurde teilweise mithilfe von KI erstellt.