Qwen3.8-Flash-Next erreicht 87,3 % auf einer einzelnen DGX Spark

ArtikelNemo, DGX Spark & Local Inference EngineerForschung

Ein lokaler Test von Qwen3.8-Flash-Next NVFP4 auf einem einzelnen NVIDIA DGX Spark (GB10) erzielt im smf-bench Official A 87,3 % und übertrifft damit frühere Ergebnisse eines Dual-Spark-Setups mit DeepSeek V4.

Das Wichtigste

  1. Qwen3.8-Flash-Next erreichte mit Tensor-Parallelismus TP=1 und deaktiviertem Thinking-Modus 137 von 157 Punkten (87,3 %) im Benchmark Official A.
  2. Im Coding-Bereich erzielte das Modell mit 30 von 30 Punkten das Punktemaximum ohne Syntaxfehler.
  3. Im Vergleich zu einem Dual-Spark-Setup mit DeepSeek V4 Vision-Exp (117/157 bzw. 74,5 %) liefert Qwen eine höhere Trefferquote, decodiert jedoch langsamer (31,1 vs. 68,5 Tokens/s bei Single-Stream).
  4. Für einen stabilen Betrieb ohne Speichermangel sind ein sauberer Swap-Speicher (Neustart bei >5 GiB belegtem Swap empfohlen) und ein KV-Zielwert von KV_TARGET_GIB=16 erforderlich.
  5. Im Vergleich zu Cloud-Modellen liegt das lokal betriebene Modell hinter Kimi K3 (89,2 %), jedoch vor Qwen3.8-Max (79,6 %) und GLM-5.2 (77.1 %).

Warum das relevant ist

Die Ergebnisse demonstrieren, dass hochqualitative lokale Inferenz mit einem großen Kontextfenster von 262k Tokens auf einem einzigen GB10-Knoten ohne Cloud-Abhängigkeit und API-Kosten machbar ist – vorausgesetzt, der Durchsatz von rund 31 Tokens/s genügt dem Einsatzzweck.

Einordnung

Der Test verdeutlicht den Trade-off zwischen Inferenzgeschwindigkeit und Modellqualität bei lokaler Hardware. Während DeepSeek V4 auf zwei Nodes einen deutlich höheren Durchsatz liefert, punktet Qwen3.8-Flash-Next mit hoher Zuverlässigkeit im Code-Bereich und guter Instruction-Following-Leistung. Das Deployment erfordert jedoch präzises Ressourcenmanagement auf dem Host-System, da aggressive KV-Cache-Konfigurationen oder belegter Swap-Speicher schnell zu Out-of-Memory-Fehlern führen.

Gefunden in

Zusammenfassung von KI erstellt (Gemini 3.8 Flash, 27. September 2026). Sie kann Fehler enthalten – maßgeblich ist die Originalquelle.

Inhaltlich ähnlich, ermittelt über die KI-Suche.

  • X-Post:Mike Gannotti

    Qwen3.8-Flash-Next auf einzelner NVIDIA DGX Spark übertrifft Dual-Spark-Setup im Benchmark

    Ein Testbericht von SMF Clearinghouse zeigt, dass das Modell Qwen3.8-Flash-Next (NVFP4) auf einer einzelnen NVIDIA DGX Spark (GB10) im Benchmark 'smf-bench Official A' 87,3 % erreicht hat. Damit übertrifft die Einzel-Node-Konfiguration das bisherige Dual-Spark-Setup von DeepSeek V4 Vision-Exp bei der Ausgabequalität, insbesondere im Bereich Coding.

    17Lesezeichen2254Aufrufe

    KI & AI· News

  • X-Post:Mia

    Performance-Update für Qwen3.8 Flash Next auf DGX Spark

    Mia (@MiaAI_lab) hat ein Performance-Update für das Modell Qwen3.8 Flash Next auf einem einzelnen DGX Spark vorgestellt. Die Aktualisierung steigert die Generierungsrate auf bis zu 108 Tokens pro Sekunde bei mehreren Streams und erweitert den KV-Cache auf 1M.

    520Lesezeichen75.709Aufrufe

    KI & AI· Ankündigung

  • Repository:MiaAI-Lab/DeepSeek-v4-Flash-One-DGX-Spark

    DeepSeek-v4-Flash auf einer einzelnen DGX Spark betreiben

    Ein Open-Source-Launcher und Docker-Setup, mit dem DeepSeek V4 Flash 0731 (EXL3) auf einer einzelnen NVIDIA DGX Spark mit 128 GiB Unified Memory ausgeführt werden kann.

    328SternePython

    KI & AI· Tool

  • Artikel:Elite Test Engineering

    DeepSeek V4 Flash auf zwei DGX-Spark-Nodes im Produktivbetrieb

    Ein Erfahrungsbericht dokumentiert das Aufsetzen des Modells DeepSeek-V4-Flash (284B MoE) über zwei DGX-Spark-Nodes mit Grace-Blackwell-Architektur mittels Ray und vLLM. Neben Hardware-Eigenheiten wie Unified Memory und NCCL-Bugs zeigt der Bericht, wie Multi-Token Prediction die Geschwindigkeit um 45 Prozent steigerte.

    KI & AI· Anleitung

Lassen Sie uns über Ihr Projekt sprechen

Standorte

  • Mattersburg
    Johann Nepomuk Bergerstraße 7/2/14
    7210 Mattersburg, Austria
  • Wien
    Ungargasse 64-66/3/404
    1030 Wien, Austria

Dieser Inhalt wurde teilweise mithilfe von KI erstellt.