Inkling-Small auf zwei NVIDIA DGX Spark mit 1M Kontext

X-PostMiaAnkündigung

Mia (@MiaAI_lab) berichtet über den Betrieb von Inkling-Small auf zwei NVIDIA DGX Spark mit einem Kontextfenster von einer Million Tokens via SGLang und dspark Speculative Drafts.

Das Wichtigste

  1. Inkling-Small läuft auf zwei NVIDIA DGX Spark mit einem Kontext von 1M Tokens.
  2. Das Setup nutzt SGLang mit dspark Speculative Drafts.
  3. Die Performance liegt bei etwa 34 Tokens/s im Einzelstream und rund 79 Tokens/s bei sechs parallelen Sitzungen.
  4. Im Gegensatz zum rein textbasierten DeepSeek V4 Flash verarbeitet Inkling-Small auch Bilder, Audio und Video.

Warum das relevant ist

Große Kontextfenster bei multimodaler Inferenz erfordern performante Serving-Lösungen; der Einsatz von Speculative Decoding in SGLang zeigt hier konkrete Durchsatzwerte auf DGX-Hardware.

Einordnung

Der Post demonstriert konkrete Durchsatzdaten für Inkling-Small bei vollem 1M-Kontext unter Verwendung von SGLang und spekulativem Drafting. Bemerkenswert ist die Gegenüberstellung mit DeepSeek V4 Flash, wobei hervorgehoben wird, dass Inkling-Small multimodale Eingaben (Text, Bild, Audio, Video) unterstützt.

Original-Post

Mia

@MiaAI_lab · 2. August 2026

Run Inkling-Small on 2x @NVIDIAAI DGX Spark with 1M context ✨ - SGLang with dspark speculative drafts ~34 tok/s (single stream) ~79 tok/s (6 concurrent sessions) Unlike DeepSeek V4 Flash which supports only text, Inkling-Small also supports images, audio, and video. Special

129 Likes13 Antworten106 Lesezeichen9536 Aufrufe

Auf X ansehen

Zusammenfassung von KI erstellt (Gemini 3.8 Flash, 27. September 2026). Sie kann Fehler enthalten – maßgeblich ist die Originalquelle.

Inhaltlich ähnlich, ermittelt über die KI-Suche.

  • Repository:MiaAI-Lab/DeepSeek-v4-Flash-One-DGX-Spark

    DeepSeek-v4-Flash auf einer einzelnen DGX Spark betreiben

    Ein Open-Source-Launcher und Docker-Setup, mit dem DeepSeek V4 Flash 0731 (EXL3) auf einer einzelnen NVIDIA DGX Spark mit 128 GiB Unified Memory ausgeführt werden kann.

    328SternePython

    KI & AI· Tool

  • Artikel:Elite Test Engineering

    DeepSeek V4 Flash auf zwei DGX-Spark-Nodes im Produktivbetrieb

    Ein Erfahrungsbericht dokumentiert das Aufsetzen des Modells DeepSeek-V4-Flash (284B MoE) über zwei DGX-Spark-Nodes mit Grace-Blackwell-Architektur mittels Ray und vLLM. Neben Hardware-Eigenheiten wie Unified Memory und NCCL-Bugs zeigt der Bericht, wie Multi-Token Prediction die Geschwindigkeit um 45 Prozent steigerte.

    KI & AI· Anleitung

  • X-Post:Mia

    Performance-Update für Qwen3.8 Flash Next auf DGX Spark

    Mia (@MiaAI_lab) hat ein Performance-Update für das Modell Qwen3.8 Flash Next auf einem einzelnen DGX Spark vorgestellt. Die Aktualisierung steigert die Generierungsrate auf bis zu 108 Tokens pro Sekunde bei mehreren Streams und erweitert den KV-Cache auf 1M.

    520Lesezeichen75.709Aufrufe

    KI & AI· Ankündigung

  • X-Post:Mike Gannotti

    Qwen3.8-Flash-Next auf einzelner NVIDIA DGX Spark übertrifft Dual-Spark-Setup im Benchmark

    Ein Testbericht von SMF Clearinghouse zeigt, dass das Modell Qwen3.8-Flash-Next (NVFP4) auf einer einzelnen NVIDIA DGX Spark (GB10) im Benchmark 'smf-bench Official A' 87,3 % erreicht hat. Damit übertrifft die Einzel-Node-Konfiguration das bisherige Dual-Spark-Setup von DeepSeek V4 Vision-Exp bei der Ausgabequalität, insbesondere im Bereich Coding.

    17Lesezeichen2254Aufrufe

    KI & AI· News

  • Video

    Video:EliteTestEngineering

    DeepSeek V4 Flash auf Cluster aus DGX Spark und Acer GN100 im Test

    EliteTestEngineering demonstriert den Betrieb von DeepSeek V4 Flash auf einem Two-Node-Cluster aus einem DGX Spark und einem Acer GN100. Das MoE-Modell erreicht dabei Inferenzgeschwindigkeiten von 10 bis 16,5 Tokens pro Sekunde, stößt jedoch bei wachsendem Kontext schnell an Speichergrenzen.

    KI & AI· Demo

Lassen Sie uns über Ihr Projekt sprechen

Standorte

  • Mattersburg
    Johann Nepomuk Bergerstraße 7/2/14
    7210 Mattersburg, Austria
  • Wien
    Ungargasse 64-66/3/404
    1030 Wien, Austria

Dieser Inhalt wurde teilweise mithilfe von KI erstellt.