GLM-5.3 Flash EXL3 auf 2x NVIDIA DGX Spark Kits

RepositoryMiaAI-Lab/GLM-5.3-Flash-EXL3-2x-DGX-SparksTool

Das GitHub-Repository von Mia's AI Lab bietet eine optimierte vLLM-Serving-Konfiguration für GLM-5.3-Flash mit 4-bpw-EXL3-Quantisierung auf zwei NVIDIA GB10 Systemen.

Das Wichtigste

  1. OpenAI-kompatibles vLLM-Serving für GLM-5.3-Flash mit EXL3/TR3-Quantisierung (4 bpw, ca. 164 GiB über 120 Shards).
  2. Ausgelegt für 2x NVIDIA GB10 mit Tensor Parallelism (TP=2) über CX7 und nativen sm_121a Cubins.
  3. Optimierte MoE-Prefills mittels EXL3_FAT_GROUPED: Ersetzt Host-Schleifen durch drei GPU-gesteuerte Launches pro Layer ohne Host-Synchronisation.
  4. Kombiniert EXL3-Gewichte mit gepacktem fp8 KV-Cache (fp8_ds_mla) und spekulativer Dekodierung über DFlash2 (k=7) mit FLASH_ATTN.

Warum das relevant ist

Große MoE-Modelle wie GLM-5.3-Flash erfordern bei lokaler Bereitstellung enormen Speicher und extrem optimierte Kernels, um praktikable Latenzen zu erzielen. Das Setup demonstriert, wie hardwarenahe CUDA-Optimierungen und spekulative Dekodierung komplexe Modelle auf zwei GB10-Beschleunigern performant betreibbar machen.

Einordnung

Das Projekt richtet sich an ML-Engineers und Infrastrukturbetreiber, die das GLM-5.3-Flash-Modell auf Nvidia-GB10-Hardware hosten wollen. Durch den Verzicht auf Marlin-Backends und die Einführung von Kernel-Optimierungen für MoE-Schichten wird Host-Overhead minimiert. Der Reifegrad entspricht einem spezialisierten Performance-Rezept mit maßgeschneiderten Docker-Images und Messungen über sparkDash.

Gefunden in

Zusammenfassung von KI erstellt (Gemini 3.8 Flash, 27. September 2026). Sie kann Fehler enthalten – maßgeblich ist die Originalquelle.

Inhaltlich ähnlich, ermittelt über die KI-Suche.

  • Repository:MiaAI-Lab/DeepSeek-v4-Flash-One-DGX-Spark

    DeepSeek-v4-Flash auf einer einzelnen DGX Spark betreiben

    Ein Open-Source-Launcher und Docker-Setup, mit dem DeepSeek V4 Flash 0731 (EXL3) auf einer einzelnen NVIDIA DGX Spark mit 128 GiB Unified Memory ausgeführt werden kann.

    328SternePython

    KI & AI· Tool

  • Repository:eugr/spark-vllm-docker

    spark-vllm-docker: Optimierte vLLM-Docker-Setups für DGX Spark

    spark-vllm-docker ist ein Open-Source-Projekt, das Docker-Konfigurationen und Startskripte bereitstellt, um das LLM-Inferenz-Framework vLLM auf NVIDIA DGX Spark-Systemen auszuführen. Es unterstützt Einzelknoten sowie Multi-Node-Cluster über Ray oder vLLMs nativen PyTorch-Distributed-Modus.

    2222SterneShell

    KI & AI· Tool

  • Artikel:Elite Test Engineering

    DeepSeek V4 Flash auf zwei DGX-Spark-Nodes im Produktivbetrieb

    Ein Erfahrungsbericht dokumentiert das Aufsetzen des Modells DeepSeek-V4-Flash (284B MoE) über zwei DGX-Spark-Nodes mit Grace-Blackwell-Architektur mittels Ray und vLLM. Neben Hardware-Eigenheiten wie Unified Memory und NCCL-Bugs zeigt der Bericht, wie Multi-Token Prediction die Geschwindigkeit um 45 Prozent steigerte.

    KI & AI· Anleitung

  • X-Post:Mia

    Inkling-Small auf zwei NVIDIA DGX Spark mit 1M Kontext

    Mia (@MiaAI_lab) berichtet über den Betrieb von Inkling-Small auf zwei NVIDIA DGX Spark mit einem Kontextfenster von einer Million Tokens via SGLang und dspark Speculative Drafts.

    106Lesezeichen9536Aufrufe

    KI & AI· Ankündigung

Lassen Sie uns über Ihr Projekt sprechen

Standorte

  • Mattersburg
    Johann Nepomuk Bergerstraße 7/2/14
    7210 Mattersburg, Austria
  • Wien
    Ungargasse 64-66/3/404
    1030 Wien, Austria

Dieser Inhalt wurde teilweise mithilfe von KI erstellt.