spark-vllm-docker: Optimierte vLLM-Docker-Setups für DGX Spark

Repositoryeugr/spark-vllm-dockerTool

spark-vllm-docker ist ein Open-Source-Projekt, das Docker-Konfigurationen und Startskripte bereitstellt, um das LLM-Inferenz-Framework vLLM auf NVIDIA DGX Spark-Systemen auszuführen. Es unterstützt Einzelknoten sowie Multi-Node-Cluster über Ray oder vLLMs nativen PyTorch-Distributed-Modus.

Das Wichtigste

  1. Optimierte Docker-Umgebungen und Startskripte für vLLM auf DGX-Spark-Hardware.
  2. Unterstützung für Einzelknoten sowie Multi-Node-Cluster über Ray oder den nativen PyTorch-Distributed-Modus.
  3. Netzwerkunterstützung für InfiniBand und RDMA (NCCL) sowie Topologien wie Direktverbindungen von zwei Spark-Nodes, QSFP/RoCE-Switches und 3-Node-Mesh-Setups.
  4. Schnelles Laden von Modellen mithilfe von fastsafetensors und InstantTensor.
  5. Vorgefertigte Nightly-Images auf DockerHub (z. B. eugr/spark-vllm:latest) sowie Optionen für Builds aus vorgefertigten Wheels oder Quellcode (vLLM, FlashInfer).
  6. Spezielle Agent-Runbooks und Anleitungen für den Betrieb und die Weiterentwicklung durch KI-Agenten.

Warum das relevant ist

Der Betrieb verteilter Sprachmodelle auf spezialisierter Hardware erfordert oft mühsame Konfigurationen von Netzwerkprotokollen (InfiniBand/RDMA), GPU-Treibern und Inferenz-Laufzeiten. Das Projekt standardisiert diesen Prozess für DGX Spark und reduziert den Einrichtungsaufwand für performante Multi-Node-Inferenz erheblich.

Einordnung

Das Repository richtet sich an ML-Engineers und Infrastruktur-Betreiber, die vLLM auf DGX Spark einsetzen möchten. Obwohl es sich um eine Community-Initiative ohne offizielle NVIDIA-Zugehörigkeit handelt, signalisieren über 2.200 Stars, automatische Nightly-Tests über Pipelines sowie strukturierte Dokumentationen für Agenten einen hohen Reifegrad für den produktionsnahen Einsatz.

Gefunden in

Zusammenfassung von KI erstellt (Gemini 3.8 Flash, 27. September 2026). Sie kann Fehler enthalten – maßgeblich ist die Originalquelle.

Inhaltlich ähnlich, ermittelt über die KI-Suche.

  • Repository:MiaAI-Lab/DeepSeek-v4-Flash-One-DGX-Spark

    DeepSeek-v4-Flash auf einer einzelnen DGX Spark betreiben

    Ein Open-Source-Launcher und Docker-Setup, mit dem DeepSeek V4 Flash 0731 (EXL3) auf einer einzelnen NVIDIA DGX Spark mit 128 GiB Unified Memory ausgeführt werden kann.

    328SternePython

    KI & AI· Tool

  • Repository:MiaAI-Lab/GLM-5.3-Flash-EXL3-2x-DGX-Sparks

    GLM-5.3 Flash EXL3 auf 2x NVIDIA DGX Spark Kits

    Das GitHub-Repository von Mia's AI Lab bietet eine optimierte vLLM-Serving-Konfiguration für GLM-5.3-Flash mit 4-bpw-EXL3-Quantisierung auf zwei NVIDIA GB10 Systemen.

    431SternePython

    KI & AI· Tool

  • Link:NVIDIA

    NVIDIA DGX Spark Developer Hub: Ressourcen für den GB10 Grace Blackwell Superchip

    NVIDIA bündelt im DGX Spark Developer Hub Anleitungen und Playbooks zur Entwicklung von AI Agents und Modellen auf dem GB10 Grace Blackwell Superchip. Die Plattform bietet Schnellstarts für Werkzeuge wie Open-WebUI, ComfyUI und vLLM sowie Anleitungen für Multi-GPU- und Multi-Spark-Setups.

    KI & AI· Sammlung

  • Repository:tonyd2wild/The-Sparky-Command-Center

    Sparky Command Center: Schlankes Monitoring für GPU-Cluster und LLM-Inferenz

    The Sparky Command Center ist ein abhängigkeitsfreies Web-Dashboard zur Überwachung von DGX-Spark-Clustern und Linux-GPU-Systemen. Es erfasst Hardware-Telemetrie über SSH und Inferenzmetriken von vLLM oder llama.cpp ohne zusätzliche Datenbanken oder externe Python-Pakete.

    40SternePython

    KI & AI· Tool

Lassen Sie uns über Ihr Projekt sprechen

Standorte

  • Mattersburg
    Johann Nepomuk Bergerstraße 7/2/14
    7210 Mattersburg, Austria
  • Wien
    Ungargasse 64-66/3/404
    1030 Wien, Austria

Dieser Inhalt wurde teilweise mithilfe von KI erstellt.