MiniMax-H3-Optimierung für NVIDIA DGX Spark (sm_121)

Repositorydrowzeys/keys-SM121-Optimized-MiniMax-H3-Nvidia-Sol-Engine-Kijai-SolAttn_Triton-Single-DGX-SparkTool

Ein optimiertes ComfyUI-Setup für das Audio- und Video-Modell MiniMax-H3 (33B) auf einem einzelnen NVIDIA DGX Spark (GB10, sm_121). Es behebt einen Silent-Compiler-Fehler und beschleunigt das Rendering um das 1,54-Fache.

Das Wichtigste

  1. Behebt einen stillen Compiler-Fehler auf sm_121: Vorherige Sol-Attn-Plugins wählten flex_attention, was auf der DGX-Spark-Architektur ohne Fehlermeldung fehlerhafte Ausgaben erzeugte.
  2. Portiert NVIDIAs Sol-Engine-Techniken (FirstBlockCache und gebatchtes VAE-Tile-Decoding) von Multi-GPU-SGLang auf Single-GPU-ComfyUI.
  3. Beschleunigt die Generierung eines 5-Sekunden-Clips (864×480) von 312,7 s auf 202,5 s (1,54× gesamt, 1,72× pro Schritt) ohne sichtbaren Qualitätsverlust.
  4. Verwendet angepasste Triton-INT8/TMA-Kernel (kijai) und liefert ein One-Shot-Installationsskript (install.sh) sowie ein Rezept für Coding-Agenten.
  5. Zeigt auf, dass Multi-Node-Splitting (CP=2) auf DGX Spark durch die begrenzte Bandbreite (5,52 GB/s) langsamer ist als die Ausführung auf einem einzelnen optimierten Knoten.

Warum das relevant ist

Auf neuer Hardware wie dem DGX Spark (GB10 / sm_121) führen bestehende Attention-Bibliotheken teils zu stillen Berechnungsfehlern, die schwer zu debuggen sind. Das Projekt löst dieses Problem gezielt für MiniMax-H3 und zeigt gleichzeitig, wie Techniken aus Multi-GPU-Server-Stacks für Desktop-Workflows in ComfyUI angepasst werden können.

Einordnung

Das Repository richtet sich spezifisch an Besitzer eines NVIDIA DGX Spark mit GB10-Chip. Für gängige Consumer-GPUs wie die RTX 5090 ist das Projekt nicht gedacht, da dort die Upstream-Plugins ohne Patches funktionieren. Hinsichtlich des Reifegrads handelt es sich um ein spezialisiertes, quelloffenes Hilfsprojekt (30 Stars, Apache 2.0) mit soliden Benchmarks, aber sehr eng gestecktem Hardware-Fokus.

Gefunden in

Zusammenfassung von KI erstellt (Gemini 3.8 Flash, 27. September 2026). Sie kann Fehler enthalten – maßgeblich ist die Originalquelle.

Inhaltlich ähnlich, ermittelt über die KI-Suche.

  • X-Post:keys

    MiniMax-H3 auf Nvidia DGX Spark: Beschleunigung und ComfyUI-Optimierung

    Ein neues Repository demonstriert die Beschleunigung des multimodalen 33B-Modells MiniMax-H3 um den Faktor 1,54 auf einer einzelnen Nvidia DGX Spark (GB10, sm_121) unter ComfyUI. Die Lösung kombiniert Patches für Nvidia Sol-Engine, Triton-Kernel und VAE-Optimierungen.

    110Lesezeichen15.641Aufrufe

    KI & AI· Tool

  • X-Post:keys 🧪

    Lokale Videogenerierung mit ComfyUI, Minimax H3 und Nvidias Sol Engine

    Der Entwickler keys demonstriert die lokale Ausführung von Videogenerierung auf einem Nvidia DGX Spark mittels ComfyUI und Minimax H3. Durch die Integration von Nvidias Sol Engine konnte die Verarbeitungszeit von 28,2 auf 12,5 Sekunden pro Schritt reduziert werden.

    108Lesezeichen6976Aufrufe

    KI & AI· Demo

  • Repository:MiaAI-Lab/DeepSeek-v4-Flash-One-DGX-Spark

    DeepSeek-v4-Flash auf einer einzelnen DGX Spark betreiben

    Ein Open-Source-Launcher und Docker-Setup, mit dem DeepSeek V4 Flash 0731 (EXL3) auf einer einzelnen NVIDIA DGX Spark mit 128 GiB Unified Memory ausgeführt werden kann.

    328SternePython

    KI & AI· Tool

  • Repository:MiaAI-Lab/GLM-5.3-Flash-EXL3-2x-DGX-Sparks

    GLM-5.3 Flash EXL3 auf 2x NVIDIA DGX Spark Kits

    Das GitHub-Repository von Mia's AI Lab bietet eine optimierte vLLM-Serving-Konfiguration für GLM-5.3-Flash mit 4-bpw-EXL3-Quantisierung auf zwei NVIDIA GB10 Systemen.

    431SternePython

    KI & AI· Tool

  • Link:NVIDIA

    NVIDIA DGX Spark Developer Hub: Ressourcen für den GB10 Grace Blackwell Superchip

    NVIDIA bündelt im DGX Spark Developer Hub Anleitungen und Playbooks zur Entwicklung von AI Agents und Modellen auf dem GB10 Grace Blackwell Superchip. Die Plattform bietet Schnellstarts für Werkzeuge wie Open-WebUI, ComfyUI und vLLM sowie Anleitungen für Multi-GPU- und Multi-Spark-Setups.

    KI & AI· Sammlung

  • Video

    Video:Heavy Metal Cloud

    Nvidia DGX Spark im Praxistest: Setup, vLLM-Serving und Vergleich mit dem Mac Studio

    Heavy Metal Cloud testet die DGX-Spark-Varianten von Gigabyte und ASUS mit Grace-Blackwell-Architektur für lokales KI-Inference und Medien-Rendering. Neben einer Schritt-für-Schritt-Anleitung für Docker, vLLM und ComfyUI zeigt das Video Vor- und Nachteile gegenüber Apples Mac Studio.

    KI & AI· Anleitung

Lassen Sie uns über Ihr Projekt sprechen

Standorte

  • Mattersburg
    Johann Nepomuk Bergerstraße 7/2/14
    7210 Mattersburg, Austria
  • Wien
    Ungargasse 64-66/3/404
    1030 Wien, Austria

Dieser Inhalt wurde teilweise mithilfe von KI erstellt.