MiniMax-H3 auf Nvidia DGX Spark: Beschleunigung und ComfyUI-Optimierung

X-PostkeysTool

Ein neues Repository demonstriert die Beschleunigung des multimodalen 33B-Modells MiniMax-H3 um den Faktor 1,54 auf einer einzelnen Nvidia DGX Spark (GB10, sm_121) unter ComfyUI. Die Lösung kombiniert Patches für Nvidia Sol-Engine, Triton-Kernel und VAE-Optimierungen.

Das Wichtigste

  1. Das 33B-Audio/Video-Modell MiniMax-H3 rendert einen 5-Sekunden-Clip (864x480) in 202,5 statt 312,7 Sekunden (1,54x Beschleunigung).
  2. Korrektur eines Fehlers in Sol-Attn auf GB10 (sm_121), bei dem flex_attention stillschweigend fehlerhaften Code kompilierte und defekte Ausgaben erzeugte.
  3. Portierung von Nvidias FirstBlockCache und stapelweisem VAE-Tile-Decoding auf Single-GPU-Setups in ComfyUI.
  4. Integration von kijai Triton-INT8/TMA-Kerneln für Blackwell-Architekturen.
  5. Multi-Node-Testing zeigte, dass verteiltes Rendering (CP=2) durch Bandbreitenlimits (5,52 GB/s vs. 503 GB/s NVLink) langsamer ist als eine optimierte Einzel-Node.
  6. Enthält ein automatisches Installationsskript (install.sh) sowie ein Rezept (RECIPE.md) zur Ausführung via Coding-Agents wie Claude Code oder Codex.

Warum das relevant ist

Große generative Video- und Audiomodelle sind extrem rechenintensiv. Das Projekt löst architektur-spezifische Kompilierungsfehler auf Nvidias Blackwell-Chip GB10 und zeigt praxisnah, wie Multi-GPU-Optimierungen aus Frameworks wie SGLang erfolgreich auf Single-GPU-Workflows in ComfyUI übertragen werden können.

Einordnung

Das Repository liefert nicht nur reine Geschwindigkeitsverbesserungen, sondern behebt ein kritisches Debugging-Problem: den stillen Kompilierungsfehler von flex_attention auf der Compute-Capability 12.1. Durch die detaillierte Messung einzelner Komponenten (Sol-Attn, FirstBlockCache, VAE-Batching) und den Nachweis, dass Multi-Node-Splitting auf DGX Spark aufgrund von Fabric-Flaschenhälsen kontraproduktiv ist, erspart die Dokumentation Entwicklern aufwändige Fehlersuchen.

Original-Post

keys 🧪

@u1tra_instinct · 5. August 2026

For those who are interested in Nvidia’s sol-engine and few speed integrations with the MinIMax H3 speed up on single dgx spark here is the repo to test it out just on comfyUI workflow optimization. My testing repo here: (may do More work tomorrow) t.co/jGaZM8ok8q

96 Likes10 Antworten110 Lesezeichen15.641 Aufrufe

Auf X ansehen

Links und Tools aus diesem Beitrag

Zusammenfassung von KI erstellt (Gemini 3.8 Flash, 27. September 2026). Sie kann Fehler enthalten – maßgeblich ist die Originalquelle.

Inhaltlich ähnlich, ermittelt über die KI-Suche.

  • Repository:drowzeys/keys-SM121-Optimized-MiniMax-H3-Nvidia-Sol-Engine-Kijai-SolAttn_Triton-Single-DGX-Spark

    MiniMax-H3-Optimierung für NVIDIA DGX Spark (sm_121)

    Ein optimiertes ComfyUI-Setup für das Audio- und Video-Modell MiniMax-H3 (33B) auf einem einzelnen NVIDIA DGX Spark (GB10, sm_121). Es behebt einen Silent-Compiler-Fehler und beschleunigt das Rendering um das 1,54-Fache.

    30SternePython

    KI & AI· Tool

  • X-Post:keys 🧪

    Lokale Videogenerierung mit ComfyUI, Minimax H3 und Nvidias Sol Engine

    Der Entwickler keys demonstriert die lokale Ausführung von Videogenerierung auf einem Nvidia DGX Spark mittels ComfyUI und Minimax H3. Durch die Integration von Nvidias Sol Engine konnte die Verarbeitungszeit von 28,2 auf 12,5 Sekunden pro Schritt reduziert werden.

    108Lesezeichen6976Aufrufe

    KI & AI· Demo

  • Link:NVIDIA

    NVIDIA DGX Spark Developer Hub: Ressourcen für den GB10 Grace Blackwell Superchip

    NVIDIA bündelt im DGX Spark Developer Hub Anleitungen und Playbooks zur Entwicklung von AI Agents und Modellen auf dem GB10 Grace Blackwell Superchip. Die Plattform bietet Schnellstarts für Werkzeuge wie Open-WebUI, ComfyUI und vLLM sowie Anleitungen für Multi-GPU- und Multi-Spark-Setups.

    KI & AI· Sammlung

  • Repository:MiaAI-Lab/DeepSeek-v4-Flash-One-DGX-Spark

    DeepSeek-v4-Flash auf einer einzelnen DGX Spark betreiben

    Ein Open-Source-Launcher und Docker-Setup, mit dem DeepSeek V4 Flash 0731 (EXL3) auf einer einzelnen NVIDIA DGX Spark mit 128 GiB Unified Memory ausgeführt werden kann.

    328SternePython

    KI & AI· Tool

  • Repository:MiaAI-Lab/GLM-5.3-Flash-EXL3-2x-DGX-Sparks

    GLM-5.3 Flash EXL3 auf 2x NVIDIA DGX Spark Kits

    Das GitHub-Repository von Mia's AI Lab bietet eine optimierte vLLM-Serving-Konfiguration für GLM-5.3-Flash mit 4-bpw-EXL3-Quantisierung auf zwei NVIDIA GB10 Systemen.

    431SternePython

    KI & AI· Tool

Lassen Sie uns über Ihr Projekt sprechen

Standorte

  • Mattersburg
    Johann Nepomuk Bergerstraße 7/2/14
    7210 Mattersburg, Austria
  • Wien
    Ungargasse 64-66/3/404
    1030 Wien, Austria

Dieser Inhalt wurde teilweise mithilfe von KI erstellt.