Clock-Sweep auf Dual-DGX-Spark: Mehr Effizienz bei 1800 MHz

X-PostWeiForschung

Wei hat ein Dual-DGX-Spark-Setup mit Taktraten zwischen 1400 und 2200 MHz getestet, um die ideale Konfiguration für den Produktivbetrieb zu ermitteln. Die Wahl fiel auf 1800 MHz, da diese Frequenz rund 30 % Strom spart und die Spitzenhitze um 5–7 °C senkt, während der Leistungsverlust minimal bleibt.

Das Wichtigste

  1. Takttests wurden von 2200 über 2000, 1800, 1600 bis hinab zu 1400 MHz durchgeführt.
  2. Bei 1800 MHz bleiben im Vergleich zu 2200 MHz etwa 93 % des Single-Concurrency-Decode, 97,5 % des Aggregate-Decode bei vier Anfragen und 93 % der Prefill-Leistung bei kalten 32K Token erhalten.
  3. Der Durchsatz bei Decode sinkt lediglich um etwa 5 %, während der durchschnittliche Stromverbrauch um rund 30 % und die Spitzentemperaturen um 5–7 °C sinken.
  4. Wei setzt die Konfiguration bereits aktiv ein und berichtet von subjektiv gleicher Geschwindigkeit bei spürbar geringerer Hitzeentwicklung.

Warum das relevant ist

Für den dauerhaften Produktivbetrieb von Inferenz-Clustern sind Energieverbrauch und Wärmeentwicklung zentrale Kosten- und Stabilitätsfaktoren. Eine leichte Taktsenkung zeigt, dass sich signifikante Einsparungen bei Strom und thermischer Belastung erzielen lassen, ohne dass die Antwortzeiten für Endanwender spürbar leiden.

Einordnung

Der Test verdeutlicht das Prinzip abnehmender Erträge im oberen Taktbereich moderner Hardware. Das Betreiben am Limit (2200 MHz) erkauft winzige Latenzvorteile mit überproportional hohem Energieverbrauch und thermischem Stress. Für Hosting-Umgebungen und KI-Infrastruktur lohnt sich daher ein systematischer Clock Sweep, um den energetischen Sweet Spot zu finden.

Original-Post

Wei

@wei_wang · 24. August 2026

把双 DGX Spark 从 2200、2000、1800、1600 一路测到 1400 MHz,终于找到了更适合 Production 的配置。 最终选择 1800 MHz。 在完整 Clock Sweep 里,1800 MHz 相比 2200 MHz 保留了约 93% 的单并发 Decode、97.5% 的四并发 Aggregate Decode,以及 93% 的冷 32K Prefill 性能。 换来的收益很实际。 t.co/3tc2yEfD5r

118 Likes33 Antworten163 Lesezeichen7787 Aufrufe

Auf X ansehen
Weitere Posts im Thread (1)
  1. @Pakero8x yep, running this now, speed feeling the same but with much less heat
Ausgewählte Antworten (4)
  • @shuizhuyu @wei_wang 这种压频测试太实用了,生产环境本来就不追求极限性能,降一点频率换三成功耗和好几度降温,对于长期跑推理的服务来说太划算了。
  • @Pakero8x @wei_wang Pretty confident in this decision after seeing the results at lower frequencies.
  • @QT9277 @wei_wang alpha:能耗比才是真 alpha。
  • @alkaidy2025 @wei_wang 降低约 30% 平均功耗来换5%的decode损失,取舍清晰

Zusammenfassung von KI erstellt (Gemini 3.8 Flash, 27. September 2026). Sie kann Fehler enthalten – maßgeblich ist die Originalquelle.

Inhaltlich ähnlich, ermittelt über die KI-Suche.

  • X-Post:Mike Gannotti

    Qwen3.8-Flash-Next auf einzelner NVIDIA DGX Spark übertrifft Dual-Spark-Setup im Benchmark

    Ein Testbericht von SMF Clearinghouse zeigt, dass das Modell Qwen3.8-Flash-Next (NVFP4) auf einer einzelnen NVIDIA DGX Spark (GB10) im Benchmark 'smf-bench Official A' 87,3 % erreicht hat. Damit übertrifft die Einzel-Node-Konfiguration das bisherige Dual-Spark-Setup von DeepSeek V4 Vision-Exp bei der Ausgabequalität, insbesondere im Bereich Coding.

    17Lesezeichen2254Aufrufe

    KI & AI· News

  • X-Post:Mia

    Performance-Update für Qwen3.8 Flash Next auf DGX Spark

    Mia (@MiaAI_lab) hat ein Performance-Update für das Modell Qwen3.8 Flash Next auf einem einzelnen DGX Spark vorgestellt. Die Aktualisierung steigert die Generierungsrate auf bis zu 108 Tokens pro Sekunde bei mehreren Streams und erweitert den KV-Cache auf 1M.

    520Lesezeichen75.709Aufrufe

    KI & AI· Ankündigung

  • Artikel:Nemo, DGX Spark & Local Inference Engineer

    Qwen3.8-Flash-Next erreicht 87,3 % auf einer einzelnen DGX Spark

    Ein lokaler Test von Qwen3.8-Flash-Next NVFP4 auf einem einzelnen NVIDIA DGX Spark (GB10) erzielt im smf-bench Official A 87,3 % und übertrifft damit frühere Ergebnisse eines Dual-Spark-Setups mit DeepSeek V4.

    KI & AI· Forschung

  • X-Post:Tech2Wild

    Optimizing Dual GPU Setups for Large Language Models

    This post explores a technical setup for running large language models using dual GPU configurations, specifically highlighting the use of hardware like the Spark and dual 4090s. The author provides a detailed guide on managing context windows and model instances to improve performance and efficiency for local AI workflows.

    52Lesezeichen8671Aufrufe

    KI & AI

  • Video

    Video:Heavy Metal Cloud

    Nvidia DGX Spark im Praxistest: Setup, vLLM-Serving und Vergleich mit dem Mac Studio

    Heavy Metal Cloud testet die DGX-Spark-Varianten von Gigabyte und ASUS mit Grace-Blackwell-Architektur für lokales KI-Inference und Medien-Rendering. Neben einer Schritt-für-Schritt-Anleitung für Docker, vLLM und ComfyUI zeigt das Video Vor- und Nachteile gegenüber Apples Mac Studio.

    KI & AI· Anleitung

  • Artikel:Elite Test Engineering

    DeepSeek V4 Flash auf zwei DGX-Spark-Nodes im Produktivbetrieb

    Ein Erfahrungsbericht dokumentiert das Aufsetzen des Modells DeepSeek-V4-Flash (284B MoE) über zwei DGX-Spark-Nodes mit Grace-Blackwell-Architektur mittels Ray und vLLM. Neben Hardware-Eigenheiten wie Unified Memory und NCCL-Bugs zeigt der Bericht, wie Multi-Token Prediction die Geschwindigkeit um 45 Prozent steigerte.

    KI & AI· Anleitung

Lassen Sie uns über Ihr Projekt sprechen

Standorte

  • Mattersburg
    Johann Nepomuk Bergerstraße 7/2/14
    7210 Mattersburg, Austria
  • Wien
    Ungargasse 64-66/3/404
    1030 Wien, Austria

Dieser Inhalt wurde teilweise mithilfe von KI erstellt.