LLM-Benchmark-Ergebnisse bei 3-Bit-Quantisierung

X-Post0xSeroDiskussion

Ein Beitrag auf X diskutiert unerwartet hohe Leistungswerte eines Sprachmodells bei 3-Bit-Quantisierung (exl-3bits). Bei einem Benchmark-Score von 78,6 % wurden Durchsätze von 100 Token pro Sekunde bei einer Spitzenleistungsaufnahme von 1400 Watt erzielt.

Das Wichtigste

  1. Erreichte Benchmark-Genauigkeit von 78,6 % unter Verwendung von 3-Bit-Quantisierung (exl-3bits).
  2. Inferenz-Geschwindigkeit von rund 100 Token pro Sekunde gemeldet.
  3. Spitzenstromverbrauch lag während des Betriebs bei 1400 Watt.

Warum das relevant ist

Effiziente Quantisierungsmethoden ermöglichen es, große Sprachmodelle mit geringerem Speicherbedarf und hohen Geschwindigkeiten auszuführen, erfordern bei Spitzenlasten jedoch weiterhin erhebliche Hardware-Ressourcen.

Einordnung

Der Autor zeigt sich überrascht über das Verhältnis von Benchmark-Trefferquote und Durchsatz bei starker 3-Bit-Quantisierung. Konkrete Details zum zugrunde liegenden Modell oder Hardware-Setup werden im kurzen Beitrag nicht genannt.

Original-Post

0xSero

@0xSero · 27. Juli 2026

How the heck is this possible scoring 78.6% @ exl-3bits 100 tok/s 1400w at peak. t.co/v3Tck0uSXJ

91 Likes5 Antworten36 Lesezeichen11.045 Aufrufe

Auf X ansehen

Zusammenfassung von KI erstellt (Gemini 3.8 Flash, 27. September 2026). Sie kann Fehler enthalten – maßgeblich ist die Originalquelle.

Inhaltlich ähnlich, ermittelt über die KI-Suche.

  • X-Post:Udi Wertheimer

    PrismML kündigt Ternary Bonsai 2 27B an: 6 GB großes quantisiertes Modell

    Udi Wertheimer hebt die Ankündigung von PrismMLs Ternary Bonsai 2 27B hervor. Das Modell basiert auf Qwen3.8 27B, benötigt lediglich 5,9 GB Speicher und soll laut Hersteller 98,2 % der Benchmark-Leistung des Vollpräzisionsmodells erreichen.

    1468Lesezeichen260.139Aufrufe

    KI & AI· Meinung

  • Artikel:Nemo, DGX Spark & Local Inference Engineer

    Qwen3.8-Flash-Next erreicht 87,3 % auf einer einzelnen DGX Spark

    Ein lokaler Test von Qwen3.8-Flash-Next NVFP4 auf einem einzelnen NVIDIA DGX Spark (GB10) erzielt im smf-bench Official A 87,3 % und übertrifft damit frühere Ergebnisse eines Dual-Spark-Setups mit DeepSeek V4.

    KI & AI· Forschung

  • X-Post:Mike Gannotti

    Qwen3.8-Flash-Next auf einzelner NVIDIA DGX Spark übertrifft Dual-Spark-Setup im Benchmark

    Ein Testbericht von SMF Clearinghouse zeigt, dass das Modell Qwen3.8-Flash-Next (NVFP4) auf einer einzelnen NVIDIA DGX Spark (GB10) im Benchmark 'smf-bench Official A' 87,3 % erreicht hat. Damit übertrifft die Einzel-Node-Konfiguration das bisherige Dual-Spark-Setup von DeepSeek V4 Vision-Exp bei der Ausgabequalität, insbesondere im Bereich Coding.

    17Lesezeichen2254Aufrufe

    KI & AI· News

  • Repository:syv-ai/qwen38-27b-rtx3090

    Qwen3.8-27B auf einer RTX 3090: Hochleistungs-Serving mit vLLM

    Das Repository bietet eine optimierte Serving-Lösung, um das Modell Qwen3.8-27B auf einer einzigen Consumer-Grafikkarte (RTX 3090 mit 24 GB VRAM) mit vLLM 0.28.0 und bis zu 150k–262k Kontextlänge zu betreiben.

    1142SternePython

    KI & AI· Tool

  • X-Post:Wei

    Clock-Sweep auf Dual-DGX-Spark: Mehr Effizienz bei 1800 MHz

    Wei hat ein Dual-DGX-Spark-Setup mit Taktraten zwischen 1400 und 2200 MHz getestet, um die ideale Konfiguration für den Produktivbetrieb zu ermitteln. Die Wahl fiel auf 1800 MHz, da diese Frequenz rund 30 % Strom spart und die Spitzenhitze um 5–7 °C senkt, während der Leistungsverlust minimal bleibt.

    163Lesezeichen7787Aufrufe

    KI & AI· Forschung

  • Artikel:unsloth.ai

    Unsloth Benchmarks: Höhere Geschwindigkeit und verringerter VRAM-Bedarf bei QLoRA

    Die Dokumentation von Unsloth präsentiert Benchmark-Ergebnisse für das Finetuning von LLMs auf NVIDIA-GPUs. Im Vergleich zur Kombination aus Hugging Face und FlashAttention-2 erreicht Unsloth bei Modellen wie Llama 3.1 und Llama 3.3 eine Verdopplung der Geschwindigkeit, spart über 70 Prozent VRAM ein und ermöglicht deutlich längere Kontextfenster.

    KI & AI· Sammlung

Lassen Sie uns über Ihr Projekt sprechen

Standorte

  • Mattersburg
    Johann Nepomuk Bergerstraße 7/2/14
    7210 Mattersburg, Austria
  • Wien
    Ungargasse 64-66/3/404
    1030 Wien, Austria

Dieser Inhalt wurde teilweise mithilfe von KI erstellt.