DeepSeek veröffentlicht DeepSeek-V4-Pro-DSpark mit spekulativer Dekodierung

Linkdeepseek-aiSammlung

DeepSeek hat die Modelldokumentation und Gewichte für DeepSeek-V4-Pro-DSpark auf Hugging Face bereitgestellt. Es handelt sich um das MoE-Modell DeepSeek-V4-Pro mit einem integrierten Modul für spekulative Dekodierung (DSpark) zur Beschleunigung der Inferenz.

Das Wichtigste

  1. DeepSeek-V4-Pro-DSpark basiert auf dem DeepSeek-V4-Pro-Checkpoint und ergänzt ein spekulatives Dekodierungsmodul (DeepSpec / DSpark).
  2. Die DeepSeek-V4-Reihe umfasst Modelle wie V4-Pro (1,6 Billionen Gesamtparameter, 49 Milliarden aktivierte Parameter) und V4-Flash (284 Milliarden Gesamtparameter, 13 Milliarden aktiviert) mit jeweils 1 Million Token Kontextlänge.
  3. Architektur-Upgrades umfassen Hybrid-Attention (CSA und HCA), Manifold-Constrained Hyper-Connections (mHC) und den Muon-Optimierer.
  4. Im Kontext von 1M Token benötigt DeepSeek-V4-Pro im Vergleich zu DeepSeek-V3.2 laut Herstellerangaben nur 27 Prozent der Inferenz-FLOPs pro Token und 10 Prozent des KV-Caches.
  5. Das Modell unterstützt drei Reasoning-Modi (Non-think, Think High, Think Max) und steht unter der MIT-Lizenz.

Warum das relevant ist

Große Mixture-of-Experts-Modelle mit extrem langen Kontexten erfordern enorme Speicher- und Rechenressourcen. Durch Techniken wie DSpark-basierte spekulative Dekodierung und komprimierte Hybrid-Attention senkt DeepSeek den Rechen- und KV-Cache-Aufwand für 1-Million-Token-Kontexte im Open-Source-Umfeld deutlich.

Einordnung

Das Release verdeutlicht den Trend zu massiven MoE-Architekturen, bei denen nur ein kleiner Bruchteil der Parameter aktiv ist (49B von 1,6T). Anstelle reiner Parameter-Skalierung liegt der Schwerpunkt auf Inferenz-Effizienz: Die Kombination aus spekulativer Dekodierung (DSpark), FP4/FP8-Mischpräzision und Hybrid-Attention zielt darauf ab, extrem lange Kontexte in Frameworks wie vLLM und SGLang handhabbar zu machen. Auffällig ist zudem der Verzicht auf herkömmliche Jinja-Chat-Templates zugunsten eines separaten Python-Encodings.

Gefunden in

Zusammenfassung von KI erstellt (Gemini 3.8 Flash, 27. September 2026). Sie kann Fehler enthalten – maßgeblich ist die Originalquelle.

Inhaltlich ähnlich, ermittelt über die KI-Suche.

  • Artikel:DeepSeek AI

    DeepSeek veröffentlicht DeepSeek-V4 Preview als Open Source mit 1M Kontext

    DeepSeek hat die Preview-Version von DeepSeek-V4 als Open Source freigegeben. Die Modellreihe umfasst die Varianten DeepSeek-V4-Pro und DeepSeek-V4-Flash, bietet standardmäßig ein Kontextfenster von einer Million Tokens und bringt neue Architekturen zur Rechenzeit- und Speicheroptimierung mit.

    KI & AI· Ankündigung

  • Link:Tencent Hy Team

    Tencent veröffentlicht MoE-Modell Hy4-preview unter Apache-2.0-Lizenz

    Das Tencent Hy Team hat Hy4-preview als quelloffenes Mixture-of-Experts-Modell (MoE) mit 770 Milliarden Gesamtparametern und 49 Milliarden aktiven Parametern pro Token vorgestellt. Das Flaggschiff-Modell bietet ein Kontextfenster von 1 Million Tokens und wurde für Aufgaben in Softwareentwicklung, Büroarbeit und wissenschaftlicher Forschung optimiert.

    KI & AI· Ankündigung

  • Link:deepseek-ai

    NVIDIA Build stellt DeepSeek-V4-Flash-0731 bereit

    DeepSeek-V4-Flash-0731 ist ein Mixture-of-Experts-Sprachmodell mit 13 Milliarden aktiven Parametern und einem Kontextfenster von rund einer Million Tokens. Der Modellkatalog von NVIDIA Build listet die Spezifikationen, Architektureigenschaften und Benchmarks für Coding- und Agenten-Workflows.

    KI & AI· Sammlung

Lassen Sie uns über Ihr Projekt sprechen

Standorte

  • Mattersburg
    Johann Nepomuk Bergerstraße 7/2/14
    7210 Mattersburg, Austria
  • Wien
    Ungargasse 64-66/3/404
    1030 Wien, Austria

Dieser Inhalt wurde teilweise mithilfe von KI erstellt.