DeepSeek-V4-Flash-0731: Offizielles Release mit spekulativer Decodierung unter MIT-Lizenz

Linkdeepseek-aiSammlung

DeepSeek-AI hat DeepSeek-V4-Flash-0731 offiziell auf Hugging Face veröffentlicht. Das 304-Milliarden-Parameter-Modell ersetzt die Preview-Version und bringt integrierte spekulative Decodierung (DSpark) sowie deutlich verbesserte Agenten-Fähigkeiten mit.

Das Wichtigste

  1. Offizielle Version von DeepSeek-V4-Flash unter der MIT-Lizenz mit 304B Parametern und FP8-Präzision.
  2. Integriertes DSpark-Modul für spekulative Decodierung, wodurch kein separates Draft-Modell in vLLM oder SGLang benötigt wird.
  3. Übertrifft laut Entwickler DeepSeek-V4-Pro (Preview) in diversen Benchmarks wie Terminal Bench 2.1 (82.7) und DeepSWE (54.4) trotz geringerer Zahl aktivierter Parameter.
  4. Neuer Parameter reasoning_effort (low, high, max) steuert die Denkzeit des Modells; empfohlene maximale Ausgabelänge liegt bei 384K Tokens.
  5. Verzicht auf Jinja-Chat-Templates zugunsten eines dedizierten Python-Encoders (encoding_dsv4) für OpenAI-kompatible Prompts.

Warum das relevant ist

Das Release kombiniert hohe Agenten- und Programmierleistung mit direkter Unterstützung für spekulative Decodierung in gängigen Inference-Engines wie vLLM und SGLang. Durch die permissive MIT-Lizenz eignet sich das Modell für effiziente lokale und selbst gehostete Enterprise-Deployments.

Einordnung

DeepSeek optimiert mit Version 0731 vor allem die Inferenz-Effizienz und Agentic-Workflows. Bemerkenswert ist die Kopplung von Ziel- und Draft-Gewichten in einem einzigen Checkpoint über DSpark, was die Server-Konfiguration vereinfacht. Die Benchmark-Ergebnisse positionieren das Flash-Modell nahe an größeren proprietären Modellen wie Opus-4.8 bei Code- und Terminal-Aufgaben. Der Verzicht auf Standard-Jinja-Templates erfordert jedoch Anpassungen im Preprocessing via eigener Encoding-Skripte.

Gefunden in

Zusammenfassung von KI erstellt (Gemini 3.8 Flash, 27. September 2026). Sie kann Fehler enthalten – maßgeblich ist die Originalquelle.

Inhaltlich ähnlich, ermittelt über die KI-Suche.

  • Link:deepseek-ai

    DeepSeek veröffentlicht DeepSeek-V4-Pro-DSpark mit spekulativer Dekodierung

    DeepSeek hat die Modelldokumentation und Gewichte für DeepSeek-V4-Pro-DSpark auf Hugging Face bereitgestellt. Es handelt sich um das MoE-Modell DeepSeek-V4-Pro mit einem integrierten Modul für spekulative Dekodierung (DSpark) zur Beschleunigung der Inferenz.

    KI & AI· Sammlung

  • Artikel:DeepSeek AI

    DeepSeek veröffentlicht DeepSeek-V4 Preview als Open Source mit 1M Kontext

    DeepSeek hat die Preview-Version von DeepSeek-V4 als Open Source freigegeben. Die Modellreihe umfasst die Varianten DeepSeek-V4-Pro und DeepSeek-V4-Flash, bietet standardmäßig ein Kontextfenster von einer Million Tokens und bringt neue Architekturen zur Rechenzeit- und Speicheroptimierung mit.

    KI & AI· Ankündigung

  • Link:deepseek-ai

    NVIDIA Build stellt DeepSeek-V4-Flash-0731 bereit

    DeepSeek-V4-Flash-0731 ist ein Mixture-of-Experts-Sprachmodell mit 13 Milliarden aktiven Parametern und einem Kontextfenster von rund einer Million Tokens. Der Modellkatalog von NVIDIA Build listet die Spezifikationen, Architektureigenschaften und Benchmarks für Coding- und Agenten-Workflows.

    KI & AI· Sammlung

  • Link:Tencent Hy Team

    Tencent veröffentlicht MoE-Modell Hy4-preview unter Apache-2.0-Lizenz

    Das Tencent Hy Team hat Hy4-preview als quelloffenes Mixture-of-Experts-Modell (MoE) mit 770 Milliarden Gesamtparametern und 49 Milliarden aktiven Parametern pro Token vorgestellt. Das Flaggschiff-Modell bietet ein Kontextfenster von 1 Million Tokens und wurde für Aufgaben in Softwareentwicklung, Büroarbeit und wissenschaftlicher Forschung optimiert.

    KI & AI· Ankündigung

Lassen Sie uns über Ihr Projekt sprechen

Standorte

  • Mattersburg
    Johann Nepomuk Bergerstraße 7/2/14
    7210 Mattersburg, Austria
  • Wien
    Ungargasse 64-66/3/404
    1030 Wien, Austria

Dieser Inhalt wurde teilweise mithilfe von KI erstellt.