Tencent Hunyuan stellt Hy4-preview vor: 770B MoE-Modell mit Sparse Attention

RepositoryTencent-Hunyuan/Hy4-previewAnkündigung

Das Tencent Hy Team hat Hy4-preview veröffentlicht, ein neues Mixture-of-Experts (MoE) Flaggschiff-Modell mit insgesamt 770 Milliarden Parametern, wovon 49 Milliarden pro Token aktiv sind. Es kombiniert MoE-Layer, Gated DeepSeek Sparse Attention und Multi-Token Prediction für spekulatives Decoding.

Das Wichtigste

  1. Architektur mit 770B Gesamtparametern und 49B aktivierten Parametern pro Token über 78 Layer.
  2. MoE-Aufbau ab Layer 2 mit 256 gerouteten Experten und einem geteilten Experten (Top-8 Aktivierung).
  3. Native MTP-Schicht (10B Parameter, 0,7B aktiviert) zur Beschleunigung via spekulatives Decoding.
  4. Einsatz von Gated DeepSeek Sparse Attention (Gated DSA) mit IndexCache sowie identity Hyper-Connections (iHC).
  5. Bereitstellung für Inferenz-Frameworks wie vLLM und SGLang sowie Modellgewichte auf Hugging Face und ModelScope.

Warum das relevant ist

Große MoE-Architekturen ermöglichen Flaggschiff-Leistung bei verringerten Inferenzkosten pro Token. Mit Hy4-preview adaptiert Tencent jüngste Architekturinnovationen wie Sparse Attention und MTP für offene Großmodelle.

Einordnung

Das Repository stellt eine Vorschau auf die Hy4-Modellgeneration dar. Der Fokus liegt auf Recheneffizienz bei enormer Gesamtgröße (770B). Technisch bedient sich Tencent an Ansätzen aus DeepSeek und GLM (Gated DSA, IndexCache) und erweitert Residualverbindungen über iHC. Da es sich explizit um eine Preview-Version handelt, zielt das Projekt vor allem auf Evaluierung, Benchmarking und die Integration in Deployment-Stacks wie vLLM und SGLang ab.

Gefunden in

Zusammenfassung von KI erstellt (Gemini 3.8 Flash, 27. September 2026). Sie kann Fehler enthalten – maßgeblich ist die Originalquelle.

Inhaltlich ähnlich, ermittelt über die KI-Suche.

  • Link:Tencent Hy Team

    Tencent veröffentlicht MoE-Modell Hy4-preview unter Apache-2.0-Lizenz

    Das Tencent Hy Team hat Hy4-preview als quelloffenes Mixture-of-Experts-Modell (MoE) mit 770 Milliarden Gesamtparametern und 49 Milliarden aktiven Parametern pro Token vorgestellt. Das Flaggschiff-Modell bietet ein Kontextfenster von 1 Million Tokens und wurde für Aufgaben in Softwareentwicklung, Büroarbeit und wissenschaftlicher Forschung optimiert.

    KI & AI· Ankündigung

  • Link:deepseek-ai

    DeepSeek veröffentlicht DeepSeek-V4-Pro-DSpark mit spekulativer Dekodierung

    DeepSeek hat die Modelldokumentation und Gewichte für DeepSeek-V4-Pro-DSpark auf Hugging Face bereitgestellt. Es handelt sich um das MoE-Modell DeepSeek-V4-Pro mit einem integrierten Modul für spekulative Dekodierung (DSpark) zur Beschleunigung der Inferenz.

    KI & AI· Sammlung

  • Artikel:DeepSeek AI

    DeepSeek veröffentlicht DeepSeek-V4 Preview als Open Source mit 1M Kontext

    DeepSeek hat die Preview-Version von DeepSeek-V4 als Open Source freigegeben. Die Modellreihe umfasst die Varianten DeepSeek-V4-Pro und DeepSeek-V4-Flash, bietet standardmäßig ein Kontextfenster von einer Million Tokens und bringt neue Architekturen zur Rechenzeit- und Speicheroptimierung mit.

    KI & AI· Ankündigung

  • Repository:Tencent/AngelSlim

    Tencent AngelSlim: Umfassendes Toolkit zur Modellkomprimierung und Beschleunigung von LLMs

    AngelSlim ist ein quelloffenes Python-Toolkit von Tencent zur Komprimierung und Beschleunigung großer Sprach- und Multimodalmodelle. Es bietet Methoden für Quantisierung, spekulatives Decoding und Sparse Attention, um ressourcenintensive Modelle wie Hunyuan oder Qwen effizienter zu trainieren und auszuführen.

    1627SternePython

    KI & AI· Tool

Lassen Sie uns über Ihr Projekt sprechen

Standorte

  • Mattersburg
    Johann Nepomuk Bergerstraße 7/2/14
    7210 Mattersburg, Austria
  • Wien
    Ungargasse 64-66/3/404
    1030 Wien, Austria

Dieser Inhalt wurde teilweise mithilfe von KI erstellt.