Tencent AngelSlim: Umfassendes Toolkit zur Modellkomprimierung und Beschleunigung von LLMs

RepositoryTencent/AngelSlimTool

AngelSlim ist ein quelloffenes Python-Toolkit von Tencent zur Komprimierung und Beschleunigung großer Sprach- und Multimodalmodelle. Es bietet Methoden für Quantisierung, spekulatives Decoding und Sparse Attention, um ressourcenintensive Modelle wie Hunyuan oder Qwen effizienter zu trainieren und auszuführen.

Das Wichtigste

  1. Breite Methodenvielfalt: Beinhaltet Quantisierung (u. a. FP8-Static, FP4, SmoothQuant, MIX-STQ1_0), Sparse Attention (Stem) und Spekulative Decodierung (AngelSpec, DFlare, DFly).
  2. Starke Kompression bei minimalem Genauigkeitsverlust: Eine Demonstration reduzierte die Vorschauversion von Hy4 von 1,5 TB auf 214 GiB bei lediglich 0,7 % Leistungsabfall im SWE-bench Pro.
  3. Hardware- und Trainingsintegration: Unterstützt verteiltes Training (TP, EP, CP, SP) über Megatron-Core zur quantisierungsbewussten Destillation (QAD) und Inferenz über Engines wie Prima.cpp.
  4. Modellunterstützung: Ausgelegt für Architekturen wie Hunyuan (Hy3, Hy4), Qwen (Qwen3-MoE) sowie DeepSeek und Vision-Language-Modelle (VLM).

Warum das relevant ist

Große Sprach- und Multimodalmodelle erfordern enorme Mengen an GPU-Speicher und Rechenleistung. Werkzeuge wie AngelSlim machen extrem große Modelle wie Hy4 auf verteilter Standard- oder Misch-Hardware lauffähig und senken die Betriebskosten im Serving- und Inferenzbetrieb durch drastische Speicherreduktion und Spekulationstechniken spürbar.

Einordnung

AngelSlim löst das praktische Problem der Deployment- und Inferenzkosten für aktuelle State-of-the-Art-Modelle. Tencent bündelt hier modernste Optimierungsverfahren: von Sparse-Attention-Algorithmen (Stem) zur Beschleunigung langer Kontexte bis hin zu modularen Frameworks für Spekulatives Decoding (AngelSpec). Zielgruppe sind ML-Ingenieure, MLOps-Teams und Forscher, die große Modelle für produktive Umgebungen optimieren müssen. Mit über 1.600 GitHub-Stars, wissenschaftlichen Technical Reports (arXiv) und aktiven Releases zeigt das Projekt einen soliden Reifegrad, auch wenn viele Features und GGUF-Portierungen auf jüngste Modellgenerationen (wie Qwen3-MoE oder Hy4) zielen und sich rasch weiterentwickeln.

Gefunden in

Zusammenfassung von KI erstellt (Gemini 3.8 Flash, 27. September 2026). Sie kann Fehler enthalten – maßgeblich ist die Originalquelle.

Inhaltlich ähnlich, ermittelt über die KI-Suche.

  • Link:Tencent Hy Team

    Tencent veröffentlicht MoE-Modell Hy4-preview unter Apache-2.0-Lizenz

    Das Tencent Hy Team hat Hy4-preview als quelloffenes Mixture-of-Experts-Modell (MoE) mit 770 Milliarden Gesamtparametern und 49 Milliarden aktiven Parametern pro Token vorgestellt. Das Flaggschiff-Modell bietet ein Kontextfenster von 1 Million Tokens und wurde für Aufgaben in Softwareentwicklung, Büroarbeit und wissenschaftlicher Forschung optimiert.

    KI & AI· Ankündigung

  • Repository:Tencent-Hunyuan/Hy4-preview

    Tencent Hunyuan stellt Hy4-preview vor: 770B MoE-Modell mit Sparse Attention

    Das Tencent Hy Team hat Hy4-preview veröffentlicht, ein neues Mixture-of-Experts (MoE) Flaggschiff-Modell mit insgesamt 770 Milliarden Parametern, wovon 49 Milliarden pro Token aktiv sind. Es kombiniert MoE-Layer, Gated DeepSeek Sparse Attention und Multi-Token Prediction für spekulatives Decoding.

    344SternePython

    KI & AI· Ankündigung

  • Repository:deepseek-ai/DeepSpec

    DeepSpec: Full-Stack-Framework für spekulative Dekodierung von DeepSeek

    DeepSpec ist eine Open-Source-Codebasis von DeepSeek zum Trainieren und Evaluieren von Draft-Modellen für spekulatives Dekodieren. Die Suite deckt die gesamte Pipeline ab: Datenvorbereitung, Modelltraining auf Multi-GPU-Knoten und Benchmarking.

    7081SternePython

    KI & AI· Tool

  • X-Post:Hamid Maei

    Ternary Bonsai 2 27B: Stark komprimiertes Qwen3.8-Modell mit 5,9 GB

    PrismML hat Ternary Bonsai 2 27B vorgestellt, eine stark komprimierte Version von Qwen3.8 27B. Das Modell ist neunmal kleiner als das Original, belegt nur 5,9 GB Speicher und erreicht laut Anbieter 98,2 Prozent der Benchmark-Leistung.

    97Lesezeichen20.996Aufrufe

    KI & AI· Ankündigung

  • Repository:MiaAI-Lab/GLM-5.3-Flash-EXL3-2x-DGX-Sparks

    GLM-5.3 Flash EXL3 auf 2x NVIDIA DGX Spark Kits

    Das GitHub-Repository von Mia's AI Lab bietet eine optimierte vLLM-Serving-Konfiguration für GLM-5.3-Flash mit 4-bpw-EXL3-Quantisierung auf zwei NVIDIA GB10 Systemen.

    431SternePython

    KI & AI· Tool

  • Link:deepseek-ai

    DeepSeek veröffentlicht DeepSeek-V4-Pro-DSpark mit spekulativer Dekodierung

    DeepSeek hat die Modelldokumentation und Gewichte für DeepSeek-V4-Pro-DSpark auf Hugging Face bereitgestellt. Es handelt sich um das MoE-Modell DeepSeek-V4-Pro mit einem integrierten Modul für spekulative Dekodierung (DSpark) zur Beschleunigung der Inferenz.

    KI & AI· Sammlung

Lassen Sie uns über Ihr Projekt sprechen

Standorte

  • Mattersburg
    Johann Nepomuk Bergerstraße 7/2/14
    7210 Mattersburg, Austria
  • Wien
    Ungargasse 64-66/3/404
    1030 Wien, Austria

Dieser Inhalt wurde teilweise mithilfe von KI erstellt.