Ling-3.0-tiny: Leichtes hybrides Reasoning-MoE-Modell von inclusionAI

LinkinclusionAITool

inclusionAI hat Ling-3.0-tiny veröffentlicht, ein leichtgewichtiges MoE-Modell mit 7,9 Milliarden Gesamtparametern, das pro Token nur 1,3 Milliarden Parameter aktiviert. Das Modell setzt auf eine hybride Architektur aus linearen Aufmerksamkeits- und Latent-Attention-Schichten und zielt auf recheneffizientes Reasoning sowie Agenten-Aufgaben auf lokaler Hardware ab.

Das Wichtigste

  1. Hybride Architektur mit einer 3:1-Abfolge aus Kimi Delta Attention (KDA) und Multi-Head Latent Attention (MLA) zur effizienten Verarbeitung langer Kontexte.
  2. Sparse Mixture-of-Experts (MoE) FFN mit 128 Experten, wovon pro Token lediglich 8 geroutete und 1 geteilter Experte (1,3 Mrd. Parameter) aktiviert werden.
  3. Unterstützt schnelles Antworten und mehrstufiges Nachdenken über einen konfigurierbaren Thinking-Modus (enable_thinking).
  4. Validiert für lokale Hardware wie Apple Silicon (M4 Pro) und NVIDIA DGX Spark bei ca. 8,34 GiB VRAM-Bedarf für FP8 bei 8K Kontext.
  5. Kompatibel mit Inferenz-Engines wie SGLang, vLLM und experimentellen Builds von Ollama via MLX.

Warum das relevant ist

Große Reasoning-Modelle benötigen meist teure Server-Infrastruktur. Ling-3.0-tiny demonstriert, wie durch Architekturoptimierungen (KDA, MLA und sparse MoE) agentenbasierte Workflows und schrittweises Denken direkt auf Laptops und Edge-Geräten mit moderatem Speicherbedarf realisiert werden können.

Einordnung

Das Modell zeigt den Trend zu stark spezialisierten, kleineren Hybrid-Architekturen. Anstatt reine Transformator-Schichten zu nutzen, kombiniert inclusionAI lineare Attention (KDA) für lange Kontexte mit MLA und starker MoE-Sparsity. Mit 1,3 Milliarden aktiven Parametern lassen sich auf handelsüblicher Hardware wie Apple Silicon Geschwindigkeiten von bis zu 90 Tokens/s erreichen. Dies senkt die Hürde für Entwickler, die Agenten- und Coding-Assistenten lokal und datenschutzfreundlich ohne Cloud-Abhängigkeit betreiben wollen.

Gefunden in

Zusammenfassung von KI erstellt (Gemini 3.8 Flash, 27. September 2026). Sie kann Fehler enthalten – maßgeblich ist die Originalquelle.

Inhaltlich ähnlich, ermittelt über die KI-Suche.

  • Artikel:Zhidx

    Ant Group veröffentlicht kompaktes MoE-Modell Ling-3.0-tiny

    Ant Groups Bailian hat das Open-Source-Modell Ling-3.0-tiny vorgestellt. Die Architektur kombiniert DeepSeeks MLA mit Kimis KDA in einem Mixture-of-Experts-Design mit 7,9 Milliarden Gesamtparametern, von denen pro Token nur 1,3 Milliarden aktiviert werden. Das Modell zielt auf den effizienten lokalen Einsatz auf Rechnern wie Apple-Silicon-Macs und DGX-Workstations ab.

    KI & AI· Ankündigung

  • Repository:inclusionAI/Ling

    Ling: Open-Source Mixture-of-Experts-Sprachmodelle von InclusionAI

    InclusionAI stellt mit Ling eine Open-Source-Modellfamilie auf Basis einer Mixture-of-Experts-Architektur (MoE) bereit. Die Modelle erscheinen in zwei Größen: Ling-lite (16,8 Milliarden Gesamtparameter, 2,75 Milliarden aktivierte Parameter) und Ling-plus (290 Milliarden Gesamtparameter, 28,8 Milliarden aktivierte Parameter).

    267SternePython

    KI & AI· Sammlung

  • Artikel:Thinking Machines Lab

    Thinking Machines Lab veröffentlicht Inkling-Small

    Thinking Machines Lab hat Inkling-Small vorgestellt, ein multimodales Open-Weights-Modell mit Mixture-of-Experts-Architektur (276 Mrd. Gesamtparameter, 12 Mrd. aktiv), das trotz geringerer Größe bei vielen Aufgaben mit dem größeren Inkling konkurriert.

    KI & AI· Ankündigung

  • Link:drumih

    TurboFieldfare: Gemma 4 26B mit nur 2 GB RAM auf Apple Silicon betreiben

    TurboFieldfare ist eine in Swift und Metal geschriebene Open-Source-Inference-Engine, die das 4-Bit-quantisierte Modell Gemma 4 26B-A4B-IT auf Apple M-Series Macs mit rund 2 GB Arbeitsspeicher ausführt. Da die Gewichte etwa 14 GB SSD-Speicher belegen, werden nur der gemeinsame Modellkern und der KV-Cache im RAM gehalten, während benötigte Experten pro Token direkt per Streaming von der SSD nachgeladen werden.

    KI & AI· Tool

Lassen Sie uns über Ihr Projekt sprechen

Standorte

  • Mattersburg
    Johann Nepomuk Bergerstraße 7/2/14
    7210 Mattersburg, Austria
  • Wien
    Ungargasse 64-66/3/404
    1030 Wien, Austria

Dieser Inhalt wurde teilweise mithilfe von KI erstellt.