Thinking Machines Lab veröffentlicht Inkling-Small

ArtikelThinking Machines LabAnkündigung

Thinking Machines Lab hat Inkling-Small vorgestellt, ein multimodales Open-Weights-Modell mit Mixture-of-Experts-Architektur (276 Mrd. Gesamtparameter, 12 Mrd. aktiv), das trotz geringerer Größe bei vielen Aufgaben mit dem größeren Inkling konkurriert.

Das Wichtigste

  1. MoE-Architektur mit 276 Milliarden Gesamtparametern und 12 Milliarden aktiven Parametern, trainiert auf NVIDIA GB300 NVL72 Systemen.
  2. Encoder-freie native Multimodalität für Text, Bild und Audio mit einem Kontextfenster von bis zu 1 Million Tokens.
  3. Übertrifft das größere Basismodell Inkling bei Reasoning und Coding-Agenten-Aufgaben (31,6 % bei Humanity's Last Exam, 80,2 % bei SWEBench-Verified).
  4. Unterstützt variable Thinking-Effort-Stufen zur flexiblen Steuerung von Rechenaufwand und Inferenzkosten ($1,20 pro 1M Ausgabetokens).
  5. Das größere Inkling behält weiterhin einen Vorsprung bei Wissensabdeckung und Faktenprüfungen.

Warum das relevant ist

Inkling-Small zeigt, wie On-Policy-Destillation und gezieltes Reinforcement Learning für Coding-Agenten ein deutlich kleineres Modell befähigen können, ein vierfach größeres Flaggschiffmodell bei logischen Aufgaben und Inferenzkosten zu übertreffen.

Einordnung

Thinking Machines Lab nutzte für Inkling-Small eine verbesserte Pre-Training-Rezeptur, Destillation vom größeren Inkling sowie zusätzliches agentisches Coding-RL. Dadurch erzielt das Modell beachtliche Werte auf Benchmarks wie SWEBench und Terminal-Bench 2.1 bei geringerem Token- und Rechenaufwand. Der spürbare Rückstand bei Fakten-Benchmarks wie SimpleQA verdeutlicht jedoch den klassischen Trade-off: Geringere Parameterzahlen schränken das reine Faktenwissen ein, während prozedurales Denken und Werkzeugnutzung erhalten oder sogar verbessert werden.

Gefunden in

Zusammenfassung von KI erstellt (Gemini 3.8 Flash, 27. September 2026). Sie kann Fehler enthalten – maßgeblich ist die Originalquelle.

Inhaltlich ähnlich, ermittelt über die KI-Suche.

  • Artikel:Thinking Machines Lab

    Thinking Machines Lab stellt Open-Weights-Modell Inkling vor

    Thinking Machines Lab hat Inkling veröffentlicht, ein multimodales Mixture-of-Experts-Modell mit 975 Milliarden Gesamtparametern (41 Milliarden aktiv) und 1 Million Token Kontext. Es ist vor allem als vielseitige Open-Weights-Basis für Fine-Tuning über die eigene Plattform Tinker gedacht.

    KI & AI· Ankündigung

  • Link:inclusionAI

    Ling-3.0-tiny: Leichtes hybrides Reasoning-MoE-Modell von inclusionAI

    inclusionAI hat Ling-3.0-tiny veröffentlicht, ein leichtgewichtiges MoE-Modell mit 7,9 Milliarden Gesamtparametern, das pro Token nur 1,3 Milliarden Parameter aktiviert. Das Modell setzt auf eine hybride Architektur aus linearen Aufmerksamkeits- und Latent-Attention-Schichten und zielt auf recheneffizientes Reasoning sowie Agenten-Aufgaben auf lokaler Hardware ab.

    KI & AI· Tool

  • Repository:inclusionAI/Ling

    Ling: Open-Source Mixture-of-Experts-Sprachmodelle von InclusionAI

    InclusionAI stellt mit Ling eine Open-Source-Modellfamilie auf Basis einer Mixture-of-Experts-Architektur (MoE) bereit. Die Modelle erscheinen in zwei Größen: Ling-lite (16,8 Milliarden Gesamtparameter, 2,75 Milliarden aktivierte Parameter) und Ling-plus (290 Milliarden Gesamtparameter, 28,8 Milliarden aktivierte Parameter).

    267SternePython

    KI & AI· Sammlung

  • Link:ornith-ai

    Ornith-1.5-397B: Open-Source-MoE-Modell mit Fokus auf Coding und Reasoning

    ornith-ai hat das multimodale Mixture-of-Experts-Modell Ornith-1.5-397B unter MIT-Lizenz veröffentlicht. Das 397 Milliarden Parameter schwere Modell setzt auf kontinuierliche Selbstverbesserung und erzielt in Programmier- und Reasoning-Benchmarks Ergebnisse auf dem Niveau führender proprietärer Modelle.

    KI & AI· Sammlung

  • Artikel:Zhidx

    Ant Group veröffentlicht kompaktes MoE-Modell Ling-3.0-tiny

    Ant Groups Bailian hat das Open-Source-Modell Ling-3.0-tiny vorgestellt. Die Architektur kombiniert DeepSeeks MLA mit Kimis KDA in einem Mixture-of-Experts-Design mit 7,9 Milliarden Gesamtparametern, von denen pro Token nur 1,3 Milliarden aktiviert werden. Das Modell zielt auf den effizienten lokalen Einsatz auf Rechnern wie Apple-Silicon-Macs und DGX-Workstations ab.

    KI & AI· Ankündigung

  • Artikel:Chris Alexiuk and Chintan Patel

    NVIDIA Nemotron 3.5 Lightning: Kompaktes MoE-Modell für Agenten-Workflows

    NVIDIA hat Nemotron 3.5 Lightning vorgestellt, ein offenes Mixture-of-Experts-Modell (MoE) mit 30 Milliarden Gesamt- und 3 Milliarden aktiven Parametern. Es wurde speziell für die Ausführungsebene langlebiger KI-Agenten optimiert, um Routineaufgaben wie Tool-Aufrufe und Ergebnisvalidierung schnell und kostengünstig zu bewältigen.

    KI & AI· Ankündigung

Lassen Sie uns über Ihr Projekt sprechen

Standorte

  • Mattersburg
    Johann Nepomuk Bergerstraße 7/2/14
    7210 Mattersburg, Austria
  • Wien
    Ungargasse 64-66/3/404
    1030 Wien, Austria

Dieser Inhalt wurde teilweise mithilfe von KI erstellt.