Ornith 1.5 35B-A3B: MoE-Modell übertrifft Qwen3.6 in Coding- und Agenten-Benchmarks

ArtikelLuis Chavez-MattosNews

Deep Reinforce hat Ornith 1.5 35B-A3B vorgestellt, ein Mixture-of-Experts-Modell mit 3 Milliarden aktiven Parametern pro Token. Laut Modellkarte übertrifft es in Programmier- und Agenten-Benchmarks ähnlich dimensionierte Modelle wie Qwen3.6-35B deutlich und überholt bei Software-Engineering-Aufgaben teilweise sogar das wesentlich größere Qwen3.5-397B.

Das Wichtigste

  1. MoE-Architektur mit 35 Milliarden Parametern insgesamt, von denen nur etwa 3 Milliarden pro Token aktiv sind (35B-A3B).
  2. Erweiterter Self-Improvement-Trainingsloop mit GRPO optimiert Aufgabenstellung, Scaffolds und Lösungs-Rollouts gemeinsam.
  3. Erreicht 79 Punkte auf SWE-bench Verified sowie 22 Punkte auf DeepSWE, während Qwen3.6-35B und Gemma 4-31B bei 0 liegen.
  4. Bleibt bei reinen Reasoning-Benchmarks wie HLE mit Tools (33,4) hinter dem massiv größeren Qwen3.5-397B (48,3) zurück.
  5. Lokal auf einer einzelnen Nvidia A100 (80 GB VRAM) mit vLLM lauffähig, bei etwa 74 GB Speicherbedarf inklusive KV-Cache.

Warum das relevant ist

Für Entwicklungsteams, die eigene Coding-Assistenten und Agenten lokal betreiben, bietet das MoE-Format hohe Effizienz: Geringe Inferenzkosten auf Single-GPU-Infrastruktur werden mit Leistungswerten kombiniert, die zuvor deutlich größeren Modellen vorbehalten waren.

Einordnung

Die auffallend hohen Werte bei DeepSWE und Terminal-Bench führt der Autor auf den automatisierten Trainingsloop zurück. Statt kuratierter statischer Datensätze generiert das Modell Aufgaben selbst und lernt über GRPO-Belohnungssignale. In einem Praxistest plante und implementierte Ornith 1.5 ein Full-Stack-Feature autonom samt Testläufen. Bei toolgestützten Reasoning-Aufgaben (HLE) bleibt jedoch ein deutlicher Abstand zu Riesenmodellen wie Qwen3.5-397B bestehen, was zeigt, dass reine Modellgröße für komplexe Logik nach wie vor eine Rolle spielt.

Gefunden in

Zusammenfassung von KI erstellt (Gemini 3.8 Flash, 27. September 2026). Sie kann Fehler enthalten – maßgeblich ist die Originalquelle.

Inhaltlich ähnlich, ermittelt über die KI-Suche.

  • Link:ornith-ai

    Ornith-1.5-397B: Open-Source-MoE-Modell mit Fokus auf Coding und Reasoning

    ornith-ai hat das multimodale Mixture-of-Experts-Modell Ornith-1.5-397B unter MIT-Lizenz veröffentlicht. Das 397 Milliarden Parameter schwere Modell setzt auf kontinuierliche Selbstverbesserung und erzielt in Programmier- und Reasoning-Benchmarks Ergebnisse auf dem Niveau führender proprietärer Modelle.

    KI & AI· Sammlung

  • Link:deep-reinforce.com

    Ornith-1.0: Open-Source-Modellfamilie für Coding-Agenten mit Self-Scaffolding

    Mit Ornith-1.0 erscheint eine Open-Source-Modellreihe für agentenbasierte Programmieraufgaben in Größen von 9B bis 397B Parametern. Durch ein neuartiges RL-Verfahren generieren die Modelle während des Trainings sowohl die Lösung als auch das unterstützende Task-Harness selbst.

    KI & AI· Ankündigung

  • Repository:ornith-ai/Ornith-1

    Ornith: Selbstverbessernde Open-Source-Modelle für Agentenaufgaben

    Das GitHub-Repository Ornith-1 stellt eine Familie quelloffener KI-Modelle vor, die speziell auf agentische Aufgaben und iterative Selbstoptimierung ausgelegt sind. Mit den Generationen Ornith-1.0 und Ornith-1.5 verfolgt das Projekt Ansätze wie Self-Scaffolding und automatisierte Aufgaben- und Lösungserstellung für Reinforcement Learning.

    2013Sterne

    KI & AI· Tool

  • Link:Kwaipilot

    KAT-Coder-V2.5-Dev: Open-Weight-MoE-Modell für Coding-Agenten

    Kwaipilot hat mit KAT-Coder-V2.5-Dev ein quelloffenes Mixture-of-Experts-Sprachmodell veröffentlicht. Das auf Qwen3.6-35B-A3B basierende Modell verfügt über 35 Milliarden Gesamt- und 3 Milliarden aktive Parameter und wurde gezielt für den Einsatz in Coding-Agenten trainiert.

    KI & AI· Tool

  • Video

    Video:xCreate

    Praxistest: Ornith 397B im Vergleich zu Qwen 3.5 und GLM 5.2

    xCreate testet Ornith 1.0 (397B), einen auf Qwen 3.5 basierenden Open-Source-Fine-Tune, der laut Benchmarks führende Modelle wie GLM 5.2 und Claude übertreffen soll. Der Test untersucht reale Codierungs-, Vision- und Logikaufgaben auf einem Mac Studio.

    KI & AI· Demo

  • Artikel:Chris Alexiuk and Chintan Patel

    NVIDIA Nemotron 3.5 Lightning: Kompaktes MoE-Modell für Agenten-Workflows

    NVIDIA hat Nemotron 3.5 Lightning vorgestellt, ein offenes Mixture-of-Experts-Modell (MoE) mit 30 Milliarden Gesamt- und 3 Milliarden aktiven Parametern. Es wurde speziell für die Ausführungsebene langlebiger KI-Agenten optimiert, um Routineaufgaben wie Tool-Aufrufe und Ergebnisvalidierung schnell und kostengünstig zu bewältigen.

    KI & AI· Ankündigung

Lassen Sie uns über Ihr Projekt sprechen

Standorte

  • Mattersburg
    Johann Nepomuk Bergerstraße 7/2/14
    7210 Mattersburg, Austria
  • Wien
    Ungargasse 64-66/3/404
    1030 Wien, Austria

Dieser Inhalt wurde teilweise mithilfe von KI erstellt.