Baidu veröffentlicht ERNIE 5.1 mit hoher Parametereffizienz und asynchroner RL-Architektur

ArtikelBaidu AI TeamAnkündigung

Baidu hat ERNIE 5.1 vorgestellt. Das Modell komprimiert die Gesamtparameter im Vergleich zu ERNIE 5.0 auf etwa ein Drittel und die aktiven Parameter auf etwa die Hälfte, während es laut Hersteller nur sechs Prozent der Vortrainingskosten vergleichbarer Modelle benötigt.

Das Wichtigste

  1. Effizientes Vortraining: Über ein 'Once-For-All'-Framework erbt ERNIE 5.1 Fähigkeiten aus ERNIE 5.0 mit elastischer Tiefe, Breite und MoE-Sparsity bei 6 % der Vortrainingskosten vergleichbarer Modelle.
  2. Asynchrone Reinforcement-Learning-Infrastruktur: Eine auf PaddlePaddle aufbauende Architektur trennt Control- und Data-Plane in vier Teilsysteme (Training, Inference, Reward, Agent Loop).
  3. Konsistenz zwischen Training und Inference: Vereinheitlichte FP8-Operatoren und die Rollout-Router-Replay-Technik (R3) reduzieren Routing-Divergenzen bei MoE-Modellen.
  4. Vierstufige Post-Training-Pipeline: Kombination aus SFT, parallelem Training von Fachexperten, On-Policy Distillation (OPD) mit mehreren Teacher-Modellen und abschließendem Online-RL für Konversations- und Kreativaufgaben.
  5. Benchmark-Ergebnisse: 4. Platz global im Arena Search Leaderboard (1. Platz unter chinesischen Modellen), Übertreffen von DeepSeek-V4-Pro bei Agenten-Benchmarks (τ³-bench, SpreadsheetBench-Verified) und 99,6 Punkte bei AIME26.

Warum das relevant ist

Modellentwickler stoßen beim Skalieren zunehmend an Rechenzeit- und Effizienzgrenzen. Baidus Ansatz demonstriert, wie elastische Subnetzwerk-Extraktion und entkoppelte RL-Pipelines die Trainings- und Inferenzkosten drastisch senken können, ohne dass Fähigkeiten bei komplexen Agenten- und Reasoning-Aufgaben verloren gehen.

Einordnung

Baidu adressiert zentrale Flaschenhälse im Training moderner MoE- und Agenten-Architekturen. Die Trennung der RL-Subsysteme ermöglicht die unabhängige Skalierung von Inference und Reward-Berechnung, während elastische CPU-Pools bisher ungenutzte Cluster-Ressourcen für Code-Sandboxen und Verifier nutzen. Das vierstufige Post-Training überwindet zudem Zielkonflikte klassischer sequenzieller Methoden: Spezifische Fähigkeiten werden parallel in Expertenmodellen trainiert und anschließend via On-Policy Distillation zusammengeführt, bevor ein abschließendes Online-RL offene Dialoge und kreative Texte abstimmt, um eine Glättung der Wahrscheinlichkeitsverteilung zu verhindern.

Gefunden in

Zusammenfassung von KI erstellt (Gemini 3.8 Flash, 27. September 2026). Sie kann Fehler enthalten – maßgeblich ist die Originalquelle.

Inhaltlich ähnlich, ermittelt über die KI-Suche.

  • Artikel:xAI

    xAI veröffentlicht Grok 4.1

    xAI hat das Modell Grok 4.1 für grok.com, die Plattform X sowie die mobilen Apps freigegeben. Neben Verbesserungen bei Tonalität, Empathie und kreativen Texten führt das Modell laut Anbieter die LMArena-Rangliste an.

    KI & AI· Ankündigung

  • Link:Z.ai

    Z.ai veröffentlicht GLM-5.1 mit Fokus auf Agentic Engineering

    Z.ai hat auf Hugging Face das Modell GLM-5.1 unter MIT-Lizenz bereitgestellt. Das MoE-Modell mit 754 Milliarden Parametern zielt auf anspruchsvolle Programmier- und Agenten-Workflows ab und soll über lange Sessions hinweg stabil arbeiten.

    KI & AI· Sammlung

  • Link:primeintellect.ai

    Mixedbread trainiert Deep-Search-Agent Toast 1 mit Prime-RL

    In einer Fallstudie beschreibt Prime Intellect, wie das Unternehmen Mixedbread das Modell Toast 1 mithilfe von Prime-RL und Verifiers v1 trainiert hat. Der auf Qwen3.6-35B-A3B basierende Retrieval-Subagent erzielt bei der Informationsbeschaffung Ergebnisse auf dem Niveau führender Modelle, arbeitet dabei jedoch 12-mal schneller und deutlich kosteneffizienter.

    KI & AI· Sammlung

  • Artikel:Shuai Shao, Kangning Zhang, Qingyao Li, Shijian Wang, Hao Wang, Wenxiang Jiao, Yuan Lu, Yi Guo, Weiwen Liu, Weinan Zhang

    Harness-R1: Automatisierte Laufzeit-Optimierung für KI-Agenten anhand von Fehlertrajektorien

    Ein Forschungsteam stellt Harness-R1 vor, eine Methode zur gezielten Anpassung der Software-Laufzeitumgebung (Harness) von LLM-Agenten. Statt nur Modellgewichte anzupassen, lernt ein separater 9B-Agent per Reinforcement Learning, fehlerhafte Ausführungsspuren zu analysieren und validierte Code-Patches für Kontextaufbereitung, Tool-Vermittlung und Aktionsvalidierung zu generieren.

    KI & AI· Forschung

Lassen Sie uns über Ihr Projekt sprechen

Standorte

  • Mattersburg
    Johann Nepomuk Bergerstraße 7/2/14
    7210 Mattersburg, Austria
  • Wien
    Ungargasse 64-66/3/404
    1030 Wien, Austria

Dieser Inhalt wurde teilweise mithilfe von KI erstellt.