Harness-R1: Automatisierte Laufzeit-Optimierung für KI-Agenten anhand von Fehlertrajektorien

ArtikelShuai Shao, Kangning Zhang, Qingyao Li, Shijian Wang, Hao Wang, Wenxiang Jiao, Yuan Lu, Yi Guo, Weiwen Liu, Weinan ZhangForschung

Ein Forschungsteam stellt Harness-R1 vor, eine Methode zur gezielten Anpassung der Software-Laufzeitumgebung (Harness) von LLM-Agenten. Statt nur Modellgewichte anzupassen, lernt ein separater 9B-Agent per Reinforcement Learning, fehlerhafte Ausführungsspuren zu analysieren und validierte Code-Patches für Kontextaufbereitung, Tool-Vermittlung und Aktionsvalidierung zu generieren.

Das Wichtigste

  1. Harness-R1 nutzt Fehlschläge von Ziel-Agenten, um per Reinforcement Learning lauffähige Patches für die Ausführungsumgebung zu erstellen.
  2. Ein eigenständiges 9B-Modell fungiert als 'Harness Engineer', initialisiert über Supervised Fine-Tuning und optimiert mit Group-Relative Policy Optimization (GRPO).
  3. Das Zielmodell bleibt während des Trainings der Laufzeitumgebung eingefroren; Belohnungen basieren direkt auf der Erfolgsquote bei erneuten Testläufen.
  4. In Benchmarks (WebShop, ALFWorld, DBBench) stieg die Erfolgsquote eines Basis-Qwen3.5-9B von 44,3 % auf 53,6 % (+9,3 Prozentpunkte).
  5. Auch bei bereits feinabgestimmten Zielmodellen steigerte die Methode die Erfolgsquote weiter von 59,2 % auf 64,2 %, was Potenzial für eine Co-Evolution beider Systeme zeigt.

Warum das relevant ist

KI-Agenten scheitern in der Praxis oft nicht an ihren Kernfähigkeiten, sondern an fehlerhaften Tool-Schnittstellen, Kontextfehlern oder mangelnder Fehlerbehandlung. Das automatisierte Patchen des ausführenden Harness eröffnet einen Weg, Agentensysteme im laufenden Betrieb modular und messbar zu verbessern, ohne jedes Mal teure Modell-Updates durchführen zu müssen.

Einordnung

Das Papier von Shao et al. verschiebt den Fokus des Agenten-Trainings von reiner Modelloptimierung hin zum System-Engineering. Indem der Harness Engineer selbst als eigenständige Policy trainiert wird, die auf nachweisbaren Erfolg optimiert ist, wird die Programmlaufzeit dynamisch repariert. Das Ergebnis zeigt, dass signifikante Performancesteigerungen auch dann möglich sind, wenn das eigentliche Basismodell unangetastet bleibt.

Gefunden in

Zusammenfassung von KI erstellt (Gemini 3.8 Flash, 27. September 2026). Sie kann Fehler enthalten – maßgeblich ist die Originalquelle.

Inhaltlich ähnlich, ermittelt über die KI-Suche.

  • Repository:DeepExperience/Harness-R1

    Harness-R1: Laufzeit-Harnesses für KI-Agenten aus Fehlerverläufen generieren

    Harness-R1 ist ein Forschungsprojekt, das einen sogenannten Harness Engineer trainiert: Ein Modell analysiert fehlgeschlagene Trajektorien von KI-Agenten und generiert automatisch wiederverwendbare Laufzeit-Hooks, um dieselben Aufgaben im zweiten Anlauf erfolgreich zu bewältigen.

    97SternePython

    KI & AI· Forschung

  • Artikel:Hongjun Liu, Yifei Ming, Shafiq Joty, Chen Zhao

    HASP: Ausführbare Skill-Programme als Leitplanken für LLM-Agenten

    Ein Forschungsteam stellt mit HASP (Harnessing LLM Agents with Skill Programs) ein Framework vor, das Erfahrungswerte von Sprachmodell-Agenten in ausführbare Programmfunktionen (PFs) überführt. Statt rein textbasierter Empfehlungen greifen diese Funktionen bei fehleranfälligen Zuständen aktiv in den Agenten-Loop ein, indem sie Aktionen anpassen oder korrigierenden Kontext einfügen.

    KI & AI· Forschung

  • Artikel:Siru Ouyang, Jun Yan, I-Hung Hsu, et al.

    ReasoningBank: Selbstlernende KI-Agenten durch Reasoning Memory

    ReasoningBank ist ein neuartiges Speicher-Framework für LLM-Agenten, das verallgemeinerbare Denkstrategien aus selbst bewerteten Erfolgen und Fehlern destilliert, um kontinuierliches Lernen im laufenden Betrieb zu ermöglichen.

    KI & AI· Forschung

  • Artikel:Mehdi Allahyari

    Harness Engineering: Warum die Umgebung wichtiger ist als das LLM-Modell

    Nach Prompt- und Context-Engineering bildet Harness Engineering die dritte Phase im Bau autonomer KI-Systeme. Mehdi Allahyari beschreibt die Software-Infrastruktur um das Sprachmodell als entscheidenden Erfolgsfaktor für Zuverlässigkeit und Selbstkorrektur.

    KI & AI· Sammlung

  • Artikel:Tejas Kumar

    Was ist ein Agent Harness? Harness Engineering verständlich erklärt

    Tejas Kumar erklärt das Konzept des Agent Harness: die Laufzeitumgebung und Kontrollschicht um ein KI-Modell, die dessen Verhalten verlässlich macht. Anhand eines praktischen Beispiels zeigt er, wie deterministischer Code rund um GPT-3.5 Turbo ein unzuverlässiges Verhalten korrigiert, ohne den Prompt zu ändern.

    KI & AI· Anleitung

  • Repository:walkinglabs/learn-harness-engineering

    Learn Harness Engineering: Open-Source-Kurs für verlässliche KI-Coding-Agents

    Das Open-Source-Projekt learn-harness-engineering von walkinglabs bietet einen praxisorientierten Einsteigerkurs, der Entwickler von Grund auf in das Harness Engineering für autonome Coding-Agents einführt. Der Kurs behandelt State-Management, Laufzeitumgebungen, Verifikationslogik und Kontrollmechanismen, um Coding-Agents stabil in der Praxis einzusetzen.

    14.831SterneTypeScript

    KI & AI· Anleitung

Lassen Sie uns über Ihr Projekt sprechen

Standorte

  • Mattersburg
    Johann Nepomuk Bergerstraße 7/2/14
    7210 Mattersburg, Austria
  • Wien
    Ungargasse 64-66/3/404
    1030 Wien, Austria

Dieser Inhalt wurde teilweise mithilfe von KI erstellt.