Harness-R1: Laufzeit-Harnesses für KI-Agenten aus Fehlerverläufen generieren

RepositoryDeepExperience/Harness-R1Forschung

Harness-R1 ist ein Forschungsprojekt, das einen sogenannten Harness Engineer trainiert: Ein Modell analysiert fehlgeschlagene Trajektorien von KI-Agenten und generiert automatisch wiederverwendbare Laufzeit-Hooks, um dieselben Aufgaben im zweiten Anlauf erfolgreich zu bewältigen.

Das Wichtigste

  1. Erstellt ausführbare Laufzeit-Patches auf Basis von gescheiterten Trajektorien eingefrorener Ziel-Agenten.
  2. Nutzt vier Hook-Typen zur Steuerung des Lebenszyklus: on_init, make_pre_hint, on_before_action und on_post_step.
  3. Basiert auf Qwen3.5-9B als Modell für den Harness Engineer und wird mit SFT sowie Online-GRPO trainiert.
  4. Getestet an Benchmarks wie WebShop, ALFWorld und DBBench; Code steht unter Apache-2.0-Lizenz.

Warum das relevant ist

Statt Agentenmodelle bei Fehlern aufwendig neu zu trainieren oder Prompts manuell anzupassen, ermöglicht Harness-R1 eine automatisierte Laufzeitkorrektur. Das Modell lernt, programmatische Leitplanken und Hinweise zu injecten, um das Verhalten des Agenten zur Laufzeit gezielt abzusichern.

Einordnung

Das Projekt von Forschenden der Shanghai Jiao Tong University, Xiaohongshu und der Southeast University verbindet Reinforcement Learning (Online-GRPO) mit programmatischen Sandboxing-Hooks. Der Ansatz modifiziert nicht die Gewichte des Ziel-Agenten, sondern bettet ihn in einen dynamisch gelernten Harness ein. Bei dem Code handelt es sich um den Begleitcode eines arXiv-Preprints (2608.02276) inklusive Checkpoints und Demos, ausgerichtet vor allem auf KI-Forscher und Entwickler komplexer Agentensysteme.

Gefunden in

Zusammenfassung von KI erstellt (Gemini 3.8 Flash, 27. September 2026). Sie kann Fehler enthalten – maßgeblich ist die Originalquelle.

Inhaltlich ähnlich, ermittelt über die KI-Suche.

  • Artikel:Shuai Shao, Kangning Zhang, Qingyao Li, Shijian Wang, Hao Wang, Wenxiang Jiao, Yuan Lu, Yi Guo, Weiwen Liu, Weinan Zhang

    Harness-R1: Automatisierte Laufzeit-Optimierung für KI-Agenten anhand von Fehlertrajektorien

    Ein Forschungsteam stellt Harness-R1 vor, eine Methode zur gezielten Anpassung der Software-Laufzeitumgebung (Harness) von LLM-Agenten. Statt nur Modellgewichte anzupassen, lernt ein separater 9B-Agent per Reinforcement Learning, fehlerhafte Ausführungsspuren zu analysieren und validierte Code-Patches für Kontextaufbereitung, Tool-Vermittlung und Aktionsvalidierung zu generieren.

    KI & AI· Forschung

  • Repository:walkinglabs/learn-harness-engineering

    Learn Harness Engineering: Open-Source-Kurs für verlässliche KI-Coding-Agents

    Das Open-Source-Projekt learn-harness-engineering von walkinglabs bietet einen praxisorientierten Einsteigerkurs, der Entwickler von Grund auf in das Harness Engineering für autonome Coding-Agents einführt. Der Kurs behandelt State-Management, Laufzeitumgebungen, Verifikationslogik und Kontrollmechanismen, um Coding-Agents stabil in der Praxis einzusetzen.

    14.831SterneTypeScript

    KI & AI· Anleitung

  • Repository:PrimeIntellect-ai/prime-agent

    Prime Agent: Selbstoptimierender RLM-Agent für Coding und autonome Workflows

    Prime Agent ist ein quelloffener Coding- und Forschungs-Agent für komplexe, langlaufende Aufgaben. Das System kombiniert das Konzept des Recursive Language Model (RLM) mit einem Continual Harness, um Kontext programmierbar zu verwalten und Erfahrungen sitzungsübergreifend zu speichern.

    19.919SterneTypeScript

    KI & AI· Tool

  • Link:DeepSeek

    DeepSeek Harness: Modulares Open-Source-Framework für AI-Agents

    DeepSeek stellt mit DeepSeek Harness eine quelloffene Developer Preview für AI-Agenten vor. Das Framework basiert auf dem Cordis-Kernel und setzt auf eine modulare Plugin-Architektur sowie lückenlose Nachvollziehbarkeit aller Interaktionen.

    KI & AI· Ankündigung

  • Artikel:Hongjun Liu, Yifei Ming, Shafiq Joty, Chen Zhao

    HASP: Ausführbare Skill-Programme als Leitplanken für LLM-Agenten

    Ein Forschungsteam stellt mit HASP (Harnessing LLM Agents with Skill Programs) ein Framework vor, das Erfahrungswerte von Sprachmodell-Agenten in ausführbare Programmfunktionen (PFs) überführt. Statt rein textbasierter Empfehlungen greifen diese Funktionen bei fehleranfälligen Zuständen aktiv in den Agenten-Loop ein, indem sie Aktionen anpassen oder korrigierenden Kontext einfügen.

    KI & AI· Forschung

  • Repository:deepseek-ai/deepseek-harness

    DeepSeek Harness: Plugin-basiertes Open-Source-Framework für KI-Agenten

    DeepSeek Harness (dsh) ist ein Open-Source-Harness für KI-Agenten von DeepSeek AI. Das System basiert auf TypeScript sowie dem Framework Cordis und setzt auf eine modulare Architektur, in der alle Funktionen als Plugins realisiert werden.

    212.765SterneTypeScript

    KI & AI· Tool

Lassen Sie uns über Ihr Projekt sprechen

Standorte

  • Mattersburg
    Johann Nepomuk Bergerstraße 7/2/14
    7210 Mattersburg, Austria
  • Wien
    Ungargasse 64-66/3/404
    1030 Wien, Austria

Dieser Inhalt wurde teilweise mithilfe von KI erstellt.