Was kommt nach RLHF? Warum Verlässlichkeit ein anderes Trainingsziel braucht

LinkDiogo AlmeidaVortrag

In seinem Vortrag auf der AI Engineer World's Fair 2026 argumentiert Diogo Almeida (früher bei OpenAI an GPT-4 und InstructGPT beteiligt, heute TypeSafe AI), dass RLHF Sprachmodelle zu hervorragenden Assistenten gemacht hat, aber echte unbeaufsichtigte Automatisierung behindert. Da RLHF menschliche Präferenzen belohnt, neigen Modelle dazu, überzeugend zu wirken statt kalibriert und korrekt zu sein. Für zuverlässige Hintergrundprozesse wird ein neues Optimierungsziel benötigt.

Das Wichtigste

  1. ChatGPT und Claude Code gehören laut Almeida zur selben Kategorie: KI-Werkzeuge zur Unterstützung eines beteiligten Nutzers, nicht autonome Systeme.
  2. RLHF optimiert auf menschliche Zustimmung, wodurch das Erzeugen einer wohlgefälligen Antwort („looking right“) und tatsächliche Korrektheit („being right“) auseinanderdriften können.
  3. Assistenz erfordert eine zufriedenstellende Interaktion mit Menschen, während Automatisierung unbeaufsichtigte, zuverlässige und kalibrierte Entscheidungen im Hintergrund verlangt.
  4. RLVR (Reinforcement Learning from Verifiable Rewards) setzt auf überprüfbare Zielerreichung statt auf Nutzergefälligkeit, löst aber nicht automatisch alle Herausforderungen im Stack.
  5. Echte Software-Automatisierung erfordert nicht nur billigere Code-Erstellung durch Chat-Assistenten, sondern Softwarebausteine mit verlässlicher Intelligenz innerhalb der Arbeitsabläufe.

Warum das relevant ist

Viele Unternehmen versuchen, Chat- und Assistenten-Modelle direkt in autonome Hintergrundprozesse einzubauen, scheitern jedoch an Zuverlässigkeit und Halluzinationen. Das Verständnis der Grenzen von RLHF zeigt, warum ein bloßes Wechseln von Prompting-Strategien nicht ausreicht: Wenn das Trainingsziel auf menschliche Gefälligkeit optimiert ist, fehlen Modellen kalibrierte Fehlergrenzen für unbeaufsichtigte Arbeitsabläufe.

Einordnung

Almeida analysiert den Unterschied zwischen den Benchmark-Erfolgen moderner Modelle und den anhaltenden Problemen in simplen Unternehmensabläufen wie dem Kundenservice. Seine Unterscheidung zwischen Interaktionszielen (Nutzer zufriedenstellen) und Automationszielen (Aufgaben verlässlich abarbeiten) liefert ein präzises Raster für Systemarchitekten: Solange Modelle dafür belohnt werden, bei Unwissenheit plausibel und gefällig zu klingen, eignen sie sich für interaktive Paar-Programmierung oder Support-Routing, bleiben aber ein Risiko für unbeaufsichtigte Hintergrund-Pipelines.

Gefunden in

Zusammenfassung von KI erstellt (Gemini 3.8 Flash, 27. September 2026). Sie kann Fehler enthalten – maßgeblich ist die Originalquelle.

Inhaltlich ähnlich, ermittelt über die KI-Suche.

  • X-Post:AI Engineer 🔜 Paris 🇫🇷

    Was kommt nach RLHF? Diogo Almeida über Assistenz versus Automation

    In seinem Vortrag auf der AI Engineer World's Fair 2026 analysiert Diogo Almeida (TypeSafe AI) die Grenzen von Reinforcement Learning from Human Feedback (RLHF). Er unterscheidet grundlegend zwischen KI-Assistenzsystemen und echter, unbeaufsichtigter Automatisierung.

    2Lesezeichen812Aufrufe

    KI & AI· Vortrag

  • Artikel:Wikipedia contributors

    Reinforcement Learning from Human Feedback (RLHF): Funktionsweise und Einsatzbereiche

    Reinforcement Learning from Human Feedback (RLHF) ist ein Verfahren im maschinellen Lernen, das KI-Modelle an menschlichen Präferenzen ausrichtet. Anstatt feste Belohnungsfunktionen manuell zu definieren, bewerten menschliche Annotatoren Modellausgaben im Vergleich. Daraus lernt ein separates Belohnungsmodell, das wiederum die Modell-Policy mittels Algorithmen wie Proximal Policy Optimization optimiert.

    KI & AI· Sammlung

  • Artikel:Mehdi Allahyari

    Harness Engineering: Warum die Umgebung wichtiger ist als das LLM-Modell

    Nach Prompt- und Context-Engineering bildet Harness Engineering die dritte Phase im Bau autonomer KI-Systeme. Mehdi Allahyari beschreibt die Software-Infrastruktur um das Sprachmodell als entscheidenden Erfolgsfaktor für Zuverlässigkeit und Selbstkorrektur.

    KI & AI· Sammlung

  • Artikel:Anthropic

    Automatisierte KI-Forscher können Alignment-Fehler verringern

    Anthropic untersucht, wie KI-Modelle autonom Sicherheits- und Alignment-Forschung betreiben können. In Experimenten schloss Claude signifikante Sicherheitslücken bei zehn Kategorien von Alignment-Fehlern, ohne grundlegende Modellfähigkeiten zu schwächen. Dabei trainierte unter anderem das schwächere Modell Claude Sonnet 5 erfolgreich einen unfertigen Checkpoint des stärkeren Claude Opus 4.8.

    KI & AI· Forschung

  • Link:IndyDevDan

    Tactical Agentic Coding: Weiterentwicklung vom Prompting zum Agentic Engineering

    Mit dem Kursangebot Tactical Agentic Coding (TAC) propagiert der Entwickler IndyDevDan den Übergang vom interaktiven KI-Coding hin zu vollautonomen Agenten-Pipelines. Statt kontinuierlich im Prompting-Kreislauf („In the Loop“) zu verweilen, sollen Software-Entwickler lernen, deterministischen Code mit nicht-deterministischen KI-Agenten wie Claude Code zu kombinieren, um autonome Entwicklungsabläufe („Out of the Loop“) zu etablieren.

    KI & AI· Sammlung

  • Link:d-squared70.github.io

    From "It Worked Once" to "Every Single Time"

    Der Artikel beschreibt einen systematischen Prozess, um KI-Modelle wie Claude durch gezieltes Training und iterative Feedbackschleifen als verlässliche Assistenten zu etablieren. Anstatt sich auf zufällige Einzelergebnisse zu verlassen, wird die Entwicklung von Fähigkeiten, objektiven Checklisten und automatisierten Prüfinstanzen betont, um konsistente Qualität zu gewährleisten.

    KI & AI

Lassen Sie uns über Ihr Projekt sprechen

Standorte

  • Mattersburg
    Johann Nepomuk Bergerstraße 7/2/14
    7210 Mattersburg, Austria
  • Wien
    Ungargasse 64-66/3/404
    1030 Wien, Austria

Dieser Inhalt wurde teilweise mithilfe von KI erstellt.