Was kommt nach RLHF? Diogo Almeida über Assistenz versus Automation

X-PostAI Engineer 🔜 Paris 🇫🇷Vortrag

In seinem Vortrag auf der AI Engineer World's Fair 2026 analysiert Diogo Almeida (TypeSafe AI) die Grenzen von Reinforcement Learning from Human Feedback (RLHF). Er unterscheidet grundlegend zwischen KI-Assistenzsystemen und echter, unbeaufsichtigter Automatisierung.

Das Wichtigste

  1. ChatGPT und Claude Code fallen in dieselbe Kategorie: Sie sind Assistenzsysteme, die darauf optimiert sind, mit anwesenden Menschen zu interagieren und deren Präferenzen zu erfüllen.
  2. RLHF belohnt Antworten, die für den menschlichen Prüfer überzeugend aussehen, was jedoch von tatsächlicher Korrektheit abweichen kann.
  3. Es besteht eine fundamentale Diskrepanz: Modelle lösen komplexe Mathematikaufgaben, scheitern aber oft an verlässlicher, unbeaufsichtigter Automatisierung gewöhnlicher Workflows.
  4. Assistenz erfordert die Zufriedenheit des Nutzers bei ständiger Begleitung; echte Automatisierung verlangt hingegen kalibrierte, fehlerfreie Entscheidungen ohne menschliche Aufsicht.
  5. Für verlässliche Software-Automatisierung muss der Technologie-Stack neu um Zuverlässigkeit und kalibrierte Entscheidungsfindung herum aufgebaut werden.

Warum das relevant ist

Viele Unternehmen versuchen, Chat- und Assistenzmodelle direkt als autonome Agenten in Produktivsysteme einzubinden. Das Verständnis des Unterschieds zwischen menschlicher Präferenzoptimierung und kalibrierter Entscheidungsfindung ist entscheidend, um praxistaugliche Architekturen ohne unvorhersehbare Fehler zu bauen.

Einordnung

Almeida, der an GPT-4 und InstructGPT mitgearbeitet hat, liefert eine nüchterne Einordnung des aktuellen Agenten-Hypes. Modelle wirken oft kompetenter als sie sind, weil Pre-Training und RLHF sie darauf trainieren, souverän zu klingen statt Unsicherheiten akkurat einzuordnen. Solange KI-Systeme primär für menschliche Bestätigung trainiert werden, bleibt der Schritt zu verlässlicher Hintergrundautomatisierung blockiert.

Original-Post

AI Engineer 🔜 Paris 🇫🇷

@aiDotEngineer · 16. September 2026

full transcript t.co/NJzRWO5i2Y

0 Likes0 Antworten2 Lesezeichen812 Aufrufe

Auf X ansehen
Weitere Posts im Thread (1)
  1. congrats to Diogo on a full launch! for more on typesafe: check his aie talk: t.co/pPg9t1cIk4 out now! t.co/rdgkq1qWeC t.co/jfM4eBBMwL
Ausgewählte Antworten (4)
  • @softech28 @aiDotEngineer Interesting 🧠🧠🧠
  • @fde_spot @aiDotEngineer Congrats to Diogo — typesafe tooling is exactly the kind of “ships past the demo” infrastructure AI eng needs.
  • @NealFrazierTech @aiDotEngineer Type-safe agent tooling seems most valuable when it narrows the gap between a prototype and a system you can actually maintain. Releasing with explicit interfaces, observable failure modes, and a clear human handoff gives teams a path to trust automation without pretending it is
  • @NickGideo @aiDotEngineer my favorite talk from the conference!

Links und Tools aus diesem Beitrag

Zusammenfassung von KI erstellt (Gemini 3.8 Flash, 27. September 2026). Sie kann Fehler enthalten – maßgeblich ist die Originalquelle.

Inhaltlich ähnlich, ermittelt über die KI-Suche.

  • Link:Diogo Almeida

    Was kommt nach RLHF? Warum Verlässlichkeit ein anderes Trainingsziel braucht

    In seinem Vortrag auf der AI Engineer World's Fair 2026 argumentiert Diogo Almeida (früher bei OpenAI an GPT-4 und InstructGPT beteiligt, heute TypeSafe AI), dass RLHF Sprachmodelle zu hervorragenden Assistenten gemacht hat, aber echte unbeaufsichtigte Automatisierung behindert. Da RLHF menschliche Präferenzen belohnt, neigen Modelle dazu, überzeugend zu wirken statt kalibriert und korrekt zu sein. Für zuverlässige Hintergrundprozesse wird ein neues Optimierungsziel benötigt.

    KI & AI· Vortrag

  • Artikel:Wikipedia contributors

    Reinforcement Learning from Human Feedback (RLHF): Funktionsweise und Einsatzbereiche

    Reinforcement Learning from Human Feedback (RLHF) ist ein Verfahren im maschinellen Lernen, das KI-Modelle an menschlichen Präferenzen ausrichtet. Anstatt feste Belohnungsfunktionen manuell zu definieren, bewerten menschliche Annotatoren Modellausgaben im Vergleich. Daraus lernt ein separates Belohnungsmodell, das wiederum die Modell-Policy mittels Algorithmen wie Proximal Policy Optimization optimiert.

    KI & AI· Sammlung

  • Artikel:Anthropic

    Automatisierte KI-Forscher können Alignment-Fehler verringern

    Anthropic untersucht, wie KI-Modelle autonom Sicherheits- und Alignment-Forschung betreiben können. In Experimenten schloss Claude signifikante Sicherheitslücken bei zehn Kategorien von Alignment-Fehlern, ohne grundlegende Modellfähigkeiten zu schwächen. Dabei trainierte unter anderem das schwächere Modell Claude Sonnet 5 erfolgreich einen unfertigen Checkpoint des stärkeren Claude Opus 4.8.

    KI & AI· Forschung

  • X-Post:Mahax

    The Shift from Prompting to Agentic Loops and Graphs

    This post discusses the transition from simple AI prompting to more complex, autonomous agentic workflows using loops and graphs. By structuring AI tasks into iterative cycles with self-correction and multi-step dependencies, users can achieve higher-quality, automated results that go beyond standard chat interactions.

    11.832Lesezeichen1 Mio.Aufrufe

    KI & AI

  • Artikel:Mehdi Allahyari

    Harness Engineering: Warum die Umgebung wichtiger ist als das LLM-Modell

    Nach Prompt- und Context-Engineering bildet Harness Engineering die dritte Phase im Bau autonomer KI-Systeme. Mehdi Allahyari beschreibt die Software-Infrastruktur um das Sprachmodell als entscheidenden Erfolgsfaktor für Zuverlässigkeit und Selbstkorrektur.

    KI & AI· Sammlung

Lassen Sie uns über Ihr Projekt sprechen

Standorte

  • Mattersburg
    Johann Nepomuk Bergerstraße 7/2/14
    7210 Mattersburg, Austria
  • Wien
    Ungargasse 64-66/3/404
    1030 Wien, Austria

Dieser Inhalt wurde teilweise mithilfe von KI erstellt.