AIEWF 2026: Build Evals that actually matter

ArtikelVortrag

Ein Foliensatz von der Veranstaltung AIEWF 2026 mit dem Titel „Build Evals that actually matter“. Der eigentliche Text der Präsentation wurde im Abzug nicht erfasst.

Das Wichtigste

  1. Präsentation im Rahmen der AIEWF 2026.
  2. Thematischer Schwerpunkt liegt laut Titel auf der Erstellung relevanter Evaluationen (Evals).
  3. Über die Benutzeroberfläche von Google Präsentationen hinaus liegen keine Folieninhalte im Textabzug vor.

Warum das relevant ist

Das Design von Evaluations-Frameworks ist zentral für den verlässlichen Einsatz von KI-Systemen. Aufgrund fehlender Folieninhalte lässt sich der konkrete Ansatz jedoch nicht beurteilen.

Einordnung

Die Quelle enthält lediglich die Navigationselemente der Google-Docs-Ansicht und den Titel. Inhaltliche Details zu den vorgestellten Evaluationsmethoden fehlen.

Gefunden in

Zusammenfassung von KI erstellt (Gemini 3.8 Flash, 27. September 2026). Sie kann Fehler enthalten – maßgeblich ist die Originalquelle.

Inhaltlich ähnlich, ermittelt über die KI-Suche.

  • Video

    Video:AI Engineer

    Evaluierungen für KI-Agenten in der Praxis: Erkenntnisse von Lyft

    Nick Ung und Akshay Sharma von Lyft beschreiben die Entwicklung einer Evaluierungspipeline für KI-Kundendienst-Agenten. Sie erklären, warum standardmäßige Offline-Tests trügerische Erfolgsquoten liefern und wie feinabgestimmte Nutzersimulatoren sowie kalibrierte LLM-Judges verlässliche Qualitätsprüfungen ermöglichen.

    KI & AI· Vortrag

  • Video

    Video:AI Engineer

    Agent-Skills nicht ohne Evals ausliefern: Best Practices von Google DeepMind

    Philipp Schmid von Google DeepMind erläutert, warum Agent-Skills systematische Evaluationen (Evals) benötigen und wie man eine leichtgewichtige Testumgebung aufbaut. Anhand von Daten aus SkillsBench und internen Beispielen bei Google zeigt er, wie Skills strukturiert, getestet und bei Modellfortschritten wieder entfernt werden sollten.

    KI & AI· Vortrag

  • Link:Diogo Almeida

    Was kommt nach RLHF? Warum Verlässlichkeit ein anderes Trainingsziel braucht

    In seinem Vortrag auf der AI Engineer World's Fair 2026 argumentiert Diogo Almeida (früher bei OpenAI an GPT-4 und InstructGPT beteiligt, heute TypeSafe AI), dass RLHF Sprachmodelle zu hervorragenden Assistenten gemacht hat, aber echte unbeaufsichtigte Automatisierung behindert. Da RLHF menschliche Präferenzen belohnt, neigen Modelle dazu, überzeugend zu wirken statt kalibriert und korrekt zu sein. Für zuverlässige Hintergrundprozesse wird ein neues Optimierungsziel benötigt.

    KI & AI· Vortrag

  • Artikel:Kuldeep Paul

    Vergleich von fünf No-Code-Plattformen für KI-Agenten und deren Evaluation

    Ein Leitfaden von Maxim AI stellt fünf No-Code-Entwicklungsplattformen für KI-Agenten vor und erläutert, warum die systematische Evaluation vor dem Produktiveinsatz unverzichtbar ist. Über HTTP-Endpunkte und Webhooks lassen sich Agenten aus Systemen wie n8n, Gumloop, MindStudio, Lindy und Relevance AI automatisiert testen und überwachen.

    KI & AI· Sammlung

Lassen Sie uns über Ihr Projekt sprechen

Standorte

  • Mattersburg
    Johann Nepomuk Bergerstraße 7/2/14
    7210 Mattersburg, Austria
  • Wien
    Ungargasse 64-66/3/404
    1030 Wien, Austria

Dieser Inhalt wurde teilweise mithilfe von KI erstellt.