VideoVideo:AI Engineer
Evaluierungen für KI-Agenten in der Praxis: Erkenntnisse von Lyft
Nick Ung und Akshay Sharma von Lyft beschreiben die Entwicklung einer Evaluierungspipeline für KI-Kundendienst-Agenten. Sie erklären, warum standardmäßige Offline-Tests trügerische Erfolgsquoten liefern und wie feinabgestimmte Nutzersimulatoren sowie kalibrierte LLM-Judges verlässliche Qualitätsprüfungen ermöglichen.
