21.09.2026
KI-Agent Erfolgskriterien: Einen Pilot messbar bewerten
Von Needs Team · 3 min Lesezeit
Eine Serviceanfrage kommt per E-Mail herein. Der KI-Agent ordnet sie zu, fasst den Vorgang zusammen und erstellt einen Antwortentwurf. Nach wenigen Minuten liegt das Ergebnis vor – doch ein Mitarbeiter muss fast jeden Satz korrigieren. War der Pilot erfolgreich? Die Zahl der Agentenläufe gibt darauf keine verlässliche Antwort.
Die wichtigsten KI-Agent Erfolgskriterien stehen deshalb vor dem Pilot fest: Ergebnisqualität, Bearbeitungsdauer bis zur Verwendbarkeit, passende Rückfragen und die möglichen Folgen von Fehlern. Ergänzt diese Kriterien um eine Ausgangsmessung, typische Fälle und klare Grenzen für Nachbesserung oder Abbruch.
1. Qualität des Ergebnisses
Definiert zuerst, woran ein brauchbares Ergebnis erkennbar ist. Bei der Vorsortierung von Serviceanfragen können das die richtige Kategorie, eine vollständige Zusammenfassung und ein fachlich passender Antwortentwurf sein.
Bewertet nicht nur das fertige Ergebnis. Je nach Aufgabe zählt auch der Weg dorthin: Hat der Agent die richtige Information verwendet? Hat er ein Werkzeug korrekt eingesetzt? Hat er fehlende Angaben erkannt?
Die Agent Evaluators von Microsoft unterscheiden zwischen der Bewertung des Endergebnisses und einzelner Schritte im Ablauf. Beides kann für den Pilot relevant sein.
2. Bearbeitungsdauer bis zur Verwendbarkeit
Messt die Zeit vom Eingang der Aufgabe bis zum nutzbaren Ergebnis. Dazu gehören Wartezeiten, Rückfragen und menschliche Nacharbeit.
Ein schneller Entwurf hilft wenig, wenn ein Mitarbeiter anschließend lange recherchieren, korrigieren oder Informationen ergänzen muss. Legt daher fest, wie viel Nacharbeit noch akzeptabel ist. Vergleicht den Wert mit dem bisherigen Ablauf und nutzt typische Vorgänge aus dem Tagesgeschäft.
3. Rückfragen im passenden Korridor
Rückfragen können zeigen, dass Angaben fehlen oder der Agent eine Unsicherheit erkannt hat. Zu viele unnötige Rückfragen bremsen den Prozess. Zu wenige können bedeuten, dass der Agent riskant rät.
Definiert deshalb je nach Aufgabe einen passenden Zielbereich. Bei einer einfachen Klassifizierung sind wenige Rückfragen plausibel. Bei unvollständigen Kundendaten kann ein höherer Wert sinnvoll sein. Bewertet zusätzlich, ob die Rückfragen verständlich und tatsächlich erforderlich sind.
4. Fehler nach ihrer Folge bewerten
Nicht jeder Fehler wiegt gleich schwer. Eine unvollständige Formulierung lässt sich leicht korrigieren. Eine falsche Lieferzusage oder Garantieinformation kann dagegen Kunden verärgern oder Kosten verursachen.
Prüft deshalb Schreibrechte, Reversibilität, Überwachbarkeit und mögliche Schadenshöhe. Diese Perspektive greift mehrere von NIST genannte Bewertungsdimensionen auf. Für risikoreiche Aktionen kann eine ausdrückliche Freigabe eine geeignete Schutzmaßnahme sein; die konkrete Regel hängt von Aufgabe, Berechtigungen und Schadenspotenzial ab. Routineaktionen können innerhalb ausdrücklich festgelegter Rechte ohne einzelne Freigabe zugelassen werden.
Mit realistischen Fällen testen
Stellt vor dem Pilot einen repräsentativen Testsatz mit bekannten Ergebnissen zusammen. Bewertet jeden Fall nach Qualität, Bearbeitungsdauer, Rückfragen und Fehlerklasse. Legt vorher fest, wann ihr nachbessert, den Umfang begrenzt oder den Pilot beendet.
OpenAI beschreibt die Bewertung vollständiger Ablaufspuren einschließlich Modell- und Werkzeugaufrufen. Das hilft, Fehler nicht nur im Endergebnis, sondern auch in ihrem Entstehungsweg zu finden.
Needs ist ein Agent OS für Unternehmen, in dem Menschen und KI-Agenten zusammenarbeiten und gemeinsames Firmenwissen nutzen. Mehr über den Einsatz von KI-Agenten bei Needs.