needs.expert
← Zurück zum Blog

25.09.2026

Welche Testfälle braucht ein KI-Agent?

Von Needs Team · 2 min Lesezeit

Eine Lieferantenrechnung kommt per E-Mail. Der KI-Agent soll sie prüfen, mit der Bestellung abgleichen und zur Zahlung vorbereiten. Im Normalfall klingt das einfach. Was passiert aber, wenn die Bestellnummer fehlt, der Betrag abweicht oder das Buchhaltungssystem nicht erreichbar ist?

Genau solche Situationen sollten Sie vor dem produktiven Einsatz testen. Aussagekräftige KI-Agent Testfälle decken mindestens fünf Fälle ab: Normalfall, fehlende Daten, Widerspruch, Toolfehler und Grenzfall.

Die fünf wichtigsten Testfälle

1. Normalfall

Alle erforderlichen Informationen liegen vor. Der Agent erledigt die Aufgabe korrekt und nutzt dafür geeignete, erlaubte Werkzeuge.

Bei der Rechnung prüft er zum Beispiel Lieferant, Betrag und Bestellnummer, gleicht die Angaben ab und legt das Ergebnis am vorgesehenen Ort ab.

2. Fehlende Daten

Eine wichtige Angabe fehlt, etwa die Bestellnummer oder das Lieferdatum. Der Agent darf diese Lücke nicht mit einer Vermutung füllen. Er fragt gezielt nach oder stellt den Vorgang mit einem verständlichen Hinweis zurück.

3. Widersprüchliche Angaben

Der Rechnungsbetrag passt nicht zum Bestellwert. Der Agent soll die Abweichung erkennen, benennen und auf eine Klärung warten. Eine Folgeaktion auf unsicherer Grundlage darf er nicht ausführen.

4. Toolfehler

Das Buchhaltungssystem ist nicht erreichbar, liefert unvollständige Daten oder reagiert zu langsam. Der Agent muss den Fehler erkennen, den Vorgang sicher anhalten und eine brauchbare Alternative anbieten. Insbesondere darf er nach dem Fehler keine Zahlung unkontrolliert erneut auslösen.

5. Grenzfall

Der Betrag überschreitet eine festgelegte Schwelle oder die Rechnung betrifft einen ungewöhnlichen Lieferanten. Der Test zeigt, ob der Agent seine Rechte und Grenzen einhält. Er kann den Fall vorbereiten, darf eine sensible Aktion aber nur ausführen, wenn sie dafür freigegeben ist.

Was Sie bei jedem Test prüfen

Bewerten Sie nicht nur das Endergebnis. Prüfen Sie auch:

  • Hat der Agent geeignete und erlaubte Werkzeuge sinnvoll eingesetzt?
  • Wenn eine Reihenfolge vorgeschrieben ist: Hat er sie eingehalten?
  • Hat er nur auf zulässige Daten zugegriffen?
  • Hat er Unsicherheit verständlich benannt?
  • Hat er bei einem Fehler sicher angehalten?
  • Sind Bearbeitungszeit und Begründung akzeptabel?

Anthropic empfiehlt aufgabenspezifische Prüfungen, die reale Arbeitsfälle und Randfälle abbilden. Google unterscheidet bei Agenten zwischen der Endantwort und dem beobachtbaren Handlungsweg. NIST ordnet Prüfung und Bewertung in einen vertrauenswürdigen KI-Lebenszyklus ein.

Diese Grundsätze gelten für jeden KI-Agenten. Für den jeweiligen Einsatz müssen konkrete Arbeitsabläufe, Datenzugriffe und zulässige Aktionen festgelegt und geprüft werden. Needs unterstützt Teams dabei, KI-Agenten in gemeinsame Arbeitsabläufe einzubinden und Rechte sowie Freigaben passend zur jeweiligen Aktion zu konfigurieren.

Definieren Sie vor dem Test, wann ein Fall bestanden ist. So wird aus einem ersten Eindruck eine belastbare Entscheidung.

Mehr über Needs erfahren.