Direkt zum Inhalt

Wer testet die Agenten?

Warum klassische Tests allein nicht genügen

Wer testet die Agenten?

Mit Agentic AI führt Software nicht mehr nur vorgegebene Schritte aus, sondern entscheidet selbst, wie sie ein Ziel erreicht. Genau das macht sie so nützlich – doch damit verändern sich die Anforderungen an die Qualitätssicherung.

Ein Agent, der heute den passenden Workflow wählt, geht morgen bei identischer Eingabe einen anderen, ebenfalls plausiblen Weg. Klassische Testfälle mit einem strikt vorgegebenen Ablauf und einem einzigen Soll-Ergebnis reichen für die Qualitätssicherung nicht mehr aus.

Warum klassische Tests allein nicht genügen

Traditionelles Testen basiert auf einer stabilen Annahme: Gleiche Eingabe, gleicher Ablauf, gleiches Ergebnis. Für viele Teile einer Softwarelandschaft ist das weiterhin unverzichtbar – etwa für Schnittstellen, Berechtigungen, bei stabilen Geschäftsregeln. Bei KI-Agenten kommt eine zusätzliche Ebene hinzu: Ihr Verhalten ist variabel. Sie wählen autonom Werkzeuge, planen Zwischenschritte und reagieren auf Kontext. 

Die Relevanz dieser Thematik ist längst groß: Laut dem State of Agent Engineering 2026-Report von LangChain haben bereits 57 % der befragten Organisationen KI-Agenten in Produktion. Gleichzeitig wird Qualität – insbesondere Konsistenz und der Umgang mit Halluzinationen – als eine der größten Hürden für den produktiven Einsatz genannt. (https://www.langchain.com/state-of-agent-engineering) 

Die Grenzen klassischer Testverfahren zeigen sich bei:

  • variierendem Verhalten: Derselbe Prompt oder Trigger kann zu unterschiedlichen Aktionen führen.
  • unterschiedlichen Wegen zum Ziel: Ein Agent kann ein Ergebnis über verschiedene Pfade erstellen. 
  • begrenzter Transparenz: Drittanbieter-Agenten oder externe SaaS-Lösungen erlauben nicht immer einen Zugriff auf Quellcode, interne Logs oder Entscheidungslogik.
  • Skalierung: Ein einzelner Agent lässt sich gut beobachten. Bei vielen parallel laufenden Agenten-Workflows ist kontinuierliche Überwachung ohne Automatisierung kaum realistisch.

Klassische Testverfahren bleiben essenziell. Unternehmen müssen sie jedoch um Testmethoden ergänzen, die Risiken und tatsächliches Verhalten bewerten.

Vom Ergebnis-Test zum Verhaltens-Test

Die entscheidende Frage lautet: „Hat der Agent das gewünschte Ergebnis erreicht, dabei die vorgegebenen Regeln eingehalten und keine unzulässige Aktion ausgelöst?“ Für die Beantwortung ist ein verhaltensbasierter Testansatz erforderlich, er verbindet mehrere Fragen:

  1. Ergebnis: Wurde das fachliche Ziel korrekt erreicht?
  2. Regelkonformität: Hat der Agent Geschäftsregeln, Berechtigungen, Freigabegrenzen und Sicherheitsvorgaben eingehalten?
  3. Interaktion: Hat er die richtigen Systeme, Daten und Werkzeuge angemessen verwendet?
  4. Nachvollziehbarkeit: Lässt sich die Arbeitsweise nachvollziehen?

Ein Beispiel: Ein Agent bearbeitet eine Kundenreklamation. Es kann zulässig sein, dass er unterschiedliche Informationsquellen nutzt oder verschiedene Bearbeitungswege wählt. Nicht zulässig wäre es dagegen, einen definierten Erstattungsbetrag ohne Freigabe zu überschreiten, personenbezogene Daten nicht datenschutzrechtlich konform zu verarbeiten, Informationsquellen ohne Berechtigung zu nutzen oder einen Vorgang ohne Dokumentation abzuschließen.

Diese Anforderungen stellen den Test und insbesondere die Testautomatisierung vor neue Herausforderungen. Letztere hat – ebenso wie menschliche Testpersonen – drei wesentliche Aufgaben: 

  • Beobachten: Oberfläche und Systemverhalten so erfassen, wie ein Mensch den Ablauf wahrnehmen würde.
  • Bewerten: Prüfen, ob Ergebnis, Regeln und Risikogrenzen eingehalten wurden – auch wenn der konkrete Weg variieren darf.
  • Nachvollziehen: Abläufe, Entscheidungen und Abweichungen ausreichend dokumentieren, damit sie analysiert und auditiert werden können.

Neue Wege auch in der Testautomation

Mit Drvless hat Objentis ein Tool entwickelt, das auf visueller Erkennung von Bildschirminformationen beruht, Testfälle automatisiert abarbeitet und die Ergebnisse für das Testmanagement aufbereitet. Ergänzend zur Automation ist das Modul „Ideation“ in der Lage, aus vorhanden Informationen Testfälle zu generieren und diese – nach einer Freigabe – direkt an die automatische Testdurchführung weiter zu geben. Das System arbeitet ausschließlich über Bilderkennung und Maus/Tastatureingaben, ohne Verschränkung mit der zu testenden Software, es ist „nicht-invasiv“. 

Dieser Ansatz ermöglicht neue Wege in der Qualitätssicherung, gerade, wenn Agents zu testen sind. Drvless ist im Produktiv-Betrieb einsetzbar und kann damit auch für 24/7 Monitoring verwendet werden: Test und Monitoring werden verknüpft. 

Warum visuelle, nicht-invasive Tests besonders wertvoll sind

Wenn Agenten oder Zielsysteme nur eingeschränkt transparent sind, ermöglicht ein visueller, nicht-invasiver Ansatz eine unabhängige End-to-End-Sicht auf das, was tatsächlich passiert. Genau dies leistet Drvless. Es ist

  • kein interner Zugriff erforderlich: Weder Quellcode noch API-Dokumentation des Agenten müssen verfügbar sein.
  • technologieübergreifend: Ob Web-Anwendung, SAP-Frontend oder Legacy-Maske – entscheidend ist nur, dass die Interaktion über eine sichtbare Oberfläche erfolgt.
  • nah am realen Einsatz: Der Test validiert, was Anwenderinnen und Anwender tatsächlich sehen und welche Aktionen der Agent in der produktiven Umgebung auslöst.

Visuelle Tests sind kein Ersatz für die anderen Testebenen. Sie prüfen beispielsweise nicht die internen Datenflüsse, API-Aufrufe oder Sicherheitsmechanismen. Ihren größten Nutzen entfalten sie als ergänzende Schicht zu API-, Security- und Daten-Tests.

Wo die Herausforderung besonders deutlich wird

Der Bedarf an einer solchen zusätzlichen Testebene zeigt sich aktuell vor allem in folgenden Bereichen:

  • Agentic-AI-Piloten in der Produktion: Sobald Agenten reale Geschäftsprozesse und Kundendaten berühren, steigen Anforderungen an Qualität, Kontrolle und Nachweisbarkeit. Ein automationsbasiertes Monitoring wird zum entscheidenden Qualitätsfaktor. Drvless eignet sich dafür in besonderer Weise.
  • Kundenservice und Backoffice: Agenten bearbeiten Anfragen, füllen Formulare aus, übertragen Daten oder treffen vorbereitende Entscheidungen mit direkter Auswirkung auf Kundinnen und Kunden. Diese Arbeitsschritte sind permanent zu überwachen. 
  • Regulierte und kritische Branchen: Je nach Branche, Einsatzszenario und Rolle des Unternehmens entstehen Anforderungen an Risikomanagement, Dokumen­tation, Monitoring und Governance. Regelwerke wie DORA oder NIS2 sind für viele Unternehmen von großer Relevanz.

Die eigentliche Frage: Wer übernimmt die Verantwortung?

Wer trägt die Verantwortung für die Qualität eines KI-Agenten?

  • Der Fachbereich, der den Anwendungsfall definiert?
  • IT und Architektur, die den Agenten integrieren?
  • IT-Security, die Zugriffsrechte und Schutzmaßnahmen verantwortet?
  • Data- oder AI-Teams, die Modelle, Prompts und Evaluierungen betreuen?
  • Oder Quality Assurance, die Teststrategie und Qualitätsnachweise sicherstellt?

Sie alle leisten einen wesentlichen Beitrag – bei klar definierten Rollen und Verantwortlichkeiten. 

Eine globale Deloitte-Studie zeigt, dass der Einsatz agentischer KI schneller wächst als die zugehörigen Kontrollmechanismen: Nur rund jedes fünfte Unternehmen verfügt über ein ausgereiftes Governance-Modell für autonome KI-Agenten. Damit bleiben Verantwortlichkeiten, Risikogrenzen, Auditierbarkeit und kontinuierliche Überwachung in vielen Organisationen noch unzureichend geklärt.

Deloitte (2026): The State of AI in the Enterprise 2026.
https://www.deloitte.com/content/dam/assets-zone3/us/en/docs/services/consulting/2026/state-of-ai-2026.pdf

Visuelle Testautomation stellt vor dem Einsatz sicher, dass eine Software, ein KI-Agent korrekt arbeitet. Dass dies auch im Betrieb so bleibt, dafür sorgt Monitoring. Objentis hat diese beiden Anforderungen in seinen Konzepten verknüpft und Lösungen entwickelt, die einfach zu implementieren und zu betreiben sind – mit Tools zur visuell basierten Testautomation, für RPA und das 24/7 Monitoring. 

Fazit

Es braucht neue Wege, neue Ansätze, mit denen Unternehmen sicherstellen, dass KI-Agenten zuverlässig, sicher und regelkonform handeln.

Klassische Tests bleiben unverzichtbar. Für den Test von KI-Agenten reichen ausschließlich ergebnis- und ablauforientierte Testfälle allein jedoch nicht aus: denn die Wege zu Ziel variieren, die Ergebnisse können sich voneinander unterscheiden. Insebesondere ist zu prüfen, ob die Agents Entscheidungen ausschließlich innerhalb definierter Grenzen treffen.

Ein visueller, verhaltensbasierter Testansatz ergänzt bestehende Qualitätssicherung: Er beobachtet Agenten in ihrer tatsächlichen Arbeitsumgebung, bewertet Ergebnisse und Regeln statt starrer Schrittfolgen. Drvless nutzt diesen Ansatz: KI-basierte visuelle Erkennung kombiniert mit vollständiger Tastatur- und Mausinteraktion – ohne Plugins oder SDKs (Software Development Kits). So kann geprüft werden, wie Agenten und die Systeme, mit denen sie interagieren, tatsächlich handeln.

Wenn ein KI-Agent zur Blackbox wird, darf der Testansatz es nicht sein. Visuelle Testautomation und Drvless sehen dabei genau hin.