Ihr Pilot funktioniert. Können Sie es belegen?
Agenten scheitern leise. Ein Prompt wird geändert, eine Modellversion wandert weiter, das Schema eines Werkzeugs verschiebt sich — und die Qualität sinkt, ohne dass ein einziger Fehler gemeldet wird. Wir bauen die Harnesses, die messen, was ein Agent wirklich tut, damit die Entscheidung, ihn unbeaufsichtigt laufen zu lassen, auf Belegen ruht und nicht auf einer guten Demo.
Hier bleiben die meisten Projekte stehen
- +40 %
Qualitätsgewinn bei Aufgaben innerhalb der Fähigkeiten der KI — und messbar schlechtere Ergebnisse bei Aufgaben außerhalb davon. Gleiches Tool, gleiche Menschen.
Source: Dell'Acqua et al. 2023, Harvard Business School / BCG, pre-registered field experiment with 758 consultants; published in Organization Science, 2025
- 46 %
der KI-Projekte scheitern irgendwo zwischen Proof of Concept und breiter Nutzung
Source: S&P Global Market Intelligence 2025, Voice of the Enterprise: AI & Machine Learning, 1,006 professionals in North America and Europe
- 39 %
der Organisationen können ihrer KI-Arbeit überhaupt eine EBIT-Wirkung auf Unternehmensebene zuordnen
Source: McKinsey QuantumBlack, The State of AI in 2025, 1,993 respondents across 105 countries
Die Endantwort zu bewerten sagt fast nichts aus
Ein Agent kann eine flüssige, plausible Antwort liefern und dabei das falsche Werkzeug aufgerufen, eine Richtlinienprüfung übersprungen und die Arbeit nie abgeschlossen haben. Diese vier Verhaltensweisen entscheiden, ob er unbeaufsichtigt laufen darf.
01 · Werkzeugauswahl
Hat er zum Richtigen gegriffen
Das richtige Werkzeug, in der richtigen Reihenfolge, mit Argumenten, die gegen das Schema validieren. Das ist deterministisch und unstrittig — Assertions, keine Meinungen — und fängt die meisten echten Regressionen ab, bevor irgendetwas Subjektives ins Spiel kommt.
02 · Aufgabenerfüllung
Ist die Arbeit tatsächlich passiert
Ein Agent, der eine selbstbewusste Zusammenfassung einer Rückerstattung schreibt, die er nie ausgelöst hat, ist gescheitert — wie gut sich die Zusammenfassung auch liest. Erfüllung wird gegen den Zustand der Systeme geprüft, die der Durchlauf verändern sollte.
03 · Richtlinientreue
Ist er innerhalb der Grenzen geblieben
Schwellenwerte, Eskalationsregeln, Freigabegrenzen, Daten, die er nie hätte berühren dürfen. Ein Agent, der zur richtigen Antwort kommt, indem er eine Freigabe umgeht, hat den Test nicht bestanden, sondern verfehlt.
04 · Verhalten im Fehlerfall
Was er tut, wenn etwas bricht
Ein Timeout, eine fehlerhafte Antwort, eine Eingabe, die zu unklar ist, um zu handeln. Sauberes Scheitern ist eine testbare Eigenschaft — und genau die Eigenschaft, die eine Demo Ihnen nie zeigen soll.
Ein Durchlauf, den Sie lesen können, statt einer Zahl, der Sie glauben müssen
Jeder Fall trägt sein eigenes Urteil und die Begründung dazu. Entscheidend: Ein fehlgeschlagenes deterministisches Assertion und ein Judge, der schlechter bewertet, werden als unterschiedliche Arten von Befund dargestellt — denn das eine ist ein Build-Gate, das andere eine Frage an einen Menschen.
Drei Aufgaben — und nur eine davon findet vor dem Launch statt
Das Verhalten festnageln
Handgelabelte Golden Cases halten das Verhalten fest, sodass eine Prompt-Änderung oder ein Modell-Upgrade belegen muss, dass es nicht geschadet hat. Neue Anbieter und neue Prompts laufen gegen die aktuelle Baseline, lange bevor sie in die Nähe der Produktion kommen.
Das Offene bewerten
Wo die Ausgabe Prosa ist, gibt es nichts zu assertieren. Rubrik-getriebene Judges liefern dann eine Bewertung, die zwischen Durchläufen zumindest vergleichbar ist. Retrieval wird sauber gemessen — Precision, Recall, Faithfulness — statt danach beurteilt zu werden, wie sich die Antwort liest.
Im Betrieb beobachten
Keine Offline-Suite sieht echten Traffic. Nachvollziehbare Durchläufe, stichprobenartige menschliche Prüfung und Drift-Signale zeigen, wann sich das echte Verhalten von den geschriebenen Fällen entfernt hat — dort verstecken sich meist die interessanten Fehler.
Dieselbe Suite, drei Modelle, eine Entscheidung
Die Modellwahl ist eine Frage der Belege, nicht der Vorliebe. Eine Suite über alle Kandidaten laufen zu lassen macht daraus einen Vergleich, den Sie auch gegenüber der Person vertreten können, die die Rechnung freigibt — und zeigt, was Sie aufgeben, wenn Sie das günstigere Modell nehmen.
Automatisierte Bewertung ist Diagnose. Menschliche Prüfung entscheidet.
Ein Judge ist ein Modell mit einer Meinung, und eine Rubrik kodiert die Annahmen derjenigen, die sie geschrieben haben. Eine grüne Suite ist ein Beleg, kein Beweis. Deshalb bauen wir Harnesses, die berichten, welche Fälle sich verändert haben und warum, halten fehlgeschlagene deterministische Assertions getrennt vom Widerspruch eines Judges und legen die Fälle, die wirklich einen Menschen brauchen, einem Menschen vor. Wir zeigen Ihnen einen Widerspruch lieber, als ihn wegzumitteln.
Fragen, die Engineers stellen
Bringen Sie uns den Agenten, den Sie nicht freigeben können
Wir sagen Ihnen, was er tut, wo er bricht und was nötig wäre, um ihm unbeaufsichtigt zu vertrauen.