KI-Chatbot-Regressions-Monitoring
Dein KI-Feature kann kaputtgehen, ohne einen einzigen Fehler im Log — ein Modellwechsel, eine Prompt-Änderung, ein defekter Key, eine abgeschnittene Antwort. Relvato sendet bei jedem Lauf denselben Prompt und meldet den Moment, in dem die Antwort schlechter wird.
Derselbe Prompt bei jedem Lauf — so wird Drift sichtbar
Relvato macht aus der unvorhersehbaren KI-Ausgabe eine deterministische Prüfung, ohne fragile Assertions.
Festen Prompt fixieren
Richte Relvato auf deinen KI-Endpunkt — einen Chatbot, eine RAG-Antwort, einen Agenten, jeden JSON-Endpunkt — und gib ihm eine Frage, die er bei jedem Lauf stellt. Der konstante Prompt macht eine Regression überhaupt erst sichtbar: Die App hat sich geändert, die Antwort musste es nicht.
Das Wesentliche prüfen
Deterministische Regeln entscheiden über Bestehen oder Fehlschlag: Der Endpunkt antwortet (2xx), die Antwort ist nicht leer, enthält weiterhin jede Pflichtphrase, keine verbotene Phrase und bleibt im Längen- und Latenzbudget.
Gegen eine Golden-Antwort bewerten
Optional fügst du eine freigegebene „Golden“-Antwort ein. Relvato AI bewertet, wie gut jede Antwort deren Bedeutung bewahrt (0–100), und erkennt Qualitätsdrift, den die Stichwortprüfung übersieht. Die Punktzahl berät nur — sie entscheidet nie über Bestehen oder Fehlschlag.
Alarmieren und korrelieren
Eine Regression löst einen Alarm aus und liegt auf der Zeitleiste beim Deploy, Modellwechsel oder der Prompt-Änderung drumherum — so weißt du, wo du zuerst suchen musst, nicht nur dass etwas kaputt ist.
Die stillen Arten, wie ein KI-Feature regrediert
Ein 200-OK-Healthcheck sieht nichts davon. Eine Ausgabe-Prüfung mit festem Prompt sieht alles.
Endpunkt down oder 4xx/5xx
Ein defekter API-Key, ein Rate-Limit, ein abgelaufener Token oder eine verschobene Route — das Feature liefert einen Fehler oder gar nichts.
Leere oder abgeschnittene Antwort
Das Modell liefert leer, einen Stummel oder eine abgeschnittene Antwort — oft nach einer Max-Tokens- oder Streaming-Änderung.
Eine Pflichtangabe verschwindet
Die Antwort erwähnt deine Rückgabefrist, Öffnungszeiten, Preise oder Richtlinie nicht mehr — eine RAG- oder Prompt-Änderung hat sie still entfernt.
Sagt plötzlich das Falsche
Eine verbotene Phrase schleicht sich ein — „Tut mir leid, das kann ich nicht“, ein halluzinierter Wettbewerber, ein geleakter System-Prompt, eine Entschuldigungsschleife.
Qualitätsdrift gegenüber der Golden-Antwort
Die Antwort besteht die Stichwortregeln noch, ist aber in Bedeutung oder Nutzen abgedriftet — der semantische Prüfer meldet den Abfall vor deinen Kunden.
Langsam oder verschlechtert
Die Latenz sprengt dein Budget oder die Antwort schrumpft — ein Modell-Downgrade oder ein Anbieter-Aussetzer, den eine Statusseite nicht zeigt.
Ein Ort für jede Art von Regression
Die KI-Ausgabe-Prüfung ist Teil desselben Monitorings, das deine Seiten, deinen Checkout und deine Verfügbarkeit überwacht.
KI-Chatbot-Regression — FAQ
Was ist eine KI-Chatbot-Regression?
Wenn ein KI-Feature, das funktioniert hat, schlechtere Antworten gibt — Fehler, leere oder abgeschnittene Antworten, eine fehlende Angabe, eine verbotene Phrase oder ein Qualitätsabfall — meist nach einem Modellwechsel, einer Prompt- oder RAG-Änderung, einer Konfigurationsänderung oder einem Anbieterproblem. Da es keine Exception im Log gibt, wird es leicht ausgeliefert und fällt erst auf, wenn Kunden sich beschweren.
Wie erkennt Relvato das ohne fragile Tests?
Es sendet bei jedem Lauf denselben festen Prompt an deinen Endpunkt und prüft die Antwort gegen deterministische Regeln: erreichbar, nicht leer, enthält die Pflichtphrasen, keine verbotenen, und im Längen- und Latenzbudget. Diese Regeln — nicht die KI — entscheiden über Bestehen oder Fehlschlag, daher sind die Ergebnisse stabil und wiederholbar.
Entscheidet die KI, ob mein Feature bestanden hat?
Nein. Die deterministischen Assertions entscheiden über Bestehen/Fehlschlag. Der optionale semantische Prüfer (Relvato AI) bewertet nur, wie nah die Antwort an deiner freigegebenen Golden-Referenz bleibt, und berät zu Qualitätsdrift — er entscheidet nie über das Ergebnis.
Funktioniert es mit jedem KI-Backend?
Ja. Richte es auf jeden HTTP-Endpunkt, der Text oder JSON zurückgibt — einen OpenAI- oder Anthropic-Aufruf hinter deiner eigenen API, eine Supabase Edge Function, ein eigenes RAG oder einen Agenten, das Backend eines Chatbot-Widgets. Setze bei Bedarf einen Response-Pfad, um die Antwort aus einer JSON-Antwort zu ziehen.
Kostet es mich Tokens?
Es ruft dein eigenes KI-Feature auf, ein Lauf kostet also so viel wie dieses Feature — genauso wie ein echter Nutzer mit einer Frage. Du steuerst, wie oft es läuft (nach Zeitplan, bei jedem Deploy oder bei Änderungsereignissen), und es ist bewusst opt-in.
Kann ich eine RAG-Pipeline oder einen Agenten überwachen, nicht nur einen Chatbot?
Ja. Alles, was einen Prompt entgegennimmt und Text zurückgibt, funktioniert — ein Support-Chatbot, ein RAG-Antwort-Endpunkt, ein Zusammenfasser, ein Klassifikator, die finale Nachricht eines Agenten. Der Ansatz „fester Prompt plus Assertions“ ist derselbe, egal was hinter dem Endpunkt steckt.
Erfahre den Moment, in dem sich deine KI-Antwort ändert
Füge die KI-Ausgabe-Prüfung in Minuten hinzu — ein fester Prompt, ein paar Regeln und eine optionale Golden-Antwort.