Alle Prüfungen ansehen
KI-Feature-Monitoring

KI-Chatbot-Regressions-Monitoring

Dein KI-Feature kann kaputtgehen, ohne einen einzigen Fehler im Log — ein Modellwechsel, eine Prompt-Änderung, ein defekter Key, eine abgeschnittene Antwort. Relvato sendet bei jedem Lauf denselben Prompt und meldet den Moment, in dem die Antwort schlechter wird.

Lege einen festen Prompt fest und die Regeln, die eine Regression definieren — Pflichtphrasen, Längen- und Latenzbudgets sowie eine optionale Golden-Referenz.
So funktioniert's

Derselbe Prompt bei jedem Lauf — so wird Drift sichtbar

Relvato macht aus der unvorhersehbaren KI-Ausgabe eine deterministische Prüfung, ohne fragile Assertions.

01

Festen Prompt fixieren

Richte Relvato auf deinen KI-Endpunkt — einen Chatbot, eine RAG-Antwort, einen Agenten, jeden JSON-Endpunkt — und gib ihm eine Frage, die er bei jedem Lauf stellt. Der konstante Prompt macht eine Regression überhaupt erst sichtbar: Die App hat sich geändert, die Antwort musste es nicht.

02

Das Wesentliche prüfen

Deterministische Regeln entscheiden über Bestehen oder Fehlschlag: Der Endpunkt antwortet (2xx), die Antwort ist nicht leer, enthält weiterhin jede Pflichtphrase, keine verbotene Phrase und bleibt im Längen- und Latenzbudget.

03

Gegen eine Golden-Antwort bewerten

Optional fügst du eine freigegebene „Golden“-Antwort ein. Relvato AI bewertet, wie gut jede Antwort deren Bedeutung bewahrt (0–100), und erkennt Qualitätsdrift, den die Stichwortprüfung übersieht. Die Punktzahl berät nur — sie entscheidet nie über Bestehen oder Fehlschlag.

04

Alarmieren und korrelieren

Eine Regression löst einen Alarm aus und liegt auf der Zeitleiste beim Deploy, Modellwechsel oder der Prompt-Änderung drumherum — so weißt du, wo du zuerst suchen musst, nicht nur dass etwas kaputt ist.

Was es erkennt

Die stillen Arten, wie ein KI-Feature regrediert

Ein 200-OK-Healthcheck sieht nichts davon. Eine Ausgabe-Prüfung mit festem Prompt sieht alles.

Endpunkt down oder 4xx/5xx

Ein defekter API-Key, ein Rate-Limit, ein abgelaufener Token oder eine verschobene Route — das Feature liefert einen Fehler oder gar nichts.

Leere oder abgeschnittene Antwort

Das Modell liefert leer, einen Stummel oder eine abgeschnittene Antwort — oft nach einer Max-Tokens- oder Streaming-Änderung.

Eine Pflichtangabe verschwindet

Die Antwort erwähnt deine Rückgabefrist, Öffnungszeiten, Preise oder Richtlinie nicht mehr — eine RAG- oder Prompt-Änderung hat sie still entfernt.

Sagt plötzlich das Falsche

Eine verbotene Phrase schleicht sich ein — „Tut mir leid, das kann ich nicht“, ein halluzinierter Wettbewerber, ein geleakter System-Prompt, eine Entschuldigungsschleife.

Qualitätsdrift gegenüber der Golden-Antwort

Die Antwort besteht die Stichwortregeln noch, ist aber in Bedeutung oder Nutzen abgedriftet — der semantische Prüfer meldet den Abfall vor deinen Kunden.

Langsam oder verschlechtert

Die Latenz sprengt dein Budget oder die Antwort schrumpft — ein Modell-Downgrade oder ein Anbieter-Aussetzer, den eine Statusseite nicht zeigt.

Passt zum Rest von Relvato

Ein Ort für jede Art von Regression

Die KI-Ausgabe-Prüfung ist Teil desselben Monitorings, das deine Seiten, deinen Checkout und deine Verfügbarkeit überwacht.

Fragen, beantwortet

KI-Chatbot-Regression — FAQ

Was ist eine KI-Chatbot-Regression?

Wenn ein KI-Feature, das funktioniert hat, schlechtere Antworten gibt — Fehler, leere oder abgeschnittene Antworten, eine fehlende Angabe, eine verbotene Phrase oder ein Qualitätsabfall — meist nach einem Modellwechsel, einer Prompt- oder RAG-Änderung, einer Konfigurationsänderung oder einem Anbieterproblem. Da es keine Exception im Log gibt, wird es leicht ausgeliefert und fällt erst auf, wenn Kunden sich beschweren.

Wie erkennt Relvato das ohne fragile Tests?

Es sendet bei jedem Lauf denselben festen Prompt an deinen Endpunkt und prüft die Antwort gegen deterministische Regeln: erreichbar, nicht leer, enthält die Pflichtphrasen, keine verbotenen, und im Längen- und Latenzbudget. Diese Regeln — nicht die KI — entscheiden über Bestehen oder Fehlschlag, daher sind die Ergebnisse stabil und wiederholbar.

Entscheidet die KI, ob mein Feature bestanden hat?

Nein. Die deterministischen Assertions entscheiden über Bestehen/Fehlschlag. Der optionale semantische Prüfer (Relvato AI) bewertet nur, wie nah die Antwort an deiner freigegebenen Golden-Referenz bleibt, und berät zu Qualitätsdrift — er entscheidet nie über das Ergebnis.

Funktioniert es mit jedem KI-Backend?

Ja. Richte es auf jeden HTTP-Endpunkt, der Text oder JSON zurückgibt — einen OpenAI- oder Anthropic-Aufruf hinter deiner eigenen API, eine Supabase Edge Function, ein eigenes RAG oder einen Agenten, das Backend eines Chatbot-Widgets. Setze bei Bedarf einen Response-Pfad, um die Antwort aus einer JSON-Antwort zu ziehen.

Kostet es mich Tokens?

Es ruft dein eigenes KI-Feature auf, ein Lauf kostet also so viel wie dieses Feature — genauso wie ein echter Nutzer mit einer Frage. Du steuerst, wie oft es läuft (nach Zeitplan, bei jedem Deploy oder bei Änderungsereignissen), und es ist bewusst opt-in.

Kann ich eine RAG-Pipeline oder einen Agenten überwachen, nicht nur einen Chatbot?

Ja. Alles, was einen Prompt entgegennimmt und Text zurückgibt, funktioniert — ein Support-Chatbot, ein RAG-Antwort-Endpunkt, ein Zusammenfasser, ein Klassifikator, die finale Nachricht eines Agenten. Der Ansatz „fester Prompt plus Assertions“ ist derselbe, egal was hinter dem Endpunkt steckt.

KI-Features ohne stille Regressionen ausliefern

Erfahre den Moment, in dem sich deine KI-Antwort ändert

Füge die KI-Ausgabe-Prüfung in Minuten hinzu — ein fester Prompt, ein paar Regeln und eine optionale Golden-Antwort.