01 · PROMPT
Zmiana instrukcji
Poprawia ton lub routing, ale może zmienić warunek eskalacji albo kolejność pytań.
AI Regression Testing · Voice · Chat · Agents
Zmiana promptu, modelu, RAG-u, toola albo integracji może poprawić jeden scenariusz i po cichu zepsuć inny. Buduję powtarzalny zestaw testów PASS / FAIL, który sprawdza nie tylko odpowiedź modelu, ale też akcje i finalny stan procesu.
Regression run · przykład
RELEASE_CANDIDATE_013
Critical regression · RESCHEDULE_APPOINTMENT
Dlaczego regresja w AI jest inna
W klasycznym teście łatwo sprawdzić konkretny output. W systemie opartym na LLM trzeba pilnować także kontekstu, retrievalu, argumentów tool calla, retry i tego, czy backend naprawdę wykonał operację.
01 · PROMPT
Poprawia ton lub routing, ale może zmienić warunek eskalacji albo kolejność pytań.
02 · MODEL
Ten sam prompt nie gwarantuje tego samego zachowania przy innym modelu lub providerze.
03 · RAG
Zmiana źródeł, chunkingu lub retrievera może podmienić poprawny kontekst na pozornie podobny.
04 · TOOLS
Odpowiedź może brzmieć poprawnie mimo złych argumentów, timeoutu albo nieudanego API.
05 · VOICE
ASR, barge-in, endpointing lub latency mogą zepsuć scenariusz, który tekstowo przechodzi.
Jak testuję
Scenariusz ma przejść wtedy, gdy system zachowa się poprawnie z punktu widzenia procesu biznesowego. Sama „dobra odpowiedź” modelu nie wystarcza.
Proces, warunki wstępne, invariants i finalny stan. Ustalamy, co system musi zrobić, czego nie może zrobić i które błędy są krytyczne.
Happy path, edge cases, korekty multi-turn, wcześniejsze bugi, błędne dane, timeouty, retry i przypadki wynikające z realnego użycia.
Deterministyczne asercje, reguły biznesowe, walidacja tool calli i backend state. Gdy wynik jest semantyczny lub stochastyczny, używam odpowiedniego scorera i w razie potrzeby kilku prób zamiast oczekiwać identycznego tekstu za każdym razem.
Zapisuję wersję promptu, modelu, konfiguracji i danych, które tworzą punkt odniesienia. Dla twardych reguł baseline może być binarny; dla zachowań stochastycznych może obejmować próg lub rozkład wyników z kilku uruchomień.
Ręcznie przed wydaniem albo opcjonalnie w CI/CD. Raport pokazuje, który scenariusz się zepsuł, gdzie i z jaką wagą.
Jeden scenariusz, kilka warstw
Przykład · przełożenie wizyty
Użytkownik prosi o przeniesienie wizyty. Odpowiedź jest naturalna i zgodna z intencją. Regression test nie kończy się jednak na tekście: sprawdza tool call, odpowiedź API i stan wizyty.
W tym przykładzie jedna regresja o severity CRITICAL wystarcza, żeby quality gate nie przeszedł.
Co dostajecie
SCENARIOS
Krytyczne przepływy, edge cases i znane failure modes zapisane w powtarzalnej formie.
GOLDEN DATASET
Wejścia, kontekst, preconditions i oczekiwane zachowanie dla scenariuszy, które mają chronić release.
EVALUATORS
Sprawdzenie odpowiedzi, tool calli, argumentów, reguł biznesowych oraz stanu systemu.
DIFF
Czytelna informacja: co nadal przechodzi, co się poprawiło i które zachowanie wróciło jako regresja.
SEVERITY
CRITICAL / HIGH / MEDIUM zamiast traktowania wszystkich FAIL-i tak samo.
OPTIONAL CI
Jeśli architektura pozwala, zestaw może zwracać PASS / FAIL w pipeline przed releasem.
Dla kogo
DOBRY FIT
Możliwe white-label jako niezależna warstwa QA przed handoverem do klienta.
MNIEJ SENSU NA TYM ETAPIE
W takim przypadku lepszy może być najpierw AI Agent Audit albo mały Quality Check.
FAQ
Nie zawsze. Dużą część scenariuszy można testować black-box przez interfejs, numer telefonu lub API. Dostęp do logów i kodu pomaga wtedy, gdy chcemy precyzyjnie walidować retriever, tool calle, parametry lub stan backendu.
Tak. Dla systemów głosowych do scenariuszy można dołączyć m.in. ASR, barge-in, turn-taking, endpointing, latencję oraz zachowanie po błędnym rozpoznaniu krytycznego slotu.
Nie. Quality gate powinien uwzględniać wagę scenariusza i severity. Krytyczny błąd w potwierdzeniu operacji biznesowej może blokować wydanie, podczas gdy drobny problem językowy nie musi.
Tak, jeśli architektura i dostęp na to pozwalają. Zestaw można uruchamiać ręcznie przed wydaniem albo zintegrować z pipeline CI/CD i zwracać wynik PASS / FAIL jako quality gate.
Nie ma jednej właściwej liczby. Zaczynam od procesów o największym ryzyku biznesowym i znanych failure modes. Bezpłatny AI Quality Check wykorzystuje 5 celowanych scenariuszy jednego procesu jako małą próbkę.
Zacznij od jednego procesu
W bezpłatnym Quality Checku wybiorę 5 celowanych scenariuszy jednego procesu i pokażę wynik w formie krótkich ustaleń PASS / FAIL.