Wprowadzenie
Większość firm testujących sztuczną inteligencję w obsłudze klienta napotyka tę samą przeszkodę. System działa bez zarzutu przez kilka tygodni. Potem udziela jednemu z klientów pewnej siebie, ale całkowicie błędnej odpowiedzi. Być może dotyczy to terminu zwrotu pieniędzy. Być może dotyczy to zasad, które zmieniły się w ostatnim kwartale. Ktoś z kierownictwa to zauważa, a wdrożenie, które miało obsłużyć większość kolejki, po cichu zatrzymuje się na jej niewielkiej części.
Dane branżowe potwierdzają, jak powszechny jest ten schemat. Raport „2025 World Quality Report” opracowany przez OpenText, Capgemini i Sogeti wykazał, że obawy dotyczące niezawodności i błędów były główną barierą we wdrażaniu sztucznej inteligencji dla 60% ankietowanych organizacji. Oddzielne badania przeprowadzone przez firmę Gong wykazały, że 58% firm wstrzymało projekty związane ze sztuczną inteligencją, a prawie połowa planowanych inwestycji w tę technologię została wstrzymana raczej z powodu obaw dotyczących zaufania niż z powodu budżetu. Narzędzia są wydajne. To zaufanie do nich pozostaje w tyle.
Matematyka stojąca za jedną błędną odpowiedzią
Praca w dziale wsparcia ma charakter asymetryczny, co sprawia, że traktowanie średniej dokładności jako wskaźnika jest niekorzystne. Prawidłowa odpowiedź pozwala zaoszczędzić kilka minut. Błędna odpowiedź może doprowadzić do zatwierdzenia zwrotu kosztów, który nigdy nie powinien mieć miejsca, wymyślenia zasad, które nigdy nie istniały, lub podjęcia zobowiązania, na które nikt nie wyraził zgody. Gdy negatywne skutki jednego błędu przeważają nad korzyściami wynikającymi ze stu poprawnych odpowiedzi, optymalizacja pod kątem przypadku średniego jest całkowicie błędnym celem.
Istnieje też koszt mniej widoczny. Kierownik wsparcia, który raz zauważy, że sztuczna inteligencja się myli, zaczyna od tej pory wszystko dwukrotnie sprawdzać, co niweluje większość czasu, który system miał zaoszczędzić. Zaufanie nie jest oceniane na podstawie pojedynczej rozmowy. Buduje się ono lub załamuje, a gdy się załamie, zespoły przestają ufać systemowi, nawet jeśli w większości przypadków ma on rację.
Halucynacje nie znikają, można nimi zarządzać
Nawet najsilniejsze modele językowe generują halucynacje w odpowiednich warunkach, a rzeczywiste wskaźniki są wyższe, niż większość ludzi zakłada. W przypadku streszczania opartego na kontekście – zadania zasadniczo identycznego z udzielaniem odpowiedzi na podstawie własnej dokumentacji pomocy – ranking halucynacji firmy Vectara plasuje najlepsze modele na poziomie około 3%, a znane flagowe modele skupiają się w przedziale od 6% do 15%. Niektóre modele wymagające intensywnego wnioskowania osiągają w tym samym zadaniu wyniki przekraczające 20%, ponieważ głębsze wnioskowanie daje im większe pole do wprowadzania twierdzeń, których tekst źródłowy nigdy nie zawierał. Jeśli zmusi się model do odpowiadania na pytania otwarte, bez żadnego punktu odniesienia, wyniki stają się znacznie gorsze. Naukowcy ze Stanford odkryli, że wiodące modele popełniają błędy w przypadku znacznej większości konkretnych pytań prawnych, gdy nie dostarczono żadnego dokumentu źródłowego.
Nie oznacza to, że którykolwiek z modeli jest zły. Oznacza to, że żaden pojedynczy model, stosowany samodzielnie, nie jest wystarczająco niezawodny, by można go było udostępnić płacącym klientom bez nadzoru.
Inteligencja i kontrola dążą w przeciwnych kierunkach
Istnieje strukturalny powód, dla którego pojedynczy model nie jest w stanie samodzielnie rozwiązać tego problemu. W miarę jak system coraz lepiej radzi sobie z niejednoznacznymi lub nieznanymi przypadkami, coraz trudniej jest go w pełni przewidzieć, ponieważ to samo rozumowanie, które pozwala mu poradzić sobie z przypadkiem, którego nikt nie przewidział, jest tym samym rozumowaniem, które czasami prowadzi go w miejsce, w którym nie powinien się znaleźć. Bardziej wydajny model niekoniecznie jest bezpieczniejszy. Ten kompromis wyjaśnia, dlaczego niezawodność musi być zaprojektowana jako warstwa otaczająca model, a nie oczekiwana od samego modelu.
Aissist podchodzi do tego zagadnienia, stosując cztery warstwy technik zamiast jednej. Inżynieria podpowiedzi ustala podstawowe zasady, których przestrzega każde zadanie, co ma większe znaczenie w systemie agentowym, gdzie pojedyncze żądanie klienta może rozgałęziać się na kilkanaście podzadań, z których wszystkie muszą przestrzegać tych samych wytycznych. Etap wzmacniający (booster) wykonuje niepewne decyzje więcej niż raz i zachowuje odpowiedź, co do której zgadza się większość agentów, kosztem dodatkowych obliczeń. Etap samokontroli polega na tym, że system weryfikuje własne wyniki lub przekazuje je drugiemu modelowi pełniącemu inną rolę, zanim cokolwiek dotrze do klienta. Nad tym wszystkim znajduje się warstwa zarządzania, która sprawdza, czy wynik lub działanie jest zgodne z polityką przed jego wysłaniem, funkcjonując mniej jak filtr, a bardziej jak nadzorca całego systemu.
Dzięki tej kombinacji platforma utrzymuje wskaźnik błędów sztucznej inteligencji poniżej 1% – warto zwrócić uwagę na tę liczbę przede wszystkim dlatego, że tak niewielu dostawców w tej branży w ogóle ją publikuje.
Ocena, kiedy nie należy odpowiadać
Najcenniejszą cechą agenta obsługi klienta nie jest udzielanie większej liczby poprawnych odpowiedzi. Jest nią rozpoznanie, na które pytania nie powinien próbować odpowiadać samodzielnie. System, który wcześnie eskaluje skomplikowany spór rozliczeniowy wraz z pełnym kontekstem, wyrządza znacznie mniej szkód niż ten, który kontynuuje obsługę i próbuje zgadywać. To właśnie odróżnia agenta, który opisuje rozwiązanie, od tego, który faktycznie je wdraża – wyszukując zamówienie, wprowadzając zmianę i potwierdzając ją klientowi.
Niezawodność trzeba utrzymywać, a nie tylko budować
System, który działa bezbłędnie w dniu uruchomienia, nie pozostanie taki bez stałego nadzoru. Produkty ulegają zmianom, zasady są aktualizowane, a pytania zadawane przez klientów zmieniają się wraz z nimi. Ciągłe monitorowanie pozwala wychwycić te zmiany w postaci danych, a nie fali skarg, a zdyscyplinowany cykl oceny, testowania i wdrażania pozwala na bieżąco eliminować wykryte luki, przy czym przed wprowadzeniem jakichkolwiek rzeczywistych zmian nadal wymagana jest akceptacja człowieka.
Co faktycznie sprawdzić, zanim zaufamy dostawcy
Każdego dostawcy, który twierdzi, że jego sztuczna inteligencja nigdy się nie myli, należy traktować z podejrzliwością, ponieważ zazwyczaj oznacza to, że nikt nie dokonuje pomiarów wystarczająco dokładnie, by stwierdzić, że jest inaczej. Ci, których warto traktować poważnie, publikują wskaźnik błędów, dokładnie wyjaśniają, w jaki sposób wykrywają błędy, zanim klienci je zauważą, oraz otwarcie informują, kiedy system przekazuje sprawę osobie, zamiast polegać na domysłach. To zupełnie inne podejście niż hasło „zaufaj sztucznej inteligencji” i to właśnie ono sprawdza się w praktyce, gdy system musi obsłużyć rzeczywistą liczbę zgłoszeń.

