• Technologia

Dlaczego wdrażanie systemów wspomagających pilotów opartych na sztucznej inteligencji utknęło w martwym punkcie z powodu braku zaufania, a nie z powodu ograniczeń funkcjonalnych

  • Felix Rose-Collins
  • ••
  • 4 min read

Wprowadzenie

Większość firm testujących sztuczną inteligencję w obsłudze klienta napotyka tę samą przeszkodę. System działa bez zarzutu przez kilka tygodni. Potem udziela jednemu z klientów pewnej siebie, ale całkowicie błędnej odpowiedzi. Być może dotyczy to terminu zwrotu pieniędzy. Być może dotyczy to zasad, które zmieniły się w ostatnim kwartale. Ktoś z kierownictwa to zauważa, a wdrożenie, które miało obsłużyć większość kolejki, po cichu zatrzymuje się na jej niewielkiej części.

Dane branżowe potwierdzają, jak powszechny jest ten schemat. Raport „2025 World Quality Report” opracowany przez OpenText, Capgemini i Sogeti wykazał, że obawy dotyczące niezawodności i błędów były główną barierą we wdrażaniu sztucznej inteligencji dla 60% ankietowanych organizacji. Oddzielne badania przeprowadzone przez firmę Gong wykazały, że 58% firm wstrzymało projekty związane ze sztuczną inteligencją, a prawie połowa planowanych inwestycji w tę technologię została wstrzymana raczej z powodu obaw dotyczących zaufania niż z powodu budżetu. Narzędzia są wydajne. To zaufanie do nich pozostaje w tyle.

Matematyka stojąca za jedną błędną odpowiedzią

Praca w dziale wsparcia ma charakter asymetryczny, co sprawia, że traktowanie średniej dokładności jako wskaźnika jest niekorzystne. Prawidłowa odpowiedź pozwala zaoszczędzić kilka minut. Błędna odpowiedź może doprowadzić do zatwierdzenia zwrotu kosztów, który nigdy nie powinien mieć miejsca, wymyślenia zasad, które nigdy nie istniały, lub podjęcia zobowiązania, na które nikt nie wyraził zgody. Gdy negatywne skutki jednego błędu przeważają nad korzyściami wynikającymi ze stu poprawnych odpowiedzi, optymalizacja pod kątem przypadku średniego jest całkowicie błędnym celem.

Istnieje też koszt mniej widoczny. Kierownik wsparcia, który raz zauważy, że sztuczna inteligencja się myli, zaczyna od tej pory wszystko dwukrotnie sprawdzać, co niweluje większość czasu, który system miał zaoszczędzić. Zaufanie nie jest oceniane na podstawie pojedynczej rozmowy. Buduje się ono lub załamuje, a gdy się załamie, zespoły przestają ufać systemowi, nawet jeśli w większości przypadków ma on rację.

Halucynacje nie znikają, można nimi zarządzać

Nawet najsilniejsze modele językowe generują halucynacje w odpowiednich warunkach, a rzeczywiste wskaźniki są wyższe, niż większość ludzi zakłada. W przypadku streszczania opartego na kontekście – zadania zasadniczo identycznego z udzielaniem odpowiedzi na podstawie własnej dokumentacji pomocy – ranking halucynacji firmy Vectara plasuje najlepsze modele na poziomie około 3%, a znane flagowe modele skupiają się w przedziale od 6% do 15%. Niektóre modele wymagające intensywnego wnioskowania osiągają w tym samym zadaniu wyniki przekraczające 20%, ponieważ głębsze wnioskowanie daje im większe pole do wprowadzania twierdzeń, których tekst źródłowy nigdy nie zawierał. Jeśli zmusi się model do odpowiadania na pytania otwarte, bez żadnego punktu odniesienia, wyniki stają się znacznie gorsze. Naukowcy ze Stanford odkryli, że wiodące modele popełniają błędy w przypadku znacznej większości konkretnych pytań prawnych, gdy nie dostarczono żadnego dokumentu źródłowego.

Nie oznacza to, że którykolwiek z modeli jest zły. Oznacza to, że żaden pojedynczy model, stosowany samodzielnie, nie jest wystarczająco niezawodny, by można go było udostępnić płacącym klientom bez nadzoru.

Inteligencja i kontrola dążą w przeciwnych kierunkach

Istnieje strukturalny powód, dla którego pojedynczy model nie jest w stanie samodzielnie rozwiązać tego problemu. W miarę jak system coraz lepiej radzi sobie z niejednoznacznymi lub nieznanymi przypadkami, coraz trudniej jest go w pełni przewidzieć, ponieważ to samo rozumowanie, które pozwala mu poradzić sobie z przypadkiem, którego nikt nie przewidział, jest tym samym rozumowaniem, które czasami prowadzi go w miejsce, w którym nie powinien się znaleźć. Bardziej wydajny model niekoniecznie jest bezpieczniejszy. Ten kompromis wyjaśnia, dlaczego niezawodność musi być zaprojektowana jako warstwa otaczająca model, a nie oczekiwana od samego modelu.

Aissist podchodzi do tego zagadnienia, stosując cztery warstwy technik zamiast jednej. Inżynieria podpowiedzi ustala podstawowe zasady, których przestrzega każde zadanie, co ma większe znaczenie w systemie agentowym, gdzie pojedyncze żądanie klienta może rozgałęziać się na kilkanaście podzadań, z których wszystkie muszą przestrzegać tych samych wytycznych. Etap wzmacniający (booster) wykonuje niepewne decyzje więcej niż raz i zachowuje odpowiedź, co do której zgadza się większość agentów, kosztem dodatkowych obliczeń. Etap samokontroli polega na tym, że system weryfikuje własne wyniki lub przekazuje je drugiemu modelowi pełniącemu inną rolę, zanim cokolwiek dotrze do klienta. Nad tym wszystkim znajduje się warstwa zarządzania, która sprawdza, czy wynik lub działanie jest zgodne z polityką przed jego wysłaniem, funkcjonując mniej jak filtr, a bardziej jak nadzorca całego systemu.

Dzięki tej kombinacji platforma utrzymuje wskaźnik błędów sztucznej inteligencji poniżej 1% – warto zwrócić uwagę na tę liczbę przede wszystkim dlatego, że tak niewielu dostawców w tej branży w ogóle ją publikuje.

Ocena, kiedy nie należy odpowiadać

Najcenniejszą cechą agenta obsługi klienta nie jest udzielanie większej liczby poprawnych odpowiedzi. Jest nią rozpoznanie, na które pytania nie powinien próbować odpowiadać samodzielnie. System, który wcześnie eskaluje skomplikowany spór rozliczeniowy wraz z pełnym kontekstem, wyrządza znacznie mniej szkód niż ten, który kontynuuje obsługę i próbuje zgadywać. To właśnie odróżnia agenta, który opisuje rozwiązanie, od tego, który faktycznie je wdraża – wyszukując zamówienie, wprowadzając zmianę i potwierdzając ją klientowi.

Niezawodność trzeba utrzymywać, a nie tylko budować

System, który działa bezbłędnie w dniu uruchomienia, nie pozostanie taki bez stałego nadzoru. Produkty ulegają zmianom, zasady są aktualizowane, a pytania zadawane przez klientów zmieniają się wraz z nimi. Ciągłe monitorowanie pozwala wychwycić te zmiany w postaci danych, a nie fali skarg, a zdyscyplinowany cykl oceny, testowania i wdrażania pozwala na bieżąco eliminować wykryte luki, przy czym przed wprowadzeniem jakichkolwiek rzeczywistych zmian nadal wymagana jest akceptacja człowieka.

Co faktycznie sprawdzić, zanim zaufamy dostawcy

Każdego dostawcy, który twierdzi, że jego sztuczna inteligencja nigdy się nie myli, należy traktować z podejrzliwością, ponieważ zazwyczaj oznacza to, że nikt nie dokonuje pomiarów wystarczająco dokładnie, by stwierdzić, że jest inaczej. Ci, których warto traktować poważnie, publikują wskaźnik błędów, dokładnie wyjaśniają, w jaki sposób wykrywają błędy, zanim klienci je zauważą, oraz otwarcie informują, kiedy system przekazuje sprawę osobie, zamiast polegać na domysłach. To zupełnie inne podejście niż hasło „zaufaj sztucznej inteligencji” i to właśnie ono sprawdza się w praktyce, gdy system musi obsłużyć rzeczywistą liczbę zgłoszeń.

Felix Rose-Collins

Felix Rose-Collins

Ranktracker's CEO/CMO & Co-founder

Felix Rose-Collins is the Co-founder and CEO/CMO of Ranktracker. With over 15 years of SEO experience, he has single-handedly scaled the Ranktracker site to over 500,000 monthly visits, with 390,000 of these stemming from organic searches each month.

Zacznij używać Ranktrackera... Za darmo!

Dowiedz się, co powstrzymuje Twoją witrynę przed zajęciem miejsca w rankingu.

Załóż darmowe konto

Lub Zaloguj się używając swoich danych uwierzytelniających

Different views of Ranktracker app