• Technológia

Prečo sa zavádzanie umelej inteligencie na podporu pilotov zastavilo kvôli nedôvere, a nie kvôli nedostatočným schopnostiam

  • Felix Rose-Collins
  • ••
  • 3 min read

Úvod

Väčšina spoločností, ktoré testujú umelú inteligenciu v oblasti zákazníckej podpory, naráža na rovnakú prekážku. Systém funguje týždne bez problémov. Potom však jednému zákazníkovi poskytne istú, ale úplne nesprávnu odpoveď. Možno ide o lehotu na vrátenie peňazí. Možno o pravidlo, ktoré sa zmenilo v minulom štvrťroku. Niekto z vedenia si to všimne a zavedenie systému, ktoré malo pokryť väčšinu čakajúcej fronty, sa ticho zastaví na jej malej časti.

Údaje z odvetvia potvrdzujú, aký bežný je tento vzorec. Správa „2025 World Quality Report“ od spoločností OpenText, Capgemini a Sogeti zistila, že obavy o spoľahlivosť a nesprávne výstupy boli pre 60 % opýtaných organizácií hlavnou prekážkou pri zavádzaní umelej inteligencie. Samostatný prieskum spoločnosti Gong zistil, že 58 % spoločností pozastavilo projekty v oblasti umelej inteligencie a takmer polovica plánovaných investícií do umelej inteligencie bola zadržaná skôr z dôvodu obáv o dôveryhodnosť než z dôvodu rozpočtu. Nástroje sú schopné. Zaostáva však dôvera v ne.

Matematika za jednou nesprávnou odpoveďou

Práca v oblasti podpory je asymetrická v tom zmysle, že ako metriku penalizuje priemernú presnosť. Správna odpoveď ušetrí pár minút. Nesprávna odpoveď môže schváliť vrátenie peňazí, ktoré nikdy nemalo byť vyplatené, vymyslieť pravidlo, ktoré nikdy neexistovalo, alebo urobiť záväzok, ktorý nikto neschválil. Keď negatívny dopad jednej chyby preváži pozitívny dopad sto správnych odpovedí, optimalizácia pre priemerný prípad je úplne nesprávnym cieľom.

Existujú aj skryté náklady. Vedúci podpory, ktorý raz zachytí chybu umelej inteligencie, začne od tej chvíle všetko dvojnásobne kontrolovať, čím sa vymaže väčšina času, ktorý mal systém ušetriť. Dôvera sa nehodnotí na základe jednotlivých konverzácií. Buď sa buduje, alebo sa rúca, a keď sa raz zrúti, tímy prestanú systému dôverovať, aj keď má väčšinu času pravdu.

Halucinácie nezmiznú, dajú sa však zvládnuť

Dokonca aj najsilnejšie jazykové modely si za správnych podmienok vymýšľajú, a reálne čísla sú vyššie, než si väčšina ľudí myslí. Pri „grounded summarization“ (zhrnutí založenom na zdroji), čo je v podstate rovnaká úloha ako odpovedať na základe vlastnej dokumentácie podpory, rebríček halucinácií spoločnosti Vectara uvádza, že najlepšie modely dosahujú okolo 3 %, zatiaľ čo známe vlajkové modely sa pohybujú v rozmedzí 6 % až 15 %. Niektoré modely s náročným uvažovaním prekračujú pri tej istej úlohe hranicu 20 %, pretože hlbšie uvažovanie im dáva väčší priestor na uvádzanie tvrdení, ktoré zdrojový text nikdy neobsahoval. Ak model vystavíte otvoreným otázkam bez akéhokoľvek podkladu, čísla sa výrazne zhoršia. Výskumníci zo Stanfordu zistili, že popredné modely vytvárajú halucinácie pri veľkej väčšine konkrétnych právnych otázok, ak nebol poskytnutý žiadny zdrojový dokument.

To však neznamená, že by bol nejaký konkrétny model zlý. Znamená to, že žiadny model použitý samostatne nie je dostatočne spoľahlivý na to, aby bol nasadený pred platiacimi zákazníkmi bez toho, aby ho niečo kontrolovalo.

Inteligencia a kontrola ťahajú opačnými smermi

Existuje štrukturálny dôvod, prečo to jeden model nedokáže vyriešiť sám. Ako sa systém zlepšuje v riešení nejednoznačných alebo neznámych prípadov, stáva sa tiež ťažšie ho úplne predvídať, pretože to isté uvažovanie, ktoré mu umožňuje riešiť prípad, pre ktorý nikto nenapísal scenár, je uvažovanie, ktoré ho občas zavedie niekam, kam by nemal ísť. Schopnejší model nie je automaticky bezpečnejší. Práve kvôli tomuto kompromisu je potrebné spoľahlivosť navrhnúť ako vrstvu okolo modelu, a nie očakávať ju od samotného modelu.

Aissist k tomu pristupuje pomocou štyroch vrstvených techník namiesto jednej. Prompt engineering stanovuje základné pravidlá, ktorými sa riadi každá úloha, čo má väčší význam v agentovom systéme, kde sa jediná požiadavka zákazníka môže rozvinúť do viac ako tuctu čiastkových úloh, ktoré všetky musia rešpektovať rovnaké bezpečnostné zábrany. Krok „booster“ spúšťa neisté rozhodnutia viac ako raz a zachováva odpoveď, na ktorej sa zhodne väčšina agentov, aj za cenu dodatočného výpočtového výkonu. Krok „self inspection“ zabezpečuje, že systém skontroluje svoj vlastný výstup alebo ho odovzdá druhému modelu v inej úlohe, skôr než sa čokoľvek dostane k zákazníkovi. A nad tým všetkým sa nachádza vrstva riadenia, ktorá skontroluje, či výstup alebo akcia zodpovedá zásadám predtým, než sa odošle, pričom funguje menej ako filter a viac ako dozorca celého systému.

Vďaka tejto kombinácii udržiava platforma mieru chýb umelej inteligencie pod 1 %, čo je číslo hodné pozornosť najmä preto, že len veľmi málo dodávateľov v tejto oblasti takéto údaje vôbec zverejňuje.

Rozhodovanie, kedy neodpovedať

Najcennejším správaním pracovníka podpory nie je správne odpovedať na viac otázok. Je to rozpoznanie, na ktoré z nich by sa nemal pokúšať odpovedať sám. Systém, ktorý včas eskaluje zložitý spor týkajúci sa fakturácie spolu s úplným kontextom, spôsobuje oveľa menšie škody ako ten, ktorý pokračuje ďalej a háda. To je tiež to, čo odlišuje pracovníka, ktorý popisuje riešenie, od toho, ktorý ho skutočne aplikuje – vyhľadá objednávku, vykoná zmenu a potvrdí ju zákazníkovi.

Spoľahlivosť sa musí udržiavať, nie len vybudovať

Systém, ktorý je presný v deň spustenia, taký nezostane, ak ho nikto nebude sledovať. Produkty sa menia, zásady sa aktualizujú a otázky, ktoré kladú zákazníci, sa menia spolu s nimi. Neustále meranie zachytáva tieto zmeny vo forme údajov namiesto vlny sťažností a disciplinovaný cyklus hodnotenia, testovania a nasadzovania neustále odstraňuje zistené medzery, pričom človek stále schvaľuje zmeny, než sa skutočne zavedú.

Čo skutočne skontrolovať, než dôverujete dodávateľovi

K akémukoľvek dodávateľovi, ktorý tvrdí, že jeho umelá inteligencia sa nikdy nemýli, by sa malo pristupovať s podozrením, pretože to zvyčajne znamená, že nikto to nemeria dostatočne dôkladne, aby vedel, či je to inak. Tí, ktorých stojí za to brať vážne, zverejňujú mieru chybovosti, presne vysvetľujú, ako zachytávajú chyby skôr, než si ich všimnú zákazníci, a otvorene hovoria o tom, kedy systém odovzdá prípad človeku namiesto toho, aby hádal. To je úplne iný prístup ako „dôverujte umelej inteligencii“ a práve ten sa osvedčí, keď systém začne spracovávať skutočný objem žiadostí.

Felix Rose-Collins

Felix Rose-Collins

Ranktracker's CEO/CMO & Co-founder

Felix Rose-Collins is the Co-founder and CEO/CMO of Ranktracker. With over 15 years of SEO experience, he has single-handedly scaled the Ranktracker site to over 500,000 monthly visits, with 390,000 of these stemming from organic searches each month.

Začnite používať Ranktracker... zadarmo!

Zistite, čo brzdí vaše webové stránky v hodnotení.

Vytvorenie bezplatného konta

Alebo sa pri hláste pomocou svojich poverení

Different views of Ranktracker app