Вступ
Більшість компаній, які тестують штучний інтелект для обслуговування клієнтів, стикаються з однією й тією ж проблемою. Система працює бездоганно протягом кількох тижнів. Потім вона надає одному клі єнту впевнену, але абсолютно неправильну відповідь. Можливо, щодо терміну повернення коштів. Можливо, щодо політики, яка змінилася минулого кварталу. Хтось із керівництва це помічає, і впровадження, яке мало охопити більшу частину черги, тихо зупиняється, охопивши лише її невелику частину.
Дані галузі підтверджують, наскільки поширеною є ця ситуація. Згідно зі звітом «2025 World Quality Report» від OpenText, Capgemini та Sogeti, для 60% опитаних організацій головними перешкодами для впровадження штучного інтелекту були проблеми з надійністю та «галюцинаціями» системи. Окреме дослідження від Gong показало, що 58% компаній призупинили проекти зі штучним інтелектом, а майже половина запланованих інвестицій у цю сферу була відкладена через проблеми з довірою, а не через бюджет. Інструменти цілком спроможні. А ось довіра до них — це те, що відстає.
Математика, що стоїть за однією неправильною відповіддю
Робота служби підтримки є асиметричною в тому сенсі, що використання середньої точності як показника є невигідним. Правильна відповідь економить кілька хвилин. Неправильна ж може призвести до затвердження повернення коштів, яке ніколи не мало відбутися, вигадати політику, якої ніколи не існувало, або взяти на себе зобов’язання, на яке ніхто не давав дозволу. Коли негативні наслідки однієї помилки переважають позитивні наслідки сотні правильних відповідей, оптимізація під середній випадок є абсолютно неправильною метою.
Є й приховані витрати. Керівник служби підтримки, який хоч раз помітив помилку ШІ, після цього починає все перевіряти двічі, що нівелює більшу частину часу, який система мала б заощадити. Довіра не оцінюється за кожною розмовою. Вона або зростає, або руйнується, і коли вона руйнується, команди перестають довіряти системі, навіть якщо вона більшу частину часу дає правильні відповіді.
Галюцинації не зникають, їх можна контролювати
Навіть найпотужніші мовні моделі вигадують інформацію за відповідних умов, і реальні показники вищі, ніж більшість людей припускає. Щодо обґрунтованого узагальнення — завдання, яке по суті є таким самим, як надання відповіді на основі власних довідкових документів, — у рейтингу галюцинацій Vectara найкращі моделі мають показник близько 3%, а відомі флагманські моделі зосереджуються в діапазоні від 6% до 15%. Деякі моделі, що інтенсивно використовують міркування, перевищують 20% у цьому ж завданні, оскільки глибше міркування дає їм більше простору для введення тверджень, яких у вихідному тексті ніколи не було. Якщо поставити модель перед відкритими питаннями, для яких немає жодних підстав, показники стають набагато гіршими. Дослідники зі Стенфорда виявили, що провідні моделі дають помилкові відповіді на переважну більшість конкретних юридичних питань, коли не надано жодного вихідного документа.
Це не означає, що якась конкретна модель є поганою. Це означає, що жодна модель, використовувана окремо, не є достатньо надійною, щоб її можна було застосовувати для платних клієнтів без нагляду з боку.
Інтелект і контроль тягнуть у протилежні боки
Існує структурна причина, через яку окрема модель не може вирішити цю проблему самостійно. У міру того, як система стає кращою в обробці неоднозначних або незнайомих випадків, її також стає складніше повністю передбачити, оскільки те саме міркування, яке дозволяє їй обробляти випадки, для яких ніхто не писав сценарію, є тим самим міркуванням, яке час від часу веде її туди, куди їй не слід йти. Більш потужна модель не обов’язково є безпечнішою. Саме цей компроміс пояснює, чому надійність потрібно проектувати як окремий шар навколо моделі, а не очікувати її від самої моделі.
Aissist підходить до цього за допомогою чотирьох рівнів методів замість одного. Інженерія підказок встановлює базові правила, яких дотримується кожне завдання, що має більшу вагу в агентній системі, де один запит клієнта може розширитися до понад десятка підзавдань, які всі повинні дотримуватися одних і тих самих обмежень. Етап «бустера» (booster) виконує невизначені рішення більше ніж один раз і зберігає відповідь, з якою погоджується більшість агентів, ціною додаткових обчислювальних ресурсів. Етап самоперевірки передбачає, що система перевіряє власний результат або передає його другій моделі в іншій ролі, перш ніж будь-що потрапить до клієнта. А над усім цим розташований багаторівневий рівень управління, який перевіряє, чи відповідає результат або дія політиці перед тим, як вони будуть оприлюднені, функціонуючи не стільки як фільтр, скільки як наглядач за всією системою.
Саме завдяки цій комбінації платформа утримує рівень помилок ШІ нижче 1% — показник, на який варто звернути увагу, головним чином тому, що дуже мало постачальників у цій галузі взагалі публікують такі дані.
Визначення, коли не слід відповідати
Найцінніша риса агента служби підтримки — не в тому, щоб правильно відповідати на якомога більше запитань. А в тому, щоб розпізнавати, на які з них не слід намагатися відповідати самостійно. Система, яка на ранній стадії ескалює складний спір щодо рахунків із додаванням повного контексту, завдає набагато менше шкоди, ніж та, яка продовжує діяти й намагається вгадати відповідь. Саме це також відрізняє агента, який лише описує спосіб виправлення, від того, хто фактично його застосовує: знаходить замовлення, вносить зміни та підтверджує їх клієнту.
Надійність потрібно підтримувати, а не лише створювати
Система, яка працює точно в день запуску, не залишиться такою, якщо за нею ніхто не стежитиме. Продукти змінюються, політики оновлюються, і запитання клієнтів змінюються разом з ними. Постійний моніторинг фіксує ці зміни у вигляді даних, а не хвилі скарг, а дисциплінований цикл оцінки, тестування та впровадження постійно усуває виявлені прогалини, причому людина все одно дає остаточне схвалення, перш ніж будь-які зміни вступають у силу.
Що насправді слід перевірити, перш ніж довіряти постачальнику
До будь-якого постачальника, який стверджує, що його ШІ ніколи не помиляється, слід ставитися з підозрою, оскільки зазвичай це означає, що ніхто не проводить достатньо ретельних вимірювань, щоб переконатися в протилежному. Ті, кого варто сприймати серйозно, оприлюднюють показник помилок, докладно пояснюють, як саме вони виявляють помилки до того, як їх побачать клієнти, та відкрито повідомляють, коли система передає справу людині, замість того щоб гадати. Це зовсім інший підхід, ніж «довіряйте ШІ», і саме він витримує випробування, коли система стикається з реальним обсягом звернень.

