Introdução
A maioria das empresas que testa IA para atendimento ao cliente se depara com o mesmo obstáculo. O sistema funciona bem por semanas. Então, ele dá a um cliente uma resposta segura, mas completamente errada. Talvez sobre o prazo para reembolso. Talvez sobre uma política que mudou no último trimestre. Alguém da gerência percebe isso, e a implantação — que deveria cobrir a maior parte da fila de espera — é discretamente suspensa antes mesmo de atingir uma fração dela.
Dados do setor confirmam o quão comum esse padrão é. O Relatório Mundial de Qualidade 2025, da OpenText, Capgemini e Sogeti, constatou que preocupações com confiabilidade e erros eram a principal barreira à adoção da IA para 60% das organizações pesquisadas. Uma pesquisa separada da Gong revelou que 58% das empresas haviam paralisado projetos de IA e que quase metade dos investimentos planejados em IA foi adiada por questões de confiança, e não por restrições orçamentárias. As ferramentas são capazes. O que fica para trás é a confiança nelas.
A matemática por trás de uma resposta errada
O trabalho de suporte é assimétrico de tal forma que penaliza a precisão média como métrica. Uma resposta correta economiza alguns minutos. Uma resposta errada pode aprovar um reembolso que nunca deveria ter sido concedido, inventar uma política que nunca existiu ou assumir um compromisso que ninguém autorizou. Quando o lado negativo de um único erro supera o lado positivo de cem respostas corretas, otimizar para o caso médio é uma meta totalmente equivocada.
Há também um custo mais sutil. Um líder de suporte que percebe que a IA errou uma vez passa a verificar tudo duas vezes a partir daí, o que anula a maior parte do tempo que deveria ter sido economizado. A confiança não é avaliada por conversa. Ela se constrói ou se desmorona, e, uma vez que se desmorona, as equipes deixam de confiar no sistema, mesmo quando ele está certo na maioria das vezes.
A alucinação não desaparece, ela é gerenciada
Mesmo os modelos de linguagem mais robustos inventam respostas sob as condições certas, e os números reais são mais altos do que a maioria das pessoas imagina. Na síntese fundamentada — essencialmente a mesma tarefa que responder a partir de seus próprios documentos de ajuda —, o ranking de alucinações da Vectara coloca os melhores modelos em torno de 3% e mostra que modelos emblemáticos bem conhecidos se concentram entre 6% e 15%. Alguns modelos com raciocínio complexo ultrapassam 20% nessa mesma tarefa, pois um raciocínio mais profundo lhes dá mais margem para introduzir afirmações que o texto de origem nunca fez. Coloque um modelo diante de perguntas abertas, sem nada para fundamentá-lo, e os números pioram consideravelmente. Pesquisadores de Stanford descobriram que modelos líderes apresentavam alucinações na grande maioria das perguntas jurídicas específicas quando nenhum documento de origem era fornecido.
Nada disso significa que algum modelo específico seja ruim. Significa que nenhum modelo, usado isoladamente, é confiável o suficiente para ser apresentado a clientes pagantes sem que haja algo supervisionando-o.
Inteligência e controle puxam em direções opostas
Há uma razão estrutural pela qual um único modelo não consegue resolver isso sozinho. À medida que um sistema se torna mais hábil em lidar com casos ambíguos ou desconhecidos, também se torna mais difícil de prever totalmente, pois o mesmo raciocínio que lhe permite lidar com um caso para o qual ninguém criou um roteiro é o mesmo que, ocasionalmente, o leva a algum lugar onde não deveria ir. Um modelo mais capaz não é automaticamente mais seguro. Essa relação de compensação é o motivo pelo qual a confiabilidade precisa ser projetada como uma camada em torno do modelo, em vez de ser esperada do próprio modelo.
A Aissist aborda isso com quatro técnicas em camadas, em vez de uma única. A engenharia de prompts define as regras básicas que toda tarefa segue, o que é mais importante em um sistema agênico, onde uma única solicitação de cliente pode se expandir em mais de uma dúzia de subtarefas que precisam respeitar os mesmos limites de segurança. Uma etapa de reforço executa decisões incertas mais de uma vez e mantém a resposta com a qual a maioria dos agentes concorda, ao custo de um processamento extra. Uma etapa de autoinspeção faz com que o sistema revise sua própria saída ou a encaminhe a um segundo modelo em uma função diferente, antes que qualquer coisa chegue ao cliente. E uma camada de governança empilhada fica acima de tudo isso, verificando se uma saída ou ação está de acordo com a política antes de ser enviada, funcionando menos como um filtro e mais como um supervisor de todo o sistema.
É essa combinação que permite à plataforma manter sua taxa de erros de IA abaixo de 1%, um número digno de nota principalmente porque poucos fornecedores nesse setor divulgam esse dado.
Avaliando quando não responder
O comportamento mais valioso de um agente de suporte não é responder corretamente a mais perguntas. É reconhecer quais delas ele não deve tentar responder sozinho. Um sistema que encaminha uma disputa complicada de cobrança logo no início, com todo o contexto anexado, causa muito menos danos do que aquele que segue em frente e tenta adivinhar. Isso também é o que diferencia um agente que descreve uma solução daquele que realmente a aplica, acessando o pedido, fazendo a alteração e confirmando-a com o cliente.
A confiabilidade precisa ser mantida, não apenas construída
Um sistema que é preciso no dia do lançamento não permanecerá assim sem alguém monitorando-o. Os produtos mudam, as políticas são atualizadas e as perguntas que os clientes fazem evoluem junto com elas. A medição contínua capta essa evolução como dados, em vez de como uma onda de reclamações, e um ciclo disciplinado de avaliação, teste e lançamento continua preenchendo as lacunas encontradas, com um ser humano ainda aprovando antes que qualquer mudança seja efetivamente implementada.
O que realmente verificar antes de confiar em um fornecedor
Qualquer fornecedor que afirme que sua IA nunca comete erros deve ser visto com desconfiança, pois isso geralmente significa que ninguém está medindo com precisão suficiente para saber se não é assim. Aqueles que merecem ser levados a sério divulgam uma taxa de erro, explicam exatamente como detectam erros antes que os clientes os percebam e são transparentes sobre quando o sistema repassa a tarefa para uma pessoa, em vez de ficar adivinhando. Esse é um argumento de venda muito diferente de “confie na IA”, e é o que realmente se sustenta quando o volume real de tickets chega.

