Inledning
De flesta företag som testar AI för kundsupport stöter på samma hinder. Systemet fungerar bra i flera veckor. Sedan ger det en kund ett självsäkert men helt felaktigt svar. Kanske om en återbetalningsfrist. Kanske om en policy som ändrades förra kvartalet. Någon i ledningen uppmärksammar detta och den utrullning som var tänkt att täcka större delen av köen stannar tyst upp vid en bråkdel av den.
Branschdata bekräftar hur vanligt detta mönster är. Rapporten ”2025 World Quality Report” från OpenText, Capgemini och Sogeti visade att oro kring tillförlitlighet och felaktiga svar var det största hindret för AI-införande hos 60 % av de tillfrågade organisationerna. En separat undersökning från Gong visade att 58 % av företagen hade lagt AI-projekt på is och att nästan hälften av de planerade AI-investeringarna hindrades av förtroendeproblem snarare än budget. Verktygen är kapabla. Det är förtroendet för dem som släpar efter.
Matematiken bakom ett felaktigt svar
Supportarbetet är asymmetriskt på ett sätt som straffar genomsnittlig träffsäkerhet som mätvärde. Ett korrekt svar sparar några minuter. Ett felaktigt svar kan godkänna en återbetalning som aldrig borde ha skett, uppfinna en policy som aldrig funnits eller göra ett åtagande som ingen har godkänt. När nackdelen med ett enda misstag uppväger fördelen med hundra korrekta svar är det helt fel mål att optimera för det genomsnittliga fallet.
Det finns också en mer dold kostnad. En supportledare som upptäcker att AI:n har fel en gång börjar därefter dubbelkontrollera allt, vilket raderar större delen av den tid som systemet egentligen skulle ha sparat. Förtroende mäts inte per konversation. Det byggs upp eller rasar samman, och när det väl rasar samman slutar teamen att lita på systemet även när det har rätt för det mesta.
Hallucinationer försvinner inte, de hanteras
Även de starkaste språkmodellerna hittar på under rätt förhållanden, och de faktiska siffrorna är högre än vad de flesta antar. När det gäller grundad sammanfattning – i princip samma uppgift som att svara utifrån egna hjälpdokument – placerar Vectaras hallucination-ranking de bästa modellerna runt 3 % och visar att välkända flaggskeppsmodeller klustrar mellan 6 % och 15 %. Vissa modeller som kräver mycket resonemang klättrar över 20 % på samma uppgift, eftersom djupare resonemang ger dem större utrymme att införa påståenden som källtexten aldrig har gjort. Ställ en modell inför öppna frågor utan något att grunda sig på, så blir siffrorna betydligt sämre. Forskare vid Stanford fann att ledande modeller hallucinerade på en stor majoritet av specifika juridiska frågor när inget källdokument tillhandahölls.
Inget av detta innebär att någon enskild modell är dålig. Det innebär att ingen enskild modell, när den används på egen hand, är tillräckligt tillförlitlig för att användas inför betalande kunder utan att någon övervakar den.
Intelligens och kontroll drar åt motsatta håll
Det finns en strukturell anledning till att en enskild modell inte kan lösa detta på egen hand. Ju bättre ett system blir på att hantera tvetydiga eller okända fall, desto svårare blir det också att förutsäga dess beteende fullt ut, eftersom samma resonemang som gör att det kan hantera ett fall som ingen har skrivit in i manuset är detsamma som ibland leder det någonstans där det inte borde hamna. En mer kapabel modell är inte automatiskt en säkrare modell. Denna avvägning är anledningen till att tillförlitlighet måste byggas in som ett lager runt modellen snarare än att förväntas av modellen i sig.
Aissist hanterar detta med fyra lager av tekniker istället för en. Prompt engineering fastställer de grundläggande regler som varje uppgift följer, vilket är särskilt viktigt i ett agentbaserat system där en enskild kundförfrågan kan utvidgas till mer än ett dussin deluppgifter som alla måste följa samma riktlinjer. Ett ”booster”-steg kör osäkra beslut mer än en gång och behåller det svar som flest agenter är överens om, på bekostnad av extra beräkningskraft. En självgranskning innebär att systemet granskar sin egen utdata, eller överlämnar den till en andra modell i en annan roll, innan något når kunden. Och ett övergripande styrningslager ligger ovanför allt detta och kontrollerar om en utdata eller åtgärd överensstämmer med policyn innan den skickas ut, vilket fungerar mindre som ett filter och mer som en övervakare för hela systemet.
Det är tack vare den kombinationen som plattformen håller sin AI-felfrekvens under 1 %, en siffra som är värd att notera främst eftersom så få leverantörer inom detta område överhuvudtaget offentliggör någon.
Att avgöra när man inte ska svara
Det mest värdefulla beteendet hos en supportagent är inte att svara rätt på fler frågor. Det är att känna igen vilka frågor den inte bör försöka besvara på egen hand. Ett system som tidigt eskalerar en knepig faktureringskonflikt, med fullständig kontext bifogad, orsakar betydligt mindre skada än ett system som kör på och gissar. Det är också detta som skiljer en agent som beskriver en lösning från en som faktiskt tillämpar den – genom att hämta fram ordern, göra ändringen och bekräfta den tillbaka till kunden.
Tillförlitligheten måste upprätthållas, inte bara byggas upp
Ett system som är korrekt på lanseringsdagen kommer inte att förbli så utan att någon övervakar det. Produkter förändras, policyer uppdateras och de frågor kunderna ställer förändras i takt med dem. Kontinuerlig mätning fångar upp dessa förändringar som data istället för som en våg av klagomål, och en disciplinerad cykel av utvärdering, testning och lansering fortsätter att täppa till de luckor som upptäcks, där en människa fortfarande godkänner innan något ändras i verkligheten.
Vad man faktiskt bör kontrollera innan man litar på en leverantör
Varje leverantör som hävdar att deras AI aldrig gör fel bör bemötas med misstänksamhet, eftersom det oftast innebär att ingen mäter noggrant nog för att veta bättre. De som är värda att ta på allvar offentliggör en felfrekvens, förklarar exakt hur de upptäcker misstag innan kunderna ser dem och är öppna med när systemet överlämnar till en person istället för att gissa. Det är ett helt annat budskap än ”lita på AI:n”, och det är det som faktiskt håller när den verkliga volymen av ärenden slår till.

