Introduktion
De flesta "AI-precisionssiffror" du läser i marknadsföringstexten är tyst meningslösa. De jämför en modell på en ren datamängd, poängsätter datasetet mot sig själv och producerar en siffra som nästan inte har något att göra med hur systemet fungerar en tisdag eftermiddag när en kund ringer från ett bullrigt lager och ställer tre frågor samtidigt.
Vi ville ha ett nummer som betydde något. Så under tre månader mellan januari och mars 2026 transkriberades varje samtal som vår AI-receptionist hanterade i hela produktionsflottan – totalt 8 427 samtal –, graderades av AI:n i realtid och ombedömdes sedan oberoende av en mänsklig granskare som aldrig såg AI-domen.
Vi spårade språk, accent (där det går att identifiera), samtalstyp, tid på dagen, längd och den specifika vägen som konversationen tog.
Poängen var att inte publicera ett smickrande nummer. Poängen var att hitta de samtal där AI:n trodde att det hade lyckats och var fel, och de samtal där AI:n verkligen hade löst kundens problem men vår interna statistik hade markerat det som en miss. Båda klasserna var större än vi förväntade oss.
Hur vi samplade och betygsatte samtalen
Det fanns tre regler. För det första, ingen cherry-picking: varje samtal under perioden var kvalificerat, inklusive de 47 samtalen som kraschade mitt i konversationen och de 312 som överfördes till en människa inom de första 15 sekunderna. För det andra var de mänskliga granskarna blinda för AI:s självbedömning – de betygsatte utskriften mot kundens uttalade avsikt, inte mot vad AI:n påstod att den hade gjort.
För det tredje publicerades rubriken innan någon data tittades på, för att hindra oss från att tyst omdefiniera "framgång" när siffrorna väl kom in.
Varje samtal poängsattes på tre oberoende dimensioner:
- Avsiktsfångst — identifierade AI:n korrekt vad uppringaren faktiskt försökte göra? (Binärt: ja/nej.)
- Uppgifts slutförande — löstes verkligen uppringarens uppgivna behov vid detta samtal, eller krävde det en mänsklig uppföljning som den som ringde inte bad om?
- Konversationshygien — var utskriften fri från hallucinationer, falska löften eller motsägelser? Betygsatt 1–5 av recensenten.
Ett samtal räknades bara som en "vinst" om det klarade alla tre: korrekt avsikt, fullständig uppgift, hygienpoäng på 4 eller 5. Den tredje porten är den som tyst eliminerade samtal som vi annars skulle ha kallat framgångar.
Rubriknumren
Över hela datasetet med 8 427 samtal rensade AI alla tre grindarna på 91.4% av samtal. Den siffran var högre än vi förutspått internt – de flesta av oss hade satsningar i intervallet 85–88 %.
Gapet mellan vår förutsägelse och resultatet var inte en modell som blev bättre än vi förväntade oss; det var att vår intuition formades av de samtal vi mindes, som var oproportionerligt dåliga.
Uppdelat efter samtalstyp var variansen signifikant:
- Tidsbokning — 96,1% (den enklaste vägen, väl inövad avsikt)
- Allmän information — 93,8 % (timmar, plats, tjänster)
- Prisförfrågningar — 89,2 % (vissa prissättningsvägar krävde disambiguation)
- Avbokning / ombokning — 87.6%
- Klagomål och upptrappningar — 78.3%
- Samtal med flera frågor — 71,9 % (två eller flera oberoende avsikter i samma samtal)
Antalet klagomål och flera frågor är de vi fokuserade på. Ett antal på 96 % vid bokning av möten är vad vi skickar för att vinna erbjudanden; ett antal på 72 % på samtal med flera frågor är vad vi skickar för att behålla dem.
Språk och accent: där överraskningarna bodde
Vi arbetar på 32 språk och vi publicerar ett enda noggrannhetsnummer per språk. Det sammanlagda gapet mellan vårt bästa språk (engelska-USA) och vårt sämst stödda språk (vietnamesiska) var 4,1 procentenheter – mindre än vi förväntade oss och mindre än vi har sett rapporterat i publicerade akademiska riktmärken.
Men aggregerade språkpoäng döljer den del av problemet som faktiskt spelar roll: accentvarians inom ett enda språk. Engelska samtal som hanterades i USA fick 92,7 %. Engelska samtal från indiska-engelsktalande kunder fick 91,3 % – väl inom bullret. engelska samtal från starkt regionalt Skotsk-engelsktalande fick 83,4 %. Det är ett 9-punkters gap, och det lever helt och hållet i kolumnen märkt "Engelska".
Poängen är inte att vår modell är dålig på skotsk engelska. Poängen är att publicering av ett nummer per språk, samtidigt som accentavvikelsen lämnas omätad, är ett sätt att dölja samtalen som din AI misslyckas med. Vi rapporterar nu accentavvikelser internt och vi räknar med att publicera det externt inom två kvartal.
De fem fellägen som förklarade 80 % av missarna
När vi grupperade de 723 missade samtalen (8,6 % av datamängden) stod fem fellägen för 81 % av dem. Ingen av dessa kommer att överraska någon som har skickat röst AI tidigare, men de relativa vikterna överraskade oss.
1. Intent-stacking (29 % av missarna)
Den som ringer har två eller flera avsikter och AI:n förbinder sig till den första innan de har angett den andra. "Jag vill boka om min tid och säljer du även X-100-modellen" är precis den typ av indata som sänker konversationstillståndet.
2. Nedgång i implicit sammanhang (22 %)
Den som ringer hänvisar till något som sagts tidigare i konversationen som AI:n inte lagrade som sammanhang - ett namn, ett pris, ett datum. Detta är det felläge som nästa generations sammanhangsfönster mest direkt adresserar.
3. Uppringaren pratade över uppmaningen (15 %)
Endpointing misslyckanden. AI:n börjar tala, den som ringer pratar över den, AI:n hör sin egen röst blandad med den som ringer och producerar en utskrift som saknar hälften av inmatningen.
4. Nummeråterläsningsfel (9 %)
Den som ringer dikterar ett telefonnummer eller adress. AI läser tillbaka det. Den som ringer rättar en siffra. AI uppdaterar fel siffra. Det här är ett 100 %-löst problem med en bekräftelseprompt med strukturerad data, och vi skickade en i februari.
5. Falsk handoff (6 %)
AI:n identifierar korrekt att den inte kan lösa samtalet och överför – men överföringsdirigeringen skickar det till fel kö. Detta är egentligen inte ett AI-fel; det är ett uppringningsfel som AI:n avslöjar.
Vad vi skickade på grund av denna studie
Tre skickade förändringar kom direkt ur studien, och en fjärde är under utveckling. Vi försökte skicka den högsta hävstångsfixeringen per felläge snarare än den mest akademiskt intressanta.
- Multi-intent detektor. En liten klassificerare som körs parallellt med avsiktsfångst och flaggar yttranden som innehåller två eller flera oberoende avsikter. När den flaggas pausas konversationen och AI:n räknar uttryckligen upp: "Jag hörde att du vill boka om och du frågade också om X-100. Låt oss göra omschemat först - är det okej?" Klassificeraren lade till 11 ms fördröjning och minskade missar med avsiktsstackning med 64 %.
- Strukturerad nummerbekräftelse. Alla telefonnummer, adresser eller belopp bekräftas nu siffra för siffra vid återläsning, med en ensiffrig redigeringshanterare. Antalet återläsningsmissar har minskat med 88 %.
- Endpointing omkalibrering. Vi justerade om tröskeln för tystnad per språk och la till ett "klarade du den tanken?" återhämtning vid misstänkt trunkering. Talk-over misslyckanden minskade från 15% till 9% av missuppsättningen.
Den fjärde ändringen – en rikare kontextbuffert per samtal som adresserar fall av implicit kontext – är den mest komplexa av de fyra, och den testas i skuggläge mot ett uthållet samtal innan det går live.
En anteckning om mänsklig väghyveldrift
Ett litet fynd som är värt att nämna: de mänskliga granskarna, trots en publicerad rubrik, drev över de tre månaderna. Under månad ett markerade granskare 87 % av samtalen som framgångsrika. Under månad tre markerade samma granskare, som poängterade slumpmässigt uttagna månad-ett-samtal en andra gång, 91 % som framgångsrika. Avskrifterna hade inte ändrats.
Driften var inte ond tro; det var förtrogenhet. När recensenterna vände sig vid AI:s fraser blev de mer generösa på konversationshygiendimensionen. Vi fångade detta genom att göra om ett urval på 5 % av månad ett-samtal under månad tre, och vi korrigerade rubriknumret för det. De 91,4 % som rapporterats ovan är den avdriftskorrigerade siffran. Råtalet var 92,1%.
Om en leverantör publicerar ett noggrannhetsnummer utan att beskriva hur de kontrollerade för mänsklig graderardrift, är numret misstänkt som standard. Vi uppfann inte detta problem; vi uppmärksammade det bara.
Vad vi mäter härnäst
Tre saker, i prioriterad ordning. För det första, accentupplöst noggrannhet inom varje större språk som stöds – och ett offentligt åtagande att publicera det när metoden har stabiliserats. För det andra, noggrannhet efter samtalet: fick den som ringde faktiskt det de kom efter, mätt 7 och 30 dagar efter samtalet genom att stämma av med kundens nedströmssystem.
För det tredje, kostnaden per upplöst-samtal som kombinerar noggrannhet med ekonomin per minut – eftersom en 98 % exakt AI som kostar $1,40/min förlorar till en 92% exakt AI som kostar $0,18/min, för nästan alla verkliga företag.
Vi kommer att publicera nästa uppsättning siffror under Q3. Om de visar regression kommer vi att publicera det också. Poängen med att mäta det här är inte att hitta ett smickrande diagram; det är att hitta de samtal vi fortfarande får fel.