Rozwiązania dla centrów kontaktowych: funkcje, zalety i sposób wyboru
Czym jest contact center, czym różni się od call center, podstawowe funkcje, zalety chmury, wybór platformy i wskaźniki KPI mierzące wydajność.
Przez trzy miesiące śledziliśmy każdą rozmowę obsługiwaną przez sztuczną inteligencję – według języka, akcentu, rodzaju rozmowy – i ocenialiśmy transkrypcję w stosunku do weryfikatora. Wartości dokładności były lepsze, niż się spodziewaliśmy. Tryby awarii były bardziej interesujące.
Większość liczb dotyczących „dokładności sztucznej inteligencji”, które czytasz w materiałach marketingowych, jest po cichu bez znaczenia. Porównują model na czystym zbiorze danych, porównują zbiór danych z samym sobą i uzyskują liczbę, która nie ma prawie nic wspólnego z działaniem systemu we wtorkowe popołudnie, kiedy klient dzwoni z hałaśliwego magazynu i zadaje trzy pytania na raz.
Chcieliśmy numeru, który coś znaczy. Tak więc przez trzy miesiące, od stycznia do marca 2026 r., każde połączenie, które nasza recepcjonistka AI obsługiwała w całej flocie produkcyjnej – łącznie 8427 połączeń – było transkrybowane, oceniane przez sztuczną inteligencję w czasie rzeczywistym, a następnie niezależnie ponownie oceniane przez weryfikatora, który nigdy nie widział werdyktu AI.
Śledziliśmy język, akcent (jeśli można go zidentyfikować), rodzaj połączenia, porę dnia, długość i konkretną ścieżkę, jaką obrała rozmowa.
Nie chodziło o opublikowanie pochlebnej liczby. Chodziło o znalezienie rozmów, w przypadku których sztuczna inteligencja myślała, że się udało, ale się myliła, oraz rozmów, w których sztuczna inteligencja rzeczywiście rozwiązała problem klienta, ale nasze wewnętrzne wskaźniki oznaczyły to jako nieudane. Obie klasy były większe, niż się spodziewaliśmy.
Były trzy zasady. Po pierwsze, żadnego selekcjonowania: kwalifikowało się każde połączenie w tym okresie, w tym 47 połączeń, które uległy awarii w połowie rozmowy i 312, które zostały przekazane człowiekowi w ciągu pierwszych 15 sekund. Po drugie, weryfikatorzy byli ślepi na samoocenę sztucznej inteligencji — ocenili transkrypcję zgodnie z intencjami klienta, a nie z tym, co twierdziła sztuczna inteligencja.
Po trzecie, rubrykę opublikowano przed sprawdzeniem jakichkolwiek danych, abyśmy nie po cichu przedefiniowali „sukcesu”, gdy tylko pojawią się liczby.
Każde połączenie oceniane było w trzech niezależnych wymiarach:
Zapowiedź była liczona jako „wygrana” tylko wtedy, gdy spełniała wszystkie trzy kryteria: poprawny zamiar, wykonanie zadania, wynik higieny na poziomie 4 lub 5. Trzecia bramka to ta, która po cichu wyeliminowała wezwania, które w przeciwnym razie nazwalibyśmy sukcesem.
W całym zestawie danych obejmującym 8427 połączeń sztuczna inteligencja wyczyściła wszystkie trzy bramki 91.4% połączeń. Liczba ta była wyższa, niż przewidywaliśmy wewnętrznie – większość z nas obstawiała w przedziale 85–88%.
Różnica między naszymi przewidywaniami a wynikiem nie oznaczała, że model stał się lepszy, niż się spodziewaliśmy; chodziło o to, że naszą intuicję kształtowały zapamiętywane wezwania, które były nieproporcjonalnie złe.
W podziale na rodzaj połączenia różnica była znacząca:
Skupiliśmy się na numerach skarg i wielu problemów. 96% liczby rezerwacji spotkań to to, co wysyłamy, aby wygrać oferty; Aby je zatrzymać, wysyłamy numer 72% w przypadku połączeń obejmujących wiele problemów.
Działamy w 32 językach i publikujemy jeden numer dokładności dla każdego języka. Łączna różnica między naszym najlepszym językiem (angielski-amerykański) a językiem najgorzej obsługiwanym (wietnamski) wyniosła 4,1 punktu procentowego – mniej niż oczekiwaliśmy i węższy niż wynikało z opublikowanych wskaźników akademickich.
Jednak zbiorcze wyniki językowe ukrywają część problemu, która faktycznie ma znaczenie: różnice w akcentach w obrębie jednego języka. Połączenia w języku angielskim obsługiwane w Stanach Zjednoczonych uzyskały 92,7%. Połączenia anglojęzyczne od klientów indyjsko-angielskojęzycznych uzyskały wynik 91,3%, co mieściło się w granicach hałasu. Telefony po angielsku z mocno regionalny Osoby posługujące się językiem szkocko-angielskim uzyskały 83,4%. Jest to 9-punktowa różnica, która w całości mieści się w kolumnie zatytułowanej „Angielski”.
Nie chodzi o to, że nasz model jest kiepski w szkockim angielskim. Chodzi o to, że opublikowanie numeru dla każdego języka, pozostawiając niezmierzoną różnicę akcentów, jest sposobem na ukrycie połączeń, z którymi nie radzi sobie sztuczna inteligencja. Obecnie zgłaszamy różnice w akcentach wewnętrznie i spodziewamy się opublikować je zewnętrznie w ciągu dwóch kwartałów.
Kiedy połączyliśmy 723 nieodebrane połączenia (8,6% zbioru danych), pięć trybów awarii stanowiło 81% z nich. Żadne z nich nie zaskoczy nikogo, kto już wcześniej dostarczał głosową sztuczną inteligencję, ale względne wagi nas zaskoczyły.
Osoba wywołująca ma co najmniej dwie intencje, a sztuczna inteligencja realizuje pierwszą, zanim zakończy określanie drugiej. „Chcę przełożyć wizytę, a także czy sprzedajesz model X-100” – to dokładnie ten rodzaj informacji, który burzy stan rozmowy.
Rozmówca odwołuje się do czegoś, co zostało powiedziane wcześniej w rozmowie, a czego sztuczna inteligencja nie zachowała jako kontekstu – do nazwy, ceny, daty. Jest to tryb awarii, na który najbardziej bezpośrednio wpływa okno kontekstowe nowej generacji.
Błędy punktów końcowych. Sztuczna inteligencja zaczyna mówić, rozmówca przez to mówi, sztuczna inteligencja słyszy swój własny głos zmieszany z głosem dzwoniącego i tworzy transkrypcję, w której brakuje połowy danych wejściowych.
Osoba dzwoniąca dyktuje numer telefonu lub adres. AI odczytuje to z powrotem. Osoba dzwoniąca poprawia jedną cyfrę. AI aktualizuje niewłaściwą cyfrę. Jest to problem, który można w 100% naprawić za pomocą monitu o potwierdzenie danych strukturalnych. Wysłaliśmy go w lutym.
Sztuczna inteligencja poprawnie identyfikuje, że nie może obsłużyć połączenia i transferu, ale routing transferu wysyła go do niewłaściwej kolejki. To naprawdę nie jest awaria sztucznej inteligencji; jest to awaria planu wybierania numeru, którą ujawnia sztuczna inteligencja.
Trzy dostarczone zmiany powstały bezpośrednio w wyniku badania, a czwarta jest w fazie opracowywania. Staraliśmy się dostarczać poprawki o największym wpływie na każdy tryb awarii, a nie najbardziej interesujące z naukowego punktu widzenia.
Czwarta zmiana — bogatszy bufor kontekstu dla każdego połączenia, który rozwiązuje problem utraty kontekstu niejawnego — jest najbardziej złożoną z czterech i jest testowana w trybie cienia w stosunku do zestawu wstrzymanych połączeń, zanim zostanie uruchomiona.
Jedno małe odkrycie, które warto wymienić: recenzenci, pomimo opublikowanej rubryki, poruszali się przez trzy miesiące. W pierwszym miesiącu recenzenci uznali 87% połączeń za udane. W trzecim miesiącu ci sami recenzenci, oceniając losowo wylosowane rozmowy telefoniczne z pierwszego miesiąca po raz drugi, uznali 91% za udane. Transkrypcje nie uległy zmianie.
Ten dryf nie był wynikiem złej wiary; to była znajomość. Gdy recenzenci przyzwyczaili się do sformułowań sztucznej inteligencji, stali się bardziej hojni w kwestii higieny rozmowy. Złapaliśmy ten problem, ponownie oceniając 5% próbę połączeń z pierwszego miesiąca w trzecim miesiącu i poprawiliśmy pod kątem tego numer nagłówka. Podane powyżej 91,4% to liczba skorygowana o dryf. Wartość surowa wyniosła 92,1%.
Jeśli sprzedawca publikuje liczbę dokładności bez opisu sposobu kontrolowania odchylenia sortownika przez człowieka, liczba ta jest domyślnie podejrzana. Nie wymyśliliśmy tego problemu; po prostu zwróciliśmy na to uwagę.
Trzy rzeczy, w kolejności priorytetów. Po pierwsze, dokładność rozpoznawania akcentów w każdym głównym obsługiwanym języku oraz publiczne zobowiązanie do opublikowania go po ustabilizowaniu się metodologii. Po drugie, dokładność wyników po rozmowie telefonicznej: czy osoba dzwoniąca rzeczywiście otrzymała to, po co przyszła, mierzona 7 i 30 dni po rozmowie na podstawie uzgodnienia z dalszym systemem klienta.
Po trzecie, koszt rozwiązanego numeru połączenia, który łączy dokładność z ekonomiką minutową — ponieważ sztuczna inteligencja o dokładności w 98%, która kosztuje 1,40 USD/min, przegrywa z sztuczną inteligencją o dokładności 92%, która kosztuje 0,18 USD/min w przypadku niemal każdej prawdziwej firmy.
Kolejny zestaw liczb opublikujemy w III kwartale. Jeśli wykażą regresję, to również opublikujemy. Celem pomiaru tych rzeczy nie jest znalezienie pochlebnego wykresu; jest znalezienie połączeń, które wciąż źle odbieramy.
Recepcjoniści AI, trasy hurtowe, numery wirtualne – zbudowane na jednej platformie z przejrzystymi cenami i całodobowym NOC.