Рішення для контакт-центру: функції, переваги та способи вибору
Що таке контакт-центр, чим він відрізняється від кол-центру, основні функції, переваги хмари, як вибрати платформу та KPI, які вимірюють ефективність.
Протягом трьох місяців ми відстежували кожен дзвінок, який обробив штучний інтелект, — за мовою, акцентом, типом — і порівнювали стенограму з рецензентом. Точність цифр була кращою, ніж ми очікували. Режими відмови були цікавішими.
Більшість цифр про «точність штучного інтелекту», які ви читаєте в маркетингових текстах, абсолютно безглузді. Вони порівнюють модель на чистому наборі даних, порівнюють набір даних із самим собою та видають число, яке майже не має нічого спільного з тим, як працює система у вівторок вдень, коли клієнт дзвонить із галасливого складу й ставить три запитання одночасно.
Ми хотіли отримати число, яке щось означало. Таким чином, протягом трьох місяців із січня по березень 2026 року кожен дзвінок, який обробляв наш секретар ШІ, — загалом 8427 дзвінків — був транскрибований, оцінений штучним інтелектом у режимі реального часу, а потім незалежно переоцінений рецензентом, який ніколи не бачив висновку ШІ.
Ми відстежували мову, акцент (якщо можна було визначити), тип дзвінка, час доби, тривалість і конкретний шлях розмови.
Суть була не в тому, щоб опублікувати втішну цифру. Суть полягала в тому, щоб знайти дзвінки, у яких штучний інтелект вважав успішним і помилявся, і виклики, у яких штучний інтелект справді вирішував проблему клієнта, але наші внутрішні показники позначали це як помилку. Обидва класи були більшими, ніж ми очікували.
Було три правила. По-перше, жодного вибору: кожен дзвінок протягом періоду був придатним, включаючи 47 дзвінків, які вийшли з ладу під час розмови, і 312, які були передані людині протягом перших 15 секунд. По-друге, рецензенти були сліпі до самооцінки штучного інтелекту — вони оцінювали стенограму відповідно до заявлених намірів замовника, а не проти того, що ШІ стверджував, що він зробив.
По-третє, рубрику було опубліковано до того, як були переглянуті будь-які дані, щоб ми не могли тихо перевизначити «успіх» після отримання цифр.
Кожен дзвінок оцінювався за трьома незалежними параметрами:
Дзвінок зараховувався як «перемога», лише якщо він очищав усі три: правильний намір, виконане завдання, оцінка гігієни 4 або 5. Треті ворота — це ті, які тихо усунули дзвінки, які ми інакше назвали б успішними.
У повному наборі даних із 8427 викликів штучний інтелект увімкнув усі три ворота 91.4% дзвінків. Ця цифра була вищою, ніж ми прогнозували внутрішньо — більшість із нас робили ставки в діапазоні 85–88%.
Розрив між нашим прогнозом і результатом не означає, що модель стає кращою, ніж ми очікували; це було те, що наша інтуїція була сформована дзвінками, які ми пам’ятали, і які були непропорційно поганими.
У розбивці за типом виклику відмінність була значною:
Ми зосередилися на номерах скарг і кількох проблем. Ми надсилаємо 96% записів на зустріч, щоб виграти угоди; кількість 72% на багатопроблемні дзвінки – це те, що ми відправляємо, щоб зберегти їх.
Ми працюємо 32 мовами та публікуємо єдиний номер точності для кожної мови. Загальна різниця між нашою найкращою мовою (англійська-США) і нашою найгіршою підтримуваною мовою (в’єтнамська) становила 4,1 відсотка — менше, ніж ми очікували, і менше, ніж ми бачили в опублікованих академічних тестах.
Але сукупні мовні бали приховують ту частину проблеми, яка насправді має значення: розбіжність акценту в одній мові. Дзвінки англійською мовою в Сполучених Штатах набрали 92,7%. Дзвінки англійською мовою від індійсько-англомовних клієнтів набрали 91,3% — у межах шуму. Дзвінки англійською з сильно регіональні Шотландсько-англомовні набрали 83,4%. Це розрив у 9 балів, і він повністю знаходиться в колонці з позначкою «Англійська».
Справа не в тому, що наша модель погано володіє шотландською англійською. Справа в тому, що оприлюднення номерів для кожної мови, залишаючи дисперсію акцентів невиміряною, є способом приховати дзвінки, з якими ваш штучний інтелект не справляється. Зараз ми звітуємо про дисперсію акценту всередині компанії та плануємо опублікувати її протягом двох кварталів.
Коли ми кластеризували 723 пропущені дзвінки (8,6% набору даних), п’ять режимів збою викликали 81% з них. Жодне з цього не здивує тих, хто раніше постачав голосовий ШІ, але відносна вага нас здивувала.
Абонент має два або більше намірів, і штучний інтелект виконує перше, перш ніж він завершить формулювання другого. «Я хочу перенести свою зустріч, а також чи продаєте ви модель X-100» — це саме те введення, яке підриває стан розмови.
Абонент посилається на щось, сказане раніше в розмові, що ШІ не зберіг як контекст — ім’я, ціна, дата. Це режим помилки, на який найбільше звертається контекстне вікно наступного покоління.
Помилки кінцевих точок. ШІ починає говорити, абонент говорить через нього, ШІ чує свій власний голос, змішаний із голосом абонента, і створює розшифровку, у якій не вистачає половини введеного.
Абонент диктує номер телефону або адресу. AI читає це назад. Абонент виправляє одну цифру. ШІ оновлює неправильну цифру. Цю проблему можна на 100% вирішити завдяки запиту підтвердження структурованих даних, і ми надіслали її в лютому.
Штучний інтелект правильно визначає, що він не може розв’язати виклик, і здійснює переадресацію, але маршрутизація передачі надсилає його до неправильної черги. Це насправді не збій ШІ; ШІ виявляє збій телефонного плану.
Три надіслані зміни виникли безпосередньо в результаті дослідження, а четверта знаходиться в розробці. Ми намагалися запропонувати виправлення найвищого кредитного плеча для кожного режиму збою, а не найцікавіше з академічної точки зору.
Четверта зміна — розширеніший контекстний буфер для кожного виклику, який усуває неявне відкидання контексту — є найскладнішою з чотирьох, і її перевіряють у тіньовому режимі на наборі викликів, що утримуються, перш ніж запрацювати.
Один невеликий висновок, який варто назвати: рецензенти, незважаючи на опубліковану рубрику, переміщалися протягом трьох місяців. За перший місяць рецензенти відзначили 87% дзвінків як успішні. За третій місяць ті самі рецензенти, вдруге оцінивши випадково взяті дзвінки першого місяця, відзначили 91% як успішні. Стенограми не змінилися.
Дрейф не був недобросовісним; це було знайомство. Коли рецензенти звикли до формулювання ШІ, вони стали більш щедрими у вимірі розмови та гігієни. Ми виявили це, переоцінивши 5% вибірку дзвінків першого місяця за третій місяць, і виправили для цього номер заголовка. 91,4%, про які повідомляється вище, є цифрою, виправленою на дрейф. Сире число становило 92,1%.
Якщо постачальник публікує номер точності, не описуючи, як він контролює дрейф грейдера, за замовчуванням це число є підозрілим. Не ми придумали цю проблему; ми просто звернули на це увагу.
Три речі в пріоритетному порядку. По-перше, точність визначення акценту в кожній основній підтримуваній мові — і публічне зобов’язання опублікувати його, коли методологія стабілізується. По-друге, точність результату після дзвінка: чи справді абонент отримав те, за чим прийшов, виміряно через 7 і 30 днів після дзвінка шляхом узгодження з системою клієнта, розташованою нижче.
По-третє, ціна за розв’язаний номер виклику, яка поєднує точність із економічністю за хвилину — тому що 98% точний штучний інтелект, який коштує 1,40 дол. США за хвилину, програє 92% точному штучному інтелекту, який коштує 0,18 дол. США за хвилину, майже для будь-якого реального бізнесу.
Ми опублікуємо наступний набір цифр у третьому кварталі. Якщо вони покажуть регресію, ми це теж опублікуємо. Сенс вимірювання цього матеріалу полягає не в тому, щоб знайти приємну діаграму; це знайти виклики, які ми все ще отримуємо неправильно.
ШІ-ресепшн, оптові маршрути, віртуальні номери — створені на одній платформі з прозорим ціноутворенням і цілодобовим NOC.