вступ
Більшість цифр про «точність штучного інтелекту», які ви читаєте в маркетингових текстах, абсолютно безглузді. Вони порівнюють модель на чистому наборі даних, порівнюють набір даних із самим собою та виробляють число, яке майже не має нічого спільного з тим, як працює система у вівторок вдень, коли клієнт телефонує з галасливого складу та ставить три запитання одночасно.
Ми хотіли отримати число, яке щось означало. Таким чином, протягом трьох місяців із січня по березень 2026 року кожен дзвінок, який обробляв наш секретар із штучного інтелекту, — загалом 8427 дзвінків — транскрибувався, оцінювався штучним інтелектом у режимі реального часу, а потім незалежно повторно оцінювався рецензентом, який ніколи не бачив вердикту штучного інтелекту.
Ми відстежували мову, акцент (якщо можна було визначити), тип дзвінка, час доби, тривалість і конкретний шлях розмови.
Суть була не в тому, щоб опублікувати втішну цифру. Суть полягала в тому, щоб знайти дзвінки, у яких штучний інтелект вважав успішним і помилявся, і дзвінки, у яких штучний інтелект справді вирішував проблему клієнта, але наші внутрішні показники позначали це як помилку. Обидва класи були більшими, ніж ми очікували.
Як ми відбирали та оцінювали дзвінки
Було три правила. По-перше, жодного вибору: усі дзвінки за цей період були придатними, включаючи 47 дзвінків, які завершилися збоєм під час розмови, і 312, які були передані людині протягом перших 15 секунд. По-друге, рецензенти були сліпі до самооцінки штучного інтелекту — вони оцінювали стенограму відповідно до заявлених намірів клієнта, а не проти того, що ШІ стверджував, що він зробив.
По-третє, рубрику було опубліковано до того, як були переглянуті будь-які дані, щоб ми не могли тихо перевизначити «успіх» після отримання цифр.
Кожен дзвінок оцінювався за трьома незалежними параметрами:
- Захоплення намірів — чи правильно ШІ визначив, що насправді намагався зробити абонент? (Двійковий: так/ні.)
- Виконання завдання — чи була заявлена потреба абонента фактично вирішена під час цього дзвінка, чи це потребувало подальшої взаємодії людини, про яку абонент не просив?
- Гігієна розмови — Чи була стенограма вільна від галюцинацій, брехливих обіцянок чи протиріч? Оцінка 1–5 рецензентом.
Дзвінок зараховувався як «перемога», лише якщо він очищав усі три: правильний намір, виконане завдання, оцінка гігієни 4 або 5. Треті ворота — це ті, які тихо усунули виклики, які ми інакше назвали б успішними.
Заголовні цифри
У повному наборі даних із 8427 викликів штучний інтелект увімкнув усі три ворота 91.4% дзвінків. Ця цифра була вищою, ніж ми прогнозували внутрішньо — більшість із нас робили ставки в діапазоні 85–88%.
Розрив між нашим прогнозом і результатом не означає, що модель стає кращою, ніж ми очікували; це було те, що наша інтуїція була сформована дзвінками, які ми пам’ятали, і які були непропорційно поганими.
У розбивці за типом виклику відмінність була значною:
- Запис на прийом — 96,1% (найпростіший шлях, добре відпрацьований намір)
- Загальні відомості — 93,8% (години роботи, місце розташування, послуги)
- Ціноутворення — 89,2% (деякі шляхи ціноутворення вимагали усунення неоднозначностей)
- Скасування / перенесення — 87.6%
- Скарги та ескалації — 78.3%
- Дзвінки з кількома проблемами — 71,9% (два або більше незалежних намірів в одному виклику)
Ми зосередилися на номерах скарг і кількох проблем. Ми надсилаємо 96% записів на зустріч, щоб виграти угоди; кількість 72% на багатопроблемні дзвінки – це те, що ми відправляємо, щоб зберегти їх.
Мова та акцент: де жили сюрпризи
Ми працюємо 32 мовами та публікуємо єдиний номер точності для кожної мови. Загальна різниця між нашою найкращою мовою (англійська-США) і нашою найгіршою підтримуваною мовою (в’єтнамська) становила 4,1 відсотка — менше, ніж ми очікували, і менше, ніж ми бачили в опублікованих академічних тестах.
Але сукупні мовні бали приховують ту частину проблеми, яка насправді має значення: розбіжність акценту в одній мові. Дзвінки англійською мовою в Сполучених Штатах набрали 92,7%. Дзвінки англійською мовою від індійсько-англомовних клієнтів набрали 91,3% — у межах шуму. Дзвінки англійською з сильно регіональні Шотландсько-англомовні набрали 83,4%. Це розрив у 9 балів, і він повністю знаходиться в колонці з позначкою «Англійська».
Справа не в тому, що наша модель погано володіє шотландською англійською. Справа в тому, що оприлюднення номерів для кожної мови, залишаючи дисперсію акцентів невиміряною, є способом приховати виклики, з якими ваш штучний інтелект не справляється. Зараз ми звітуємо про дисперсію акценту всередині компанії та плануємо опублікувати її протягом двох кварталів.
П'ять режимів відмов, які пояснюють 80% промахів
Коли ми кластеризували 723 пропущені дзвінки (8,6% набору даних), п’ять режимів збою викликали 81% з них. Жодне з цього не здивує тих, хто раніше постачав голосовий ШІ, але відносна вага нас здивувала.
1. Стекування намірів (29% промахів)
Абонент має два або більше намірів, і штучний інтелект виконує перше, перш ніж він завершить формулювання другого. «Я хочу перенести свою зустріч, а також чи продаєте ви модель X-100» — це саме те введення, яке підриває стан розмови.
2. Випадання неявного контексту (22%)
Абонент посилається на щось, сказане раніше в розмові, що ШІ не зберіг як контекст — ім’я, ціна, дата. Це режим помилки, на який найбільше звертається контекстне вікно наступного покоління.
3. Абонент говорив через підказку (15%)
Помилки кінцевих точок. ШІ починає говорити, абонент говорить через нього, ШІ чує свій власний голос, змішаний із голосом абонента, і створює розшифровку, у якій не вистачає половини введеного.
4. Помилки повторного читання номерів (9%)
Абонент диктує номер телефону або адресу. AI читає це назад. Абонент виправляє одну цифру. ШІ оновлює неправильну цифру. Цю проблему можна на 100% вирішити завдяки запиту підтвердження структурованих даних, і ми надіслали її в лютому.
5. Помилкова передача (6%)
Штучний інтелект правильно визначає, що він не може розв’язати виклик, і здійснює переадресацію, але маршрутизація передачі надсилає його до неправильної черги. Це насправді не збій ШІ; ШІ виявляє збій телефонного плану.
Що ми відправили завдяки цьому дослідженню
Три надіслані зміни виникли безпосередньо в результаті дослідження, а четверта знаходиться в розробці. Ми намагалися запропонувати виправлення найвищого рівня для кожного режиму збою, а не найцікавіше з академічної точки зору.
- Багатоплановий детектор. Невеликий класифікатор, який працює паралельно із захопленням намірів і позначає висловлювання, які містять два або більше незалежних намірів. Коли позначено прапорцем, розмова призупиняється, а штучний інтелект чітко перераховує: «Я чув, що ви хочете перенести розклад, і ви також запитали про X-100. Давайте спочатку перенесемо розклад — це нормально?» Класифікатор додав 11 мс затримки та зменшив промахи стекування намірів на 64%.
- Підтвердження структурованого номера. Будь-який номер телефону, адреса чи сума тепер підтверджується цифра за цифрою під час повторного читання за допомогою обробника редагування однієї цифри. Промахи зворотного зчитування номерів зменшилися на 88%.
- Повторне калібрування кінцевої точки. Ми перенастроїли поріг мовчання для кожної мови та додали «ти закінчив цю думку?» відновлення при підозрі на усічення. Невдачі при розмові впали з 15% до 9% від набору промахів.
Четверта зміна — розширеніший контекстний буфер для кожного виклику, який усуває неявне відкидання контексту — є найскладнішою з чотирьох, і її перевіряють у тіньовому режимі на наборі викликів, що утримуються, перш ніж запрацювати.
Примітка про дрейф грейдера
Один невеликий висновок, який варто назвати: рецензенти, незважаючи на опубліковану рубрику, переміщалися протягом трьох місяців. За перший місяць рецензенти відзначили 87% дзвінків як успішні. За третій місяць ті самі рецензенти, вдруге оцінюючи випадково вибрані дзвінки першого місяця, відзначили 91% як успішні. Стенограми не змінилися.
Дрейф не був недобросовісним; це було знайомство. Коли рецензенти звикли до формулювання штучного інтелекту, вони стали більш щедрими у вимірі розмови та гігієни. Ми виявили це, переоцінивши 5% вибірку дзвінків першого місяця за третій місяць, і виправили для цього номер заголовка. 91,4%, про які повідомляється вище, є цифрою, виправленою на дрейф. Сире число становило 92,1%.
Якщо постачальник публікує номер точності, не описуючи, як він контролює дрейф грейдера, за замовчуванням це число є підозрілим. Не ми придумали цю проблему; ми просто звернули на це увагу.
Що ми вимірюємо далі
Три речі в пріоритетному порядку. По-перше, точність визначення акценту в кожній основній підтримуваній мові — і публічне зобов’язання опублікувати його, коли методологія стабілізується. По-друге, точність результату після дзвінка: чи справді абонент отримав те, за чим прийшов, виміряно через 7 і 30 днів після дзвінка шляхом узгодження з системою клієнта, розташованою нижче.
По-третє, ціна за розв’язаний номер виклику, яка поєднує точність із економічністю за хвилину — тому що 98% точний штучний інтелект, який коштує 1,40 дол. США за хвилину, програє 92% точному штучному інтелекту, який коштує 0,18 дол. США за хвилину, майже для будь-якого реального бізнесу.
Ми опублікуємо наступний набір цифр у третьому кварталі. Якщо вони покажуть регресію, ми це теж опублікуємо. Сенс вимірювання цього матеріалу полягає не в тому, щоб знайти приємну діаграму; це знайти виклики, які ми все ще отримуємо неправильно.