Введение
Большинство цифр «точности искусственного интеллекта», которые вы читаете в маркетинговых текстах, совершенно бессмысленны. Они сравнивают модель с чистым набором данных, сравнивают набор данных с самим собой и выдают число, которое почти не имеет ничего общего с работой системы во вторник днем, когда клиент звонит с шумного склада и задает сразу три вопроса.
Мы хотели, чтобы число что-то значило. Таким образом, в течение трех месяцев с января по март 2026 года каждый звонок, который наш ИИ-секретарь обрабатывал в производственном парке — всего 8427 звонков — расшифровывался, оценивался ИИ в режиме реального времени, а затем независимо переоценивался человеком-рецензентом, который никогда не видел вердикт ИИ.
Мы отслеживали язык, акцент (если его можно идентифицировать), тип звонка, время суток, продолжительность и конкретный путь разговора.
Целью было не опубликовать лестную цифру. Цель заключалась в том, чтобы найти звонки, в которых ИИ считал, что он добился успеха и ошибся, а также звонки, в которых ИИ действительно решил проблему клиента, но наши внутренние показатели отметили это как промах. Оба класса оказались больше, чем мы ожидали.
Как мы отбирали и оценивали звонки
Было три правила. Во-первых, никакого выбора: каждый звонок за период учитывался, включая 47 звонков, которые прервались в середине разговора, и 312, которые были переведены на человека в течение первых 15 секунд. Во-вторых, рецензенты-люди были слепы к самооценке ИИ — они оценивали стенограмму в соответствии с заявленным намерением клиента, а не в соответствии с тем, что ИИ утверждал, что он сделал.
В-третьих, рубрика была опубликована до того, как были рассмотрены какие-либо данные, чтобы удержать нас от тихого переопределения понятия «успех» после того, как появились цифры.
Каждый звонок оценивался по трем независимым параметрам:
- Захват намерения — правильно ли ИИ определил, что на самом деле пытался сделать звонивший? (Двоичный: да/нет.)
- Завершение задачи — была ли заявленная потребность звонящего действительно решена в ходе этого звонка или потребовалось участие человека, о котором звонивший не просил?
- Гигиена разговора — не было ли в стенограмме галлюцинаций, ложных обещаний или противоречий? Оценка рецензента от 1 до 5.
Вызов считался «победой», только если он удовлетворял всем трем критериям: правильное намерение, завершение задачи, гигиенический балл 4 или 5. Третьи ворота — это те, которые незаметно устраняют вызовы, которые в противном случае мы бы назвали успешными.
Цифры в заголовке
Во всем наборе данных из 8427 вызовов ИИ очистил все три шлюза. 91.4% звонков. Это число оказалось выше, чем мы прогнозировали внутри компании — у большинства из нас были ставки в диапазоне 85–88%.
Разрыв между нашим прогнозом и результатом не означает, что модель стала лучше, чем мы ожидали; Дело в том, что наша интуиция формировалась под воздействием вызовов, которые мы помнили, и которые были непропорционально плохими.
В разбивке по типам вызовов разница была значительной:
- Бронирование встреч — 96,1% (самый простой путь, хорошо отрепетированное намерение)
- Общая информация — 93,8% (часы работы, расположение, услуги)
- Ценовые запросы — 89,2% (некоторые пути ценообразования требовали устранения неоднозначности)
- Отмена/перенос — 87.6%
- Жалобы и обострения — 78.3%
- Звонки по нескольким вопросам — 71,9% (два и более независимых намерения в одном вызове)
Мы сосредоточились на номерах жалоб и нескольких проблем. 96% заказов на встречи — это то, что мы отправляем, чтобы выиграть сделки; 72% звонков по нескольким вопросам — это то, что мы отправляем, чтобы их сохранить.
Язык и акцент: где жили сюрпризы
Мы работаем на 32 языках и публикуем единый показатель точности для каждого языка. Совокупный разрыв между нашим лучшим языком (английский-американский) и нашим худшим поддерживаемым языком (вьетнамский) составил 4,1 процентного пункта — меньше, чем мы ожидали, и меньше, чем мы видели в опубликованных академических тестах.
Но совокупные оценки по языку скрывают ту часть проблемы, которая действительно имеет значение: различия в акцентах внутри одного языка. Звонки на английском языке, обработанные в США, набрали 92,7%. Звонки на английском языке от индийско-англоговорящих клиентов набрали 91,3% — вполне в рамках общего шума. Английские звонки от строго региональный Носители шотландского английского языка набрали 83,4%. Это разрыв в 9 пунктов, и он полностью находится внутри столбца с надписью «Английский».
Дело не в том, что наша модель плоха в шотландском английском. Дело в том, что публикация числа для каждого языка без измерения разницы акцентов — это способ скрыть вызовы, с которыми не справляется ваш ИИ. Сейчас мы сообщаем о различиях в акцентах внутри компании и планируем опубликовать ее снаружи в течение двух кварталов.
Пять режимов отказа, которые объясняют 80% промахов
Когда мы сгруппировали 723 пропущенных звонка (8,6% набора данных), на пять режимов сбоя пришлось 81% из них. Ничто из этого не удивит никого, кто раньше внедрял голосовой ИИ, но относительный вес нас удивил.
1. Намеренное стекинг (29% промахов)
У вызывающего абонента есть два или более намерений, и ИИ фиксирует первое из них до того, как закончит формулировать второе. «Я хочу перенести встречу, а также продать ли вам модель X-100» — это именно тот тип ввода, который разрушает состояние разговора.
2. Неявное падение контекста (22%).
Звонящий ссылается на то, что было сказано ранее в разговоре и что ИИ не сохранил в качестве контекста — имя, цену, дату. Это режим сбоя, к которому наиболее непосредственно обращается контекстное окно следующего поколения.
3. Звонивший проговорил подсказку (15%)
Сбои конечных точек. ИИ начинает говорить, вызывающий абонент говорит поверх него, ИИ слышит свой собственный голос, смешанный с голосом звонящего, и создает расшифровку, в которой отсутствует половина ввода.
4. Ошибки при считывании чисел (9%).
Звонящий диктует номер телефона или адрес. ИИ считывает его обратно. Звонящий исправляет одну цифру. ИИ обновляет неправильную цифру. Это 100% решаемая проблема с запросом на подтверждение структурированных данных, и мы выпустили такую проблему в феврале.
5. Ложная передача (6%)
ИИ правильно определяет, что он не может решить вызов, и осуществляет перевод, но маршрутизация передачи отправляет его не в ту очередь. На самом деле это не ошибка ИИ; это сбой плана набора, который обнаруживает ИИ.
Что мы отправили благодаря этому исследованию
Три выпущенных изменения появились непосредственно в результате исследования, а четвертое находится в разработке. Мы постарались предложить максимально эффективное исправление для каждого режима сбоя, а не самое интересное с академической точки зрения.
- Многоцелевой детектор. Небольшой классификатор, который работает параллельно с фиксацией намерений и помечает высказывания, содержащие два или более независимых намерения. Если этот флажок установлен, разговор приостанавливается, и ИИ явно перечисляет: «Я слышал, что вы хотите перенести расписание, и вы также спрашивали о X-100. Давайте сначала перенесем расписание — это нормально?» Классификатор добавил задержку на 11 мс и сократил количество промахов при стекировании на 64%.
- Подтверждение структурированного номера. Любой номер телефона, адрес или сумма теперь подтверждается по цифрам при обратном считывании с помощью обработчика однозначного редактирования. Промахи при обратном считывании номеров сократились на 88%.
- Рекалибровка конечной точки. Мы перенастроили порог молчания для каждого языка и добавили вопрос «Вы закончили эту мысль?» восстановление при подозрении на усечение. Число неудачных попыток переговора сократилось с 15% до 9% от числа промахов.
Четвертое изменение — более богатый контекстный буфер для каждого вызова, который устраняет неявное удаление контекста — является самым сложным из четырех, и перед его запуском оно тестируется в теневом режиме против набора отложенных вызовов.
Заметка о заносе человеческого грейдера
Один небольшой вывод, о котором стоит упомянуть: количество рецензентов, несмотря на опубликованную рубрику, колебалось в течение трех месяцев. За первый месяц рецензенты отметили 87% звонков как успешные. В третий месяц те же рецензенты, оценивая случайно выбранные звонки первого месяца во второй раз, отметили 91% как успешные. Стенограммы не изменились.
Дрейф не был недобросовестным; это было знакомство. Когда рецензенты привыкли к формулировкам ИИ, они стали более щедрыми в вопросах гигиены разговоров. Мы уловили это, повторно оценив 5% выборки звонков первого месяца в третьем месяце и исправив это в заголовке. Указанные выше 91,4% — это показатель с поправкой на дрейф. Исходное число составило 92,1%.
Если поставщик публикует показатель точности, не описывая, как он контролировал смещение грейдера человеком, это число по умолчанию считается подозрительным. Мы не придумали эту проблему; мы просто обратили на это внимание.
Что мы измеряем дальше
Три вещи в порядке приоритета. Во-первых, точность определения акцентов на каждом основном поддерживаемом языке — и публичное обязательство опубликовать его, как только методология стабилизируется. Во-вторых, точность результатов после звонка: действительно ли звонивший получил то, за чем пришел, измеряется через 7 и 30 дней после звонка путем сверки с последующей системой клиента.
В-третьих, показатель стоимости за обработанный вызов, который сочетает в себе точность с поминутной экономикой — потому что ИИ с точностью 98%, который стоит 1,40 доллара в минуту, проигрывает ИИ с точностью 92%, который стоит 0,18 доллара в минуту, практически для любого реального бизнеса.
Мы опубликуем следующий набор цифр в третьем квартале. Если они покажут регресс, мы это тоже опубликуем. Цель измерения этого материала не в том, чтобы найти лестную диаграмму; это значит найти вызовы, которые мы все еще получаем неправильно.