вступ
Протягом двох десятиліть індустрія контакт-центрів узгоджувала процес: супервайзер випадковим чином відбирав невеликий відсоток записаних дзвінків — зазвичай від 2 до 5 на агента на тиждень — порівнював їх із 30-рядковою рубрикою та об’єднував результати у звіт про коучинг. Вся індустрія була побудована навколо цієї практики. Продавці продавали картки показників. Аудитори підтвердили рубрики. Конференції мали треки для цього.
Математика ніколи не працювала. Контактний центр із 1000 агентів, який обробляє 200 000 дзвінків на тиждень, з вибіркою 2% на агента, дає вам 40 000 оцінених дзвінків — це звучить багато, доки ви не зрозумієте, що вибірка рівномірно випадкова для дзвінків, які на 99% доброякісні.
Вибірка 40 000 випадкових розмов, щоб знайти 60 дзвінків, у яких агент порушив комплаєнс, — це визначення голки в стозі сіна. До того моменту, коли стог сіна було відсортовано, агент пішов далі, клієнт відмовився, а порушення поглибилося.
Суть QA ніколи не полягала в тому, щоб оцінити середній дзвінок. Важливо було знайти дзвінки — невдачі, збереження, крайні випадки, розмови, у яких агент зробив щось виняткове чи тривожне. Випадкова вибірка структурно погана для пошуку будь-якого з них.
Що змінилося за останні 18 місяців
Дві речі змінилися достатньо, щоб стара модель була явно зламана. По-перше, якість транскрипції перетнула поріг корисності — у більшості основних мов транскрипції тепер достатньо надійні, щоб оцінювати їх програмним забезпеченням, а не лише людськими вухами.
По-друге, великі мовні моделі отримали достатньо хороші результати в керованій класифікації, тому спеціально навчена модель може оцінити виклик за 30 вимірами за 4 секунди менш ніж за копійки.
Разом це означало, що вперше в історії контакт-центру кожен окремий дзвінок можна було оцінити за критерієм — не 2%, не 5%, а 100%. Після оцінки кожного дзвінка питання перестає бути "які дзвінки ми відбираємо?" і стає "які дзвінки заслуговують на увагу супервізора?"
Це питання, яке варто вирішити, і це проблема ранжирування, а не проблема вибірки.
Що входить до оцінки ризику
Ми оцінюємо кожен дзвінок за трьома незалежними параметрами, а потім об’єднуємо їх у єдиний ранг, який супервізор бачить на своїй консолі.
- Ризик відповідності — чи виклик містив висловлювання, які викликають регулятивне розкриття? Міні-Міранда, згода TCPA, обмеження FDCPA щодо стягнення боргів, розкриття захищеної інформації про здоров’я. Цей розмір є двійковим — більшість дзвінків оцінюється близько нуля, маленький хвіст має високу оцінку.
- Ризик результату — чи ймовірно, що цей клієнт відмовиться, поскаржиться або піде на ескалацію в результаті цього дзвінка? Поєднує траєкторію настроїв, сигнали про невирішені проблеми, відверту мову скарг і вартість рівня облікового запису клієнта.
- Тренерська цінність — чи може керівник, який спостерігає за цією розмовою, навчитися чомусь, чого вони можуть навчити? Тренери високого рангу - це незвичайні сейви, чисті передачі та контрольована деескалація. Вони не невдачі; вони є взірцями.
Три виміри не однаково зважені, і ваги не однакові для клієнтів. Оператор зі стягнення заборгованості найбільше оцінює ризик недотримання вимог. Команда підтримки корпоративних SaaS зважує ризик результату. Команда адаптації, яка займає важкі тренування, важить цінність тренера. Вагові коефіцієнти відображаються в налаштуваннях супервізора, і ми встановлюємо розумні значення за умовчанням для кожної галузі.
Консоль супервізора: ранжована черга
Вигляд консолі навмисно відрізняється від старого інтерфейсу користувача «черги випадкових зразків». Замість розбитого на сторінки списку останніх дзвінків це єдина ранжована черга, відсортована за сумарним показником ризику, яка оновлюється кожні дві хвилини. Верхня частина черги – близько 20 дзвінків, які сьогодні потребують уваги. Все, що внизу, — довгий хвіст.
Кожна картка виклику містить три підрахунки, 90-секундний підсумок того, про що був виклик, і конкретні фрагменти, позначені моделлю. Супервізор може прослухати фрагмент, не прослуховуючи весь виклик. Якщо фрагмент — це вся історія — а в більшості випадків так і є — супервізор підтверджує або відхиляє позначку протягом 30 секунд і йде далі.
Раніше перевірка якості за випадковою вибіркою займала в середньому 8 хвилин на дзвінок. Середня черга за рейтингом становить 2 хвилини 40 секунд. Вартість QA за дзвінок впала. Покриття зросло з 2% до 100%. Керівник витрачає свій час на дзвінки, які фактично змінили показник.
Заперечення ми почули
Коли ми показали рейтингову чергу керівникам QA у клієнтів-дизайнерів-партнерів, постійно виникло три заперечення.
Заперечення 1: «Модель пропустить те, що вловила б людина».
Вірно абстрактно; здебільшого неправдиві на практиці. Модель сумує за людськими речами фахівець вловить — аудитор відповідності, переглядаючи той самий виклик, може виявити тонкощі, які модель не позначає. Але порівняння не проти спеціаліста. Це проти того, щоб супервайзер випадково відбирав 2% дзвінків. Модель оцінює 100% і відзначає очевидні 5%. Спеціаліст оглядає 5%.
Покриття мережею набагато краще, ніж стара система.
Заперечення 2: «Агенти обіграють рахунок».
Напевно правда. Будь-яка метрика, яка привертає увагу, стає грою. Захист є подвійним: рахунок є багатовимірним, тож одна вісь гри підштовхує вас до іншої; і оцінка не є оцінкою продуктивності агента. Оцінка є сигналом сортування для керівника. Огляд ефективності - це те, що керівник робить висновок після того, як вони прослухають фактичний виклик.
Ми продаємо рахунок як чергу, а не табло.
Заперечення 3: «Це змінює роботу керівника».
Це теж правда, і ми повинні бути чесними щодо цього. Керівник контакт-центру з рейтинговою чергою витрачає менше часу на підрахунок дзвінків за 30-рядковою рубрикою та більше часу на навчання, ескалацію та втручання. Начальники, яким подобалася стара робота — її методична, керована системою оцінок частина — не обов’язково в захваті від нової.
Перед запуском ми відкрито говорили про це з керівниками відділу проектування-партнера. Це зміна робочого процесу, а не просто зміна інструменту.
Що виявила нова система за перші 90 днів
Серед чотирьох партнерів-дизайнерів, які керували виключно ранжованою чергою протягом 90 днів, команди супервайзерів передавали в 4,7 рази більше дзвінків на тиждень до утримання або відповідності, ніж вони мали за випадковою вибіркою. Збільшення не було ефектом «більшого контролю»; це були майже всі виклики, які випадкова вибірка структурно пропустила.
Один клієнт помітив збій у сценарії стягнення боргів — один агент почав використовувати мову, яка перетинала межі FDCPA, приблизно під час 9% їхніх дзвінків — випадкова вибірка не з’являлася протягом 11 тижнів. Рейтингова черга виявила це протягом 48 годин після початку дрейфу, тому що оцінка відповідності ризику для цих конкретних дзвінків підскочила на два стандартних відхилення вище базового рівня агента.
Інший клієнт виявив, що агенти, яких система випадкової вибірки позначила як найнижчі, насправді не були найгіршими — вони просто були найгучнішими. Ранжирувана черга, яка оцінювалася на основі ризику результату, визначила двох тихих, але незмінно погано ефективних агентів, чиї дзвінки були відібрані з такою ж частотою, як і всі інші, і потрапили в «середню» купу.
Чого ми свідомо не будемо робити з рахунком
Три речі, навмисно.
Ми не будемо автоматично оцінювати агентів на виході черги. Оцінка є сигналом сортування. Рейтинги роботи агентів все ще проходять через супервайзера. Ми навмисно тримаємо людину в курсі не тому, що модель не може цього зробити, а тому, що ми спостерігали, як достатньо систем автоматичної оцінки підриває довіру, щоб хотіти повністю уникнути шаблону.
Під час розмови ми не будемо показувати йому результати агента в реальному часі. Існує школа думки, яка стверджує, що агенти повинні бачити власні оцінки тренерів у режимі реального часу. Існує сильніша школа думки, яка каже, що це погіршує якість виклику. Ми на боці другої школи.
За умовчанням ми не будемо експортувати оцінку в системи керування продуктивністю. Клієнти, які бажають підключити оцінку до окремого HR-інструменту, можуть зробити це за допомогою чіткої конфігурації, але ми робимо вибір за замовчуванням безпечнішим. Якщо ви хочете мати число в електронній таблиці, ви повинні запитати це навмисно.