8,400건의 실제 통화에서 AI 접수 정확도를 측정했습니다.
3개월 동안 우리는 AI가 처리한 모든 통화를 언어, 억양, 통화 유형별로 추적하고 인간 검토자와 비교하여 성적표를 평가했습니다. 정확도 수치는 우리가 예상했던 것보다 나았습니다. 실패 모드가 더 흥미로웠습니다.
무작위 샘플링은 실제로 중요한 호출을 놓칩니다. 우리는 위험 점수를 중심으로 감독 콘솔을 재구축하고 QA가 숫자 게임인 척하는 것을 중단했습니다.
20년 동안 컨택 센터 업계는 다음과 같은 프로세스에 동의했습니다. 감독자는 녹음된 통화 중 작은 비율(보통 상담원당 주당 2~5건)을 무작위로 샘플링하여 30행 기준표에 대해 점수를 매긴 다음 점수를 코칭 보고서로 합산하는 프로세스에 동의했습니다. 전체 산업은 이러한 관행을 중심으로 구축되었습니다. 공급업체는 스코어카드를 판매했습니다. 감사자는 기준표를 검증했습니다. 컨퍼런스에는 이에 대한 트랙이 있었습니다.
수학은 결코 작동하지 않았습니다. 에이전트당 2% 샘플링으로 매주 200,000개의 통화를 처리하는 1,000명의 상담원으로 구성된 컨택 센터는 40,000개의 점수가 부여된 통화를 제공합니다. 이는 99% 양성 통화 전체에서 샘플이 균일하게 무작위라는 사실을 깨닫기 전까지는 많은 것처럼 들립니다.
상담원이 규정 준수 위반을 저지른 60건의 통화를 찾기 위해 40,000건의 무작위 대화를 샘플링하는 것은 건초 더미 속의 바늘과 같습니다. 건초더미가 정리될 때쯤이면 상담원은 물러나고 고객은 이탈하며 위반 사항은 더욱 심각해집니다.
QA의 요점은 평균 통화 점수를 매기는 것이 아닙니다. 실패, 저장, 극단적인 경우, 상담원이 예외적이거나 놀라운 일을 한 대화 등 중요한 통화를 찾는 것이 었습니다. 무작위 샘플링은 구조적으로 이러한 항목을 찾는 데 좋지 않습니다.
기존 모델이 명백히 망가질 정도로 두 가지가 바뀌었습니다. 첫째, 전사 품질은 유용성 기준점을 넘어섰습니다. 대부분의 주요 언어에서 전사 내용은 이제 사람의 귀뿐만 아니라 소프트웨어로도 점수를 매길 수 있을 만큼 신뢰할 수 있습니다.
둘째, 대규모 언어 모델은 지도 분류에서 충분히 뛰어나서 맞춤형 학습 모델이 1페니도 안 되는 비용으로 4초 안에 30차원에 대한 호출 점수를 매길 수 있습니다.
이는 컨택 센터 역사상 처음으로 모든 단일 통화가 기준표에 따라 점수가 매겨질 수 있음을 의미합니다. 즉, 2%도, 5%도 아닌 100%입니다. 모든 통화에 점수가 매겨지면 "어떤 통화를 샘플링합니까?"라는 질문이 더 이상 발생하지 않습니다. "인간 감독자의 관심을 받을 만한 통화는 무엇입니까?"가 됩니다.
그것은 해결할 가치가 있는 문제이고, 샘플링 문제가 아니라 순위 문제입니다.
우리는 세 가지 독립적인 차원에서 모든 통화의 점수를 매긴 다음 이를 감독자가 콘솔에서 볼 수 있는 단일 순위로 결합합니다.
세 가지 차원의 가중치는 동일하지 않으며 고객 전체의 가중치도 동일하지 않습니다. 채권 추심 운영자는 규정 준수 위험에 가장 큰 비중을 둡니다. 하이 터치 엔터프라이즈 SaaS 지원 팀은 결과 위험에 가중치를 둡니다. 교육이 많은 온보딩 팀은 코칭 가치에 중점을 둡니다. 가중치는 감독자 설정에 노출되며 업계별로 합리적인 기본값을 설정합니다.
콘솔은 기존의 "무작위 샘플 대기열" UI와 의도적으로 다르게 보입니다. 페이지가 매겨진 최근 통화 목록 대신, 통합된 위험 점수로 정렬되고 2분마다 새로 고쳐지는 단일 순위 대기열입니다. 대기열의 맨 위에는 오늘 주의가 필요한 20개 정도의 통화가 있습니다. 아래의 모든 것은 긴 꼬리입니다.
각 통화 카드에는 3개의 하위 점수, 통화 내용에 대한 90초 요약, 모델이 플래그를 지정한 특정 스니펫이 포함되어 있습니다. 감독자는 전체 통화를 듣지 않고도 스니펫만 들을 수 있습니다. 스니펫이 전체 내용인 경우(대부분의 경우) 감독자는 30초 안에 플래그를 확인하거나 거부하고 계속 진행합니다.
무작위 샘플 QA에는 통화당 평균 8분이 소요되었습니다. 순위 대기열의 평균 길이는 2분 40초입니다. 통화당 QA 비용이 감소했습니다. 보장 범위가 2%에서 100%로 변경되었습니다. 감독자는 실제로 지표를 이동시킨 통화에 시간을 보내고 있습니다.
디자인 파트너 고객의 QA 리더에게 순위가 매겨진 대기열을 보여주었을 때 지속적으로 세 가지 반대 의견이 나왔습니다.
추상적으로는 사실입니다. 실제로는 대부분 거짓입니다. 모델은 인간의 것을 그리워한다 전문가 포착할 것입니다. 동일한 호출을 검토하는 규정 준수 감사자는 모델이 표시하지 않은 미묘한 점을 발견할 수 있습니다. 그러나 비교는 전문가와의 비교가 아닙니다. 이는 통화의 2%를 무작위로 샘플링하는 감독자에 대한 것입니다. 모델은 100%를 검토하고 명백한 5%를 표시합니다. 전문가가 5%를 검토합니다.
Net Coverage는 이전 시스템보다 훨씬 좋습니다.
아마도 사실일 겁니다. 관심을 끄는 측정항목은 모두 조작됩니다. 방어는 두 가지입니다. 점수는 다차원적이므로 게임을 하면 한 축이 다른 축을 밀어냅니다. 점수는 상담원의 성과 평가가 아닙니다. 점수는 감독관에게 분류 신호입니다. 성과 검토는 감독자가 실제 통화를 듣고 결론을 내리는 것입니다.
점수판이 아닌 대기열로 점수를 판매합니다.
또한 사실이며, 우리는 그것에 대해 솔직해야 합니다. 순위가 높은 컨택 센터의 감독자는 30행 기준에 따라 통화 채점에 소요되는 시간을 줄이고 코칭, 에스컬레이션 및 개입에 더 많은 시간을 사용합니다. 기존 업무(체계적이고 스코어카드 중심의 업무)를 좋아했던 감독자들이 반드시 새로운 업무에 열광하는 것은 아닙니다.
우리는 출시 전에 이에 대해 디자인 파트너 운영 리더들과 공개적으로 이야기했습니다. 이는 단순한 도구 변경이 아닌 작업 흐름 변경입니다.
90일 동안 독점적으로 순위가 매겨진 대기열을 실행한 4개의 설계 파트너 전체에서 감독자 팀은 무작위 샘플링보다 보존 또는 규정 준수에 대한 통화를 주당 4.7배 더 많이 에스컬레이션했습니다. 증가는 "보다 정밀한 조사" 효과가 아니었습니다. 무작위 샘플링이 구조적으로 놓친 것은 거의 전적으로 호출이었습니다.
한 고객은 부채 추심 스크립트 드리프트를 포착했습니다. 단일 상담원이 통화의 약 9%에서 FDCPA 경계를 넘는 언어를 사용하기 시작했는데, 무작위 샘플링이 11주 동안 나타나지 않았습니다. 순위가 매겨진 대기열은 드리프트 시작 후 48시간 이내에 대기열에 표시되었습니다. 왜냐하면 해당 특정 통화의 규정 준수 위험 점수가 상담원의 기준보다 2 표준 편차를 뛰어넘었기 때문입니다.
또 다른 고객은 무작위 표본 시스템이 가장 낮은 성과자로 표시한 에이전트가 실제로 가장 낮은 성과자가 아니라 가장 시끄러운 에이전트라는 사실을 발견했습니다. 결과 위험을 기준으로 등급을 매긴 순위 대기열은 통화가 다른 모든 사람과 동일한 속도로 샘플링되어 "평균" 더미에 도달한 조용하지만 지속적으로 성과가 낮은 상담원 두 명을 식별했습니다.
의도적으로 세 가지입니다.
대기열 출력에 대해 상담원의 점수를 자동으로 매기지 않습니다. 점수는 분류 신호입니다. 상담원 성과 평가는 여전히 감독자를 통해 이루어집니다. 우리는 모델이 그렇게 할 수 없기 때문이 아니라 자동 채점 시스템이 패턴을 완전히 피하려고 신뢰를 약화시키는 것을 충분히 보아왔기 때문에 의도적으로 인간을 루프에 유지합니다.
통화 중에는 상담원의 실시간 점수가 상담원에게 표시되지 않습니다. 에이전트가 자신의 코칭 점수를 실시간으로 확인해야 한다는 학설이 있습니다. 그렇게 하면 통화 품질이 저하된다고 주장하는 더 강력한 사고 방식이 있습니다. 우리는 두 번째 학교 편입니다.
기본적으로 점수를 성과 관리 시스템으로 내보내지 않습니다. 점수를 별도의 HR 도구에 연결하려는 고객은 명시적인 구성을 통해 그렇게 할 수 있지만 기본값을 더 안전한 선택으로 만듭니다. 스프레드시트에 숫자를 표시하려면 의도적으로 요청해야 합니다.
AI 접수원, 도매 경로, 가상 번호 — 투명한 가격과 연중무휴 NOC로 단일 플랫폼에 구축되었습니다.