첫날에 STIR/SHAKEN 증명을 제공하는 이유
대부분의 클라우드 전화 공급업체는 발신자 ID 증명을 상위 기능으로 취급합니다. 통신사는 그렇지 않습니다. 기본값으로 설정한 이유와 아웃바운드 응답률에 대한 변경 사항은 다음과 같습니다.
3개월 동안 우리는 AI가 처리한 모든 통화를 언어, 억양, 통화 유형별로 추적하고 인간 검토자와 비교하여 성적표를 평가했습니다. 정확도 수치는 우리가 예상했던 것보다 나았습니다. 실패 모드가 더 흥미로웠습니다.
마케팅 카피에서 읽는 대부분의 "AI 정확도" 수치는 조용히 의미가 없습니다. 그들은 깨끗한 데이터 세트에 대한 모델을 벤치마킹하고, 자체적으로 데이터 세트의 점수를 매기고, 고객이 시끄러운 창고에서 전화를 걸어 한 번에 세 가지 질문을 하는 화요일 오후에 시스템 성능과 거의 관련이 없는 숫자를 생성합니다.
우리는 뭔가 의미가 있는 숫자를 원했습니다. 따라서 2026년 1월부터 3월까지 3개월 동안 생산 시설 전체에서 처리된 모든 AI 접수 담당자(총 8,427건)가 녹음되어 AI에 의해 실시간으로 등급이 매겨진 다음 AI 평결을 본 적이 없는 인간 검토자가 독립적으로 재등급을 매겼습니다.
우리는 언어, 억양(식별 가능한 경우), 통화 유형, 시간, 길이 및 대화의 구체적인 경로를 추적했습니다.
요점은 기분 좋은 숫자를 공개하는 것이 아니었습니다. 요점은 AI가 성공했다고 생각하고 틀렸다고 생각하는 통화와 AI가 고객의 문제를 진정으로 해결했지만 우리 내부 지표에서 이를 실패로 표시한 통화를 찾는 것이었습니다. 두 클래스 모두 우리가 예상했던 것보다 더 컸습니다.
세 가지 규칙이 있었습니다. 첫째, 체리 피킹이 없습니다. 대화 중간에 중단된 47건의 통화와 처음 15초 이내에 사람에게 전송된 312건을 포함하여 해당 기간의 모든 통화가 적격했습니다. 둘째, 인간 검토자는 AI의 자체 평가를 보지 못했습니다. 그들은 AI가 수행했다고 주장한 내용이 아닌 고객이 명시한 의도에 따라 성적표의 등급을 매겼습니다.
셋째, 수치가 입력된 후에 조용히 "성공"을 재정의하는 것을 방지하기 위해 데이터를 검토하기 전에 루브릭을 게시했습니다.
각 통화는 세 가지 독립적인 차원에 따라 점수가 매겨졌습니다.
통화는 올바른 의도, 작업 완료, 위생 점수 4 또는 5의 세 가지를 모두 충족한 경우에만 "승리"로 간주됩니다. 세 번째 게이트는 성공이라고 불렀을 통화를 조용히 제거하는 게이트입니다.
전체 8,427개 호출 데이터 세트에서 AI는 세 가지 게이트를 모두 삭제했습니다. 91.4% 통화. 그 숫자는 우리가 내부적으로 예측한 것보다 더 높았습니다. 우리 대부분은 85~88% 범위의 베팅을 했습니다.
우리의 예측과 결과 사이의 격차는 우리가 예상했던 것보다 모델이 좋아지는 것이 아니었습니다. 우리의 직관은 우리가 기억하는 통화에 의해 형성되는데, 그 통화는 불균형적으로 나쁜 통화였습니다.
통화 유형별로 분류하면 차이가 상당합니다.
불만 사항과 다중 문제 번호는 우리가 집중한 것입니다. 약속 예약의 96% 수치는 거래 성사를 위해 배송되는 것입니다. 다중 문제 통화의 72% 수치는 이를 유지하기 위해 배송되는 것입니다.
우리는 32개 언어로 운영되며 언어별로 단일 정확도 수치를 게시합니다. 최고의 언어(미국 영어)와 최악의 지원 언어(베트남어) 사이의 총 격차는 4.1% 포인트로, 예상보다 좁았고, 발표된 학술 벤치마크에서 보고된 것보다 좁았습니다.
그러나 총 언어 점수는 실제로 중요한 문제인 단일 언어 내의 악센트 차이를 숨깁니다. 미국에서 처리된 영어 통화는 92.7%를 기록했습니다. 인도-영어를 사용하는 고객의 영어 전화는 91.3%를 기록했습니다. 영어로 걸려오는 전화 지역성이 강한 스코틀랜드-영어 사용자는 83.4%를 기록했습니다. 이는 9포인트 간격이며 완전히 "English"라고 표시된 열 내부에 있습니다.
요점은 우리 모델이 스코틀랜드 영어를 잘 못한다는 것이 아닙니다. 요점은 악센트 차이를 측정하지 않은 채 언어별 번호를 게시하는 것이 AI가 실패하는 통화를 숨기는 방법이라는 것입니다. 현재 내부적으로 악센트 차이를 보고하고 있으며, 2분기 이내에 외부에 게시할 예정입니다.
723개의 부재중 전화(데이터 세트의 8.6%)를 클러스터링했을 때 5가지 실패 모드가 그 중 81%를 차지했습니다. 이전에 음성 AI를 출시한 사람이라면 이 중 어느 것도 놀라지 않을 것이지만 상대적인 가중치는 우리를 놀라게 했습니다.
호출자에게는 두 개 이상의 인텐트가 있고 AI는 두 번째 인텐트를 완료하기 전에 첫 번째 인텐트를 실행합니다. "약속 일정을 변경하고 싶고 X-100 모델도 판매하고 싶습니다"는 대화 상태를 핵무기로 만드는 입력과 정확히 같습니다.
발신자는 AI가 컨텍스트로 저장하지 않은 이름, 가격, 날짜 등 대화 초반에 말한 내용을 언급합니다. 이는 차세대 컨텍스트 창이 가장 직접적으로 해결하는 실패 모드입니다.
엔드포인트 실패. AI가 말하기 시작하면 호출자가 이에 대해 이야기하고 AI는 호출자의 음성과 혼합된 자신의 음성을 듣고 입력의 절반이 누락된 기록을 생성합니다.
발신자가 전화번호나 주소를 알려줍니다. AI가 다시 읽어줍니다. 발신자가 한 자리를 수정합니다. AI가 잘못된 숫자를 업데이트합니다. 이는 구조화된 데이터 확인 프롬프트로 인해 100% 해결 가능한 문제이며, 우리는 2월에 하나를 출시했습니다.
AI는 통화를 해결할 수 없다는 것을 정확하게 식별하고 전달합니다. 그러나 전달 라우팅은 이를 잘못된 대기열로 보냅니다. 이것은 실제로 AI 실패가 아닙니다. AI가 노출하는 것은 다이얼 플랜 실패입니다.
출시된 세 가지 변경 사항은 연구에서 직접 나온 것이며 네 번째 변경 사항은 개발 중입니다. 우리는 학문적으로 가장 흥미로운 것보다는 실패 모드당 가장 높은 활용도의 수정 사항을 제공하려고 노력했습니다.
네 번째 변경 사항(암시적 컨텍스트 삭제를 해결하는 보다 풍부한 호출별 컨텍스트 버퍼)은 네 가지 중 가장 복잡하며, 활성화되기 전에 보류된 호출 세트에 대해 섀도우 모드에서 시험되고 있습니다.
명명할 가치가 있는 한 가지 작은 발견은 인간 검토자가 게시된 기준표에도 불구하고 3개월 동안 표류했다는 것입니다. 첫 번째 달에 검토자는 통화의 87%를 성공으로 표시했습니다. 세 번째 달에는 동일한 검토자가 두 번째로 무작위로 추첨된 첫 번째 달 통화에 점수를 매겨 91%를 성공으로 표시했습니다. 성적표는 변경되지 않았습니다.
표류는 나쁜 믿음이 아니 었습니다. 그것은 익숙함이었다. 리뷰어가 AI의 표현에 익숙해지면서 대화 위생 측면에 더욱 관대해졌습니다. 우리는 3개월차에 1개월차 통화의 5% 샘플을 다시 채점하여 이를 파악하고 이에 대한 헤드라인 번호를 수정했습니다. 위에 보고된 91.4%는 드리프트 보정된 수치입니다. 원수는 92.1%였다.
공급업체가 휴먼 그레이더 드리프트를 제어한 방법을 설명하지 않고 정확도 수치를 게시하는 경우 기본적으로 해당 수치는 의심스러운 수치입니다. 우리는 이 문제를 만들어낸 것이 아닙니다. 우리는 그것에만 주의를 기울였습니다.
우선순위에 따라 세 가지입니다. 첫째, 지원되는 각 주요 언어 내에서 악센트 해결의 정확성과 방법론이 안정화되면 이를 게시하겠다는 공개 약속입니다. 둘째, 통화 후 결과 정확성: 통화 후 7일과 30일 후에 고객의 다운스트림 시스템과 조정하여 측정한 결과로 발신자가 원하는 것을 실제로 받았습니까?
셋째, 정확성과 분당 경제성을 결합한 해결 호출당 비용입니다. 왜냐하면 거의 모든 실제 비즈니스에서 분당 $1.40의 비용이 드는 98% 정확한 AI가 분당 $0.18의 비용이 드는 92% 정확한 AI에 패배하기 때문입니다.
우리는 3분기에 다음 수치를 발표할 것입니다. 회귀가 표시되면 해당 내용도 게시할 것입니다. 이 물건을 측정하는 요점은 마음에 드는 차트를 찾는 것이 아닙니다. 우리가 여전히 잘못 알고 있는 호출을 찾는 것입니다.
AI 접수원, 도매 경로, 가상 번호 — 투명한 가격과 연중무휴 NOC로 단일 플랫폼에 구축되었습니다.