为什么我们在第一天就提供 STIR/SHAKEN 证明
大多数云电话供应商将呼叫者 ID 认证视为一项更高级别的功能。运营商没有。以下是我们将其设置为默认值的原因以及它对出站应答率的更改。
在三个月的时间里,我们跟踪了人工智能处理的每一个电话——按语言、口音、电话类型——并根据人类审阅者对文字记录进行评分。准确率数字比我们预期的要好。故障模式更有趣。
您在营销文案中读到的大多数“人工智能准确性”数字实际上毫无意义。他们在干净的数据集上对模型进行基准测试,对数据集本身进行评分,并生成一个与周二下午客户从嘈杂的仓库打电话并同时询问三个问题时系统表现几乎无关的数字。
我们想要一个有意义的数字。因此,在 2026 年 1 月至 3 月之间的三个月里,我们的人工智能接待员在整个制作团队中处理的每个电话(总共 8,427 个电话)都由人工智能实时转录和评分,然后由从未见过人工智能判决的人类审核员独立重新评分。
我们跟踪了语言、口音(如果可以识别)、通话类型、一天中的时间、长度以及对话的具体路径。
重点不是要公布一个讨人喜欢的数字。关键是找到人工智能认为成功但错误的呼叫,以及人工智能真正解决了客户问题但我们的内部指标将其标记为失败的呼叫。两个班级的规模都超出了我们的预期。
有三个规则。首先,不挑挑拣拣:整个期间的每个呼叫都符合资格,包括在通话过程中崩溃的 47 个呼叫以及在前 15 秒内转接给人工的 312 个呼叫。其次,人类审阅者对人工智能的自我评估视而不见——他们根据客户声明的意图对成绩单进行评分,而不是根据人工智能声称它所做的任何事情。
第三,该标题是在查看任何数据之前发布的,以防止我们在数据出现后悄悄地重新定义“成功”。
每个通话都在三个独立的维度上进行评分:
只有满足了所有三个要求的呼叫才被算作“胜利”:正确的意图、完成的任务、卫生得分为 4 或 5。第三道门是悄悄消除呼叫的门,否则我们会称之为成功。
在完整的 8,427 个呼叫数据集中,人工智能清除了所有三个门 91.4% 的呼叫。这个数字比我们内部预测的要高——我们大多数人的赌注都在 85-88% 的范围内。
我们的预测和结果之间的差距并不是模型比我们预期的更好;而是模型变得比我们预期的要好。我们的直觉是由我们所记得的电话所塑造的,而这些电话中坏电话的比例不成比例。
按呼叫类型细分,差异非常显着:
投诉和多问题数量是我们关注的重点。 96% 的预约率是我们赢得交易的关键; 72% 的多问题呼叫数量是我们为了保留它们而提供的。
我们以 32 种语言开展业务,并针对每种语言发布单一准确率数字。我们最好的语言(美国英语)和支持最差的语言(越南语)之间的总差距为 4.1 个百分点,比我们预期的要窄,也比我们在已发布的学术基准中看到的要窄。
但总体语言分数掩盖了真正重要的问题部分:单一语言内的口音差异。在美国处理的英语电话得分为92.7%。来自印度英语客户的英语通话得分为 91.3%——完全在噪音范围内。英语电话来自 强烈的区域性 说苏格兰英语的人得分为 83.4%。这是 9 分的差距,而且它完全位于标有“英语”的栏内。
问题不在于我们的模型不擅长苏格兰英语。关键是,发布每种语言的号码,同时不测量口音差异,是隐藏人工智能无法接听的呼叫的一种方法。我们现在正在内部报告口音差异,并预计在两个季度内向外部发布。
当我们对 723 个未接来电(占数据集的 8.6%)进行聚类时,五种故障模式占其中的 81%。这些都不会令之前推出过语音 AI 的人感到惊讶,但相对权重确实让我们感到惊讶。
呼叫者有两个或多个意图,人工智能在完成第二个意图之前承诺第一个意图。 “我想重新安排我的约会,而且你们是否出售 X-100 型号”正是这种破坏对话状态的输入。
来电者引用了对话中早些时候所说的一些内容,即人工智能没有存储为上下文——名称、价格、日期。这是下一代上下文窗口最直接解决的故障模式。
端点失败。人工智能开始说话,呼叫者对其进行交谈,人工智能听到自己的声音与呼叫者的声音混合,并生成缺少一半输入的文字记录。
呼叫者口述电话号码或地址。人工智能将其读回。呼叫者更正一位数字。 AI 更新了错误的数字。这是一个 100% 可修复的问题,带有结构化数据确认提示,我们在 2 月份发布了一个。
人工智能正确地识别出它无法解决呼叫和转接,但转接路由将其发送到错误的队列。这并不是真正的人工智能失败;而是人工智能的失败。这是人工智能暴露的拨号计划故障。
三个已发布的更改直接来自研究,第四个正在开发中。我们试图针对每种故障模式提供最高杠杆的修复方案,而不是学术上最有趣的修复方案。
第四个变化是更丰富的每次调用上下文缓冲区,可解决隐式上下文丢失问题,这是四个变化中最复杂的,并且在上线之前正在影子模式下针对保留的调用集进行试验。
一个值得一提的小发现是:尽管已发布了标题,但人类审稿人在三个月内的表现却出现了偏差。第一个月,审核者将 87% 的通话标记为成功。在第三个月,同样的审阅者对第一个月随机抽取的电话进行第二次评分,将 91% 标记为成功。成绩单没有改变。
这种倾向并非出于恶意,而是出于恶意。这是熟悉的感觉。随着审稿人习惯了人工智能的措辞,他们在对话卫生方面变得更加慷慨。我们通过在第三个月重新对第一个月通话的 5% 样本进行评分来发现这一点,并更正了标题数字。上面报告的 91.4% 是经过漂移校正的数字。原始数字为92.1%。
如果供应商发布了准确度数字,但没有描述他们如何控制人类平地机漂移,则默认情况下该数字是可疑的。这个问题不是我们发明的,而是我们发明的。我们只是注意到了而已。
三件事,按优先顺序排列。首先,每种主要支持语言中的口音解析准确性——以及公开承诺一旦方法稳定就将其发布。其次,呼叫后结果的准确性:呼叫者是否真正收到了他们想要的东西,通过与客户的下游系统协调在呼叫后 7 天和 30 天进行测量。
第三,将准确性与每分钟经济性相结合的每次解决呼叫成本——因为对于几乎所有实际业务来说,每分钟成本为 1.40 美元的准确率 98% 的人工智能会输给每分钟成本为 0.18 美元的准确率 92% 的人工智能。
我们将在第三季度发布下一组数字。如果它们表现出回归,我们也会发布。测量这些东西的目的不是为了找到一个讨人喜欢的图表;而是为了找到一个令人愉悦的图表。就是要找到我们仍然出错的调用。