我们通过 8,400 个真实通话测量了 AI 接待员的准确性
在三个月的时间里,我们跟踪了人工智能处理的每一个电话——按语言、口音、电话类型——并根据人类审阅者对文字记录进行评分。准确率数字比我们预期的要好。故障模式更有趣。
随机抽样会错过真正重要的调用。我们围绕风险评分重建了主管控制台,并不再假装 QA 是一场数字游戏。
二十年来,联络中心行业商定了一个流程:主管会随机抽取一小部分录音呼叫(通常每个座席每周 2 到 5 个),根据 30 行的评分标准对它们进行评分,并将分数汇总到指导报告中。整个行业都是围绕这种做法建立的。供应商出售记分卡。审核员验证了标准。会议对此进行了跟踪。
数学从来没有起作用。一个拥有 1,000 名座席的联络中心每周处理 200,000 个呼叫,每个座席抽取 2% 的样本,为您提供 40,000 个评分呼叫 — 这听起来似乎很多,直到您意识到样本在 99% 良性的呼叫中均匀随机。
对 40,000 个随机对话进行采样,找出客服人员违反合规行为的 60 个电话,这简直就是大海捞针。当大海捞针被整理好时,代理已经离开,客户已经流失,违规行为变得更加复杂。
质量检查的目的从来不是给平均评分打分。这是为了找到重要的呼叫——失败、扑救、边缘情况、特工做了异常或令人震惊的事情的对话。随机抽样在结构上很难找到其中任何一个。
有两件事的改变足以使旧模型明显崩溃。首先,转录质量跨越了有用的门槛——在大多数主要语言中,转录现在足够可靠,可以用软件评分,而不仅仅是用人耳评分。
其次,大型语言模型在监督分类方面表现得足够好,定制训练的模型可以在 4 秒内对 30 个维度的调用进行评分,成本还不到一分钱。
所有这些意味着联络中心历史上第一次可以根据评分标准对每个呼叫进行评分——不是 2%,不是 5%,而是 100%。一旦对每个呼叫进行评分,问题就不再是“我们对哪些呼叫进行采样?”并变成“哪些呼叫值得人类主管注意?”
这是值得解决的问题,而且是排序问题,而不是抽样问题。
我们在三个独立的维度上对每个呼叫进行评分,然后将它们组合成主管在控制台中看到的单个排名。
这三个维度的权重并不相同,而且不同客户的权重也不同。收债运营商最重视合规风险。高度接触的企业 SaaS 支持团队会权衡结果风险。训练有素的入职团队会重视教练的价值。权重在主管设置中公开,我们为每个行业设置合理的默认值。
控制台看起来故意与旧的“随机样本队列”用户界面不同。它不是最近呼叫的分页列表,而是一个单独的排名队列,按组合风险评分排序,每两分钟刷新一次。今天需要关注的电话排在最前面的是大约 20 个。下面的一切都是一条长尾巴。
每张电话卡都包含三个子分数、电话内容的 90 秒摘要以及模型标记的具体片段。主管可以收听片段而无需收听完整的通话。如果该片段代表了整个故事(大多数情况下都是如此),主管会在 30 秒内确认或拒绝该标记,然后继续。
过去,随机样本 QA 平均每次通话需要 8 分钟。排名队列平均2分40秒。每次调用的质量检查成本已经下降。覆盖率从2%提高到100%。主管将时间花在实际改变指标的呼叫上。
当我们向设计合作伙伴客户的 QA 负责人展示排序后的队列时,一致出现了三个反对意见。
抽象而言是真实的;实践中大多是错误的。该模型错过了人类的东西 专家 会发现 - 审查同一电话的合规审计员可能会发现模型未标记的微妙之处。但这种比较并不是针对专家。它反对主管随机抽取 2% 的通话。该模型评论 100%,并标记明显的 5%。专家审查这5%。
网络覆盖范围远好于旧系统。
也许是真的。任何引起关注的指标都会被利用。防御是双重的:分数是多维的,所以玩一个轴会把你推向另一个轴;并且该分数并非代理人的绩效考核。该分数是主管的分类信号。绩效评估是主管在听取实际电话后得出的结论。
我们将分数作为队列出售,而不是记分牌。
这也是事实,我们应该诚实地面对这一点。排名队列联络中心的主管花费更少的时间根据 30 行的规则对呼叫进行评分,而将更多的时间用于指导、升级和干预。喜欢旧工作的主管——其中有条不紊、以记分卡为导向的部分——不一定对新工作感到兴奋。
在发布之前,我们与设计合作伙伴运营负责人公开讨论了这一点。这是工作流程的改变,而不仅仅是工具的改变。
在专门运行排名队列 90 天的四个设计合作伙伴中,主管团队每周升级到保留或合规的呼叫数量比随机抽样时多 4.7 倍。这种增加并不是“更多审查”的影响;随机抽样在结构上几乎漏掉了所有的电话。
一位客户发现收债脚本出现偏差——一名代理在大约 9% 的电话中开始使用跨越 FDCPA 边界的语言——随机抽样已经 11 周没有出现。排名队列在漂移开始后 48 小时内就会浮出水面,因为这些特定呼叫的合规风险评分比客服人员的基线高出两个标准差。
另一位客户发现,随机抽样系统标记为绩效最低的座席实际上并不是绩效最低的员工,他们只是声音最大的员工。排名队列根据结果风险进行评级,确定了两个安静但始终表现不佳的座席,他们的呼叫以与其他人相同的速度进行采样,并落在“平均”堆中。
三件事,故意的。
我们不会对队列输出的代理进行自动评分。该分数是一个分类信号。代理绩效评级仍然由主管进行。我们故意让人类参与进来,不是因为模型无法做到这一点,而是因为我们已经看到足够多的自动评分系统侵蚀了信任,因此想要完全避免这种模式。
我们不会在通话期间向客服人员显示客服人员的实时分数。有一种观点认为,经纪人应该实时查看自己的教练分数。有一种更强烈的观点认为,这样做会降低通话质量。我们站在第二所学校一边。
默认情况下,我们不会将分数导出到绩效管理系统。想要将分数连接到单独的 HR 工具的客户可以通过显式配置来实现,但我们将默认设置作为更安全的选择。如果您想要电子表格上的数字,则必须特意询问。