Ajoxi
  • 支柱
    云电话

    云电话、短信、视频、传真、聊天——完整的 UCaaS 堆栈。

    • 虚拟电话号码随时随地拨打本地和免费电话号码
    • 商务电话通话、短信、视频,一次登录
    • 客户参与每个通道,一个线程
    • 个人人工智能每个代表的人工智能助手
    • 短信和彩信主要业务线的文字
    • 团队聊天内部聊天,与客户联系在一起
    • 视频会议带 AI 笔记 + 回顾的房间
    • 在线传真无需传真机即可传真
    • 网站聊天机器人自动解决订单状态和退货
    • 电话系统内置 AI 的现代 PBX
    精选
    一切都包括在内。
    云电话、AI联络中心、AI接待员、短信、视频、300+集成。
    查看计划和定价
  • 核心能力
    • 人工智能接待员24/7 第一时间答复 · 32 种语言
    • 人工智能情感自动路由心烦意乱的呼叫者
    • AI代理协助Whisper 脚本 + 下一个最佳操作
    • 对话智能文字记录、情绪、反对意见
    • 通话录音全保真+关键词搜索
    • 自动总机拖放式可视化 IVR 构建器
    • 主管工具聆听·窃窃私语·驳船·审计日志
    • 免费电话号码800、888、877 — 快速配置
    新的
    AI情绪·实时评分。
    一旦情绪低落,路线就会让客户对高级代理商感到不安。在每个付费计划上。
    查看人工智能情绪
  • 按行业和团队
    • 金融SOC 2 · FINRA 就绪审计跟踪
    • 零售全渠道+购物车恢复短信
    • 软件即服务每个席位上的 API + 个人人工智能
    • 后勤多站点调度路由
    • 销售团队强力拨号+实时AI辅导
    • 支持团队8 个通道共享内存
    • 远程团队每台设备上的号码相同
    • 中小企业AI接待员充当您的前台
    • 企业ITSSO、SCIM、多站点治理
    大多数采用
    调用堆栈合规性信任。
    通话录音、搅拌/震动、情绪路由。 SOC 2、PCI 和 FINRA 就绪审计跟踪。
    查看金融
  • 本机同步
    • 枢纽点双向同步·生命周期触发器
    • 佐霍CRM · 办公桌 · 书籍 · Bigin
    即将推出
    销售人员。管道传动。新鲜销售。
    所有三个本机双向同步将于 2026 年第三季度进行。想要在发布时预先了解吗?
    发布时给我发电子邮件
  • 定价
  • 学习
    • 博客工程和产品说明
    • 客户案例真实的结果,真实的数字
    • 指南分步剧本
    • 网络研讨会每周四直播·点播
    • 联系我们与销售人员交谈或获取支持
    建造
    • 文档一切如何运作
    • API参考REST + 网络钩子
    • 软件开发工具包节点、Python、Go、Ruby
    • 变更日志每艘船,在一个地方
    相信
    • 状态页实时正常运行时间 + 事件
    • 安全+合规SOC 2 · GDPR · PCI
    • 隐私我们收集什么以及为什么
    • 条款合同,分章节
    鲜墨
    实测 8,400 个呼叫。
    AI 接待员按语言、口音和呼叫类型的准确性(未经编辑的数字)。
    阅读帖子
  • English flag英语
  • Español flag西班牙语
  • Français flag法国人
  • Deutsch flag德语
  • Italiano flag意大利人
  • Português flag葡萄牙语
  • Nederlands flag荷兰
  • Русский flag俄罗斯
  • Polski flag波尔斯基
  • Türkçe flag图尔克切
  • العربية flag巴黎
  • हिन्दी flagहिन्दी
  • 简体中文 flag简体中文
  • 日本語 flag日本语
  • 한국어 flag한국어
  • Tiếng Việt flag越南
  • Bahasa Indonesia flag印度尼西亚语
  • ไทย flagไทย
  • Svenska flag斯文斯卡
  • Українська flagУкраїнська
登入免费试用
云手机
虚拟电话号码随时随地拨打本地和免费电话号码商务电话通话、短信、视频,一次登录客户参与每个通道,一个线程个人人工智能每个代表的人工智能助手短信和彩信主要业务线的文字团队聊天内部聊天,与客户联系在一起视频会议带 AI 笔记 + 回顾的房间在线传真无需传真机即可传真网站聊天机器人自动解决订单状态和退货电话系统内置 AI 的现代 PBX
联络中心
全渠道每个通道一个队列外拨拨号器预测、力量、预览代理协助现场耳语辅导主管协助实时发现不良电话互动分析自动质量检查、主题趋势企业500+ 座位操作
人工智能家族
阿约西语音AI接待员预约人工智能助手草稿、摘要、后续行动对话人工智能阅读每个电话,这样您就不会错过任何事情
人工智能接待员24/7 第一时间答复 · 32 种语言人工智能情感自动路由心烦意乱的呼叫者AI代理协助Whisper 脚本 + 下一个最佳操作对话智能文字记录、情绪、反对意见通话录音全保真+关键词搜索自动总机拖放式可视化 IVR 构建器主管工具聆听·窃窃私语·驳船·审计日志免费电话号码800、888、877 — 快速配置
金融SOC 2 · FINRA 就绪审计跟踪零售全渠道+购物车恢复短信软件即服务每个席位上的 API + 个人人工智能后勤多站点调度路由销售团队强力拨号+实时AI辅导支持团队8 个通道共享内存远程团队每台设备上的号码相同中小企业AI接待员充当您的前台企业ITSSO、SCIM、多站点治理
枢纽点双向同步·生命周期触发器佐霍CRM · 办公桌 · 书籍 · Bigin
学习
博客工程和产品说明客户案例真实的结果,真实的数字指南分步剧本网络研讨会每周四直播·点播联系我们与销售人员交谈或获取支持
建造
文档一切如何运作API参考REST + 网络钩子软件开发工具包节点、Python、Go、Ruby变更日志每艘船,在一个地方
相信
状态页实时正常运行时间 + 事件安全+合规SOC 2 · GDPR · PCI隐私我们收集什么以及为什么条款合同,分章节
  • English flag英语
  • Español flag西班牙语
  • Français flag法国人
  • Deutsch flag德语
  • Italiano flag意大利人
  • Português flag葡萄牙语
  • Nederlands flag荷兰
  • Русский flag俄罗斯
  • Polski flag波尔斯基
  • Türkçe flag图尔克切
  • العربية flag巴黎
  • हिन्दी flagहिन्दी
  • 简体中文 flag简体中文
  • 日本語 flag日本语
  • 한국어 flag한국어
  • Tiếng Việt flag越南
  • Bahasa Indonesia flag印度尼西亚语
  • ไทย flagไทย
  • Svenska flag斯文斯卡
  • Українська flagУкраїнська
登入免费试用
Ajoxi

云电话和人工智能联络中心在同一个运营商级网络上。

SOC 2通用数据保护条例PCI-DSS

世界信托大厦 7 楼 C 室
中环士丹利街50号
香港

info@ajoxi.com+1 (512) 612-4425

云手机

  • 商务电话
  • 客户参与
  • 短信和彩信
  • 团队聊天
  • 视频会议
  • 电话系统

联络中心

  • 全渠道
  • 外拨拨号器
  • 代理协助
  • 互动分析
  • 企业CCaaS

人工智能

  • 人工智能平台
  • 人工智能接待员
  • 人工智能助手
  • 对话式人工智能
  • 人工智能情感
  • 对话智能

解决方案

  • 金融
  • 零售与电子商务
  • SaaS 与技术
  • 销售团队
  • 中小企业

经销商

  • 批发网络电话
  • 批发语音
  • SIP 集群
  • CLI 路由

公司

  • 定价
  • 关于
  • 顾客
  • 联系我们
  • 国家/地区代码
  • 区号
  • 文档
  • 地位
  • 安全

© 2026 阿约西。版权所有。

各系统正常
  • 隐私
  • 条款
  • 网站地图
博客/工程/普通话和英语的延迟相同。这是如何

普通话和英语的延迟相同。这是如何

要在 32 种语言之间实现延迟平价而不使模型膨胀,需要一个我们没有预见到的模型路由层。来自延迟作战室的笔记。

目录
  • 1.介绍
  • 2.毫秒实际上去了哪里
  • 3.路由修复
  • 4.无人预见的分类器即将到来
  • 5.TTS 方面的问题
  • 6.测量奇偶性,而不是平均值
  • 7.还慢什么
  • 8.我们会采取什么不同的做法

介绍

我们的语音产品有两个我们无法在内部协调的投诉。对于说英语的企业客户来说,人工智能感觉很敏捷。对于说普通话的客户,以及越来越多的说越南语、他加禄语和印地语的客户来说,人工智能感觉很迟缓。从呼叫者沉默到 AI 第一个音节的端到端测量结果显示,英语的差距为 260 毫秒,普通话的差距为 540 毫秒。这两个数字都在公布的延迟预算之内。

只有一个人在电话中感到可以接受。

任何看到延迟差距的工程团队都会本能地研究模型。更快的推理。较小的型号。更好的量化。我们做了所有这些。它为我们带来了 60 毫秒的整体时间,但没有缩小任何结果——相对差距仍然存在,而英语的速度仍然是两倍。

真正的解决方案来自不同的观察:我们将延迟视为模型问题,而实际上它是一个路由问题。

毫秒实际上去了哪里

将 540 毫秒的普通话响应分成几段是澄清问题的第一件事。会计看起来大致是这样的:

  • 音频捕获和端点 — 80 毫秒
  • 语音转文本第一个标记 — 140 毫秒
  • 意图+检索管道 — 90 毫秒
  • 大模型第一代币(代) — 180 毫秒
  • 文本转语音第一音频 — 50 毫秒

在英语路径上,相同的部分得分为 80 / 60 / 90 / 80 / 40。显着不同的两个部分是语音到文本和大型模型生成。 STT 在普通话中速度较慢,因为声学模型是用较长的上下文窗口(对于音调消歧所必需的)进行训练的,这将第一个标记推了 80 毫秒。

模型生成速度较慢,因为标记器在普通话中为每个具有相同含义的字符生成的标记比在英语中更多。

两者都不是模型缺陷。两者都是独立团队为了优化自己的指标而悄悄积累的权衡——STT 代表准确性,LLM 代表发电质量。延迟成本是真实存在的,但这不是任何人的损益。

花费 200 毫秒的路由修复

我们不再通过单一的法学硕士来路由所有语言。相反,我们在生成之前构建了一个薄分类层,可在 8 毫秒内检测三件事:传入话语的语言、对话意图类别,以及请求是否是我们通过对 2M 呼叫段进行聚类而识别的约 40 种高频模式之一。

当分类器识别出非英语语言中的高频模式时,我们会将生成路由到一个更小的、专门用于直接处理该模式的语言专用模型。较小的模型是在相同模式的数百万次完成中提炼出来的,因此它在这些特定路径上的质量在大模型的噪声范围内 - 但它的第一个令牌延迟大约是三分之一。

当分类器看到尾部意图(任何不属于 40 种模式的内容)时,请求就会落入大模型,就像以前一样。大部分延迟下降来自于高频模式 还 占通话量约 78% 的模式。尾部情况会支付原始延迟,但这种情况很少见。

无人预见的分类器即将到来

薄分类器是该项目的一部分,没有人为其做预算。构建它比构建路由系统本身花费的时间更长,因为故障模式很微妙。如果分类器将 1% 的请求错误路由到不处理这些请求的小模型,那么它会产生幻觉,而不仅仅是降低响应。

三件事使分类器发挥作用。首先,它是根据实际生产流量而不是合成数据进行训练的。其次,它返回了路由器可以设定的置信度分数——任何低于 0.91 置信度的值都会自动进入大模型。

第三,我们在现有管道上进行了六周的影子部署,在任何流量实际路由到小模型之前,大模型提供了地面实况。

影子部署发现了离线测试集遗漏的四类错误。其中两个很容易在训练数据中修复。两个必需的深思熟虑的路由规则——任何涉及身份验证、支付或预约取消的事情总是会进入大模型,无论分类器的置信度如何,因为这些路径上的幻觉成本高于延迟胜利。

TTS 方面的问题

当 LLM 和 STT 变更正在接受审核时,一个并行团队正在研究演讲输出。 50 毫秒的 TTS 英语首音频实际上是无与伦比的;大多数非英语语言的 70 毫秒到 90 毫秒的差距是由较小的语音模型、不太积极的缓存以及在负载下优先考虑英语的单个共享 GPU 池驱动的。

我们将 TTS 基础设施划分为语言固定池。普通话 TTS 现在在靠近我们大多数普通话流量来源地区的硬件上运行自己的池,具有自己的扩展规则。切换后两周内,延迟从 70-90 毫秒降至 45 毫秒。

这一切都不聪明。这是基础设施工作,没有人愿意做,因为任何单一语言的边际进步单独来看都不足以证明其合理性。

我们现在在内部写下的教训是,“我们没有对此进行投资,因为没有任何一个面向用户的指标可以证明它是合理的”,正是这种决定导致了四年来两种语言之间 280 毫秒的差距。

测量奇偶性,而不是平均值

我们在内部做出的一项虽小但意义重大的改变是团队延迟仪表板报告的方式。我们曾经根据单个 SLO 跟踪所有语言的平均端到端延迟的 p50 和 p95。仪表板大部分时间看起来都是绿色的。

新的仪表板报告 p50 和 p95 每种语言 反对 平价 SLO——支持的最慢和最快语言之间的差距有自己的预算,单独执行。我们将奇偶预算设置为 60 毫秒。当差距超出预算时,值班人员就会接到传呼。

奇偶校验仪表板做了基于平均值的仪表板无法做到的事情:它使最慢语言的回归与最快语言的回归具有同样的紧迫性。当对 32 种语言进行平均时,越南语的 200 毫秒回归会使平均值移动 6 毫秒。当您测量奇偶校验时,仪表板会移动 200 毫秒。

还慢什么

经过路由工作、TTS 池和奇偶校验仪表板后,我们最差的语言(粤语,主要是因为支持的声学模型语料库较小)为 320 毫秒。英语为220ms。剩下的 100 毫秒差距是真实存在的,我们大致知道它的位置 - 粤语 STT 声学模型较旧,尚未在新架构上使用,我们将在第三季度重新训练它。

但“最慢的语言落后最快的语言 100 毫秒”与“最慢的语言落后最快的语言 280 毫秒”是不同的对话。前者是已知的回归,计划每季度修复一次。后者是我们不知道的客户体验紧急情况。

下次我们会采取什么不同的做法

如果我们用我们现在所知道的从头开始重建延迟堆栈,那么三件事按优先顺序排列。

  • 首先构建分类器路由器,然后构建模型。路由层最终成为影响力最高的部分。将其视为“如果我们需要的话,我们稍后会添加它”,结果意味着我们的单模型延迟时间比我们需要的时间长了 18 个月。
  • 在语言 SLO 之前设置奇偶校验 SLO。诱惑是为每种语言设定目标并让平等出现。平等并没有出现;它慢慢地朝着团队主要语言的方向发散。
  • 为每种语言的基础设施提供资源,就像每种语言是一个单独的产品一样。 Mandarin TTS 从第一天起就应该拥有自己的 GPU 池,而不是从我们测量延迟差距的那一天开始。

这些都不是新颖的研究。这些都不需要纸质文件。它需要将延迟平价视为一项产品承诺,然后为乏味的基础设施提供资金以支持该承诺。我们现在拥有我们需要的平等。我们已经四年没有得到它了。

在 Ajoxi 上发出你的声音。

人工智能接待员、批发路线、虚拟号码——构建在一个平台上,具有透明的定价和 24/7 NOC。

查看定价 与我们交谈
继续阅读

相关阅读

从 Ajoxi 博客中精心挑选的下一篇文章。

We measured AI receptionist accuracy across 8,400 real calls
人工智能

我们通过 8,400 个真实通话测量了 AI 接待员的准确性

在三个月的时间里,我们跟踪了人工智能处理的每一个电话——按语言、口音、电话类型——并根据人类审阅者对文字记录进行评分。准确率数字比我们预期的要好。故障模式更有趣。

阅读文章
Why we ship STIR/SHAKEN attestation on day one
遵守

为什么我们在第一天就提供 STIR/SHAKEN 证明

大多数云电话供应商将呼叫者 ID 认证视为一项更高级别的功能。运营商没有。以下是我们将其设置为默认值的原因以及它对出站应答率的更改。

阅读文章
The case for ranking calls, not sampling them
产品

对调用进行排名而不是对其进行采样的情况

随机抽样会错过真正重要的调用。我们围绕风险评分重建了主管控制台,并不再假装 QA 是一场数字游戏。

阅读文章