Ajoxi
  • Pilar
    TELÉFONO EN LA NUBE

    Teléfono en la nube, mensajería, vídeo, fax, chat: la pila completa de UCaaS.

    • Número de teléfono virtualNúmeros locales y gratuitos, en cualquier lugar
    • Teléfono empresarialLlamadas, SMS, vídeo, un inicio de sesión
    • Compromiso del clienteCada canal, un hilo
    • IA personalCompañero de IA para cada repetición
    • SMS y MMSTexto de la línea de negocio principal.
    • Chat de equipoChat interno, vinculado a los clientes.
    • Reuniones por vídeoHabitaciones con notas de IA + resumen
    • Fax en líneaFax sin máquina de fax
    • Chatbot del sitio webResuelve automáticamente el estado del pedido y las devoluciones
    • Sistema telefónicoPBX moderno con IA integrada
    Presentado
    Todo incluido.
    Teléfono en la nube, centro de contacto con IA, recepcionista con IA, SMS, vídeo, más de 300 integraciones.
    Ver planes y precios
  • Capacidades principales
    • Recepcionista de IAPrimera respuesta 24 horas al día, 7 días a la semana · 32 idiomas
    • Sentimiento de la IAEnruta automáticamente a las personas que llaman molestas
    • Asistencia de agente de IAGuiones de susurros + siguiente mejor acción
    • Inteligencia de conversaciónTranscripciones, sentimiento, objeciones.
    • Grabación de llamadasFidelidad total + búsqueda de palabras clave
    • Asistente automáticoGenerador IVR visual de arrastrar y soltar
    • Herramientas de supervisorEscuchar · susurrar · barcaza · registro de auditoría
    • Números gratuitos800, 888, 877: aprovisionamiento rápido
    Nuevo
    Sentimiento de IA · puntuación en vivo.
    Las rutas molestan a los clientes hasta los agentes senior en el momento en que el sentimiento cae. En cada plan pago.
    Ver sentimiento de IA
  • Por industria y equipo
    • FinanzasSOC 2 · Pistas de auditoría listas para FINRA
    • MinoristaOmnicanal + SMS de recuperación de carrito
    • SaaSAPI + IA personal en cada asiento
    • LogísticaEnrutamiento de despacho multisitio
    • Equipos de ventasMarcador potente + entrenamiento de IA en vivo
    • Equipos de soporteMemoria compartida en 8 canales
    • Equipos remotosMismo número en todos los dispositivos
    • PYMERecepcionista con IA como su recepción
    • TI empresarialSSO, SCIM, gobernanza multisitio
    Más adoptados
    Fideicomisos de cumplimiento de una pila de llamadas.
    Grabación de llamadas, STIR/SHAKEN, enrutamiento de sentimientos. Pistas de auditoría listas para SOC 2, PCI y FINRA.
    Ver finanzas
  • Sincronización nativa
    • HubSpotSincronización bidireccional · activadores del ciclo de vida
    • ZohoCRM · Escritorio · Libros · Bigin
    Muy pronto
    Fuerza de ventas. Pipedrive. Ventas frescas.
    Las tres sincronizaciones bidireccionales nativas en el tercer trimestre de 2026. ¿Quieres un aviso sobre el lanzamiento?
    Envíeme un correo electrónico al iniciar
  • Precios
  • Aprender
    • BlogNotas de ingeniería y productos
    • Historias de clientesResultados reales, números reales
    • GuíasManuales paso a paso
    • Seminarios webEn vivo todos los jueves · bajo demanda
    • ContáctenosHable con ventas u obtenga soporte
    Construir
    • Documentoscomo funciona todo
    • Referencia APIDESCANSO + webhooks
    • SDKNodo, Python, Go, Ruby
    • Registro de cambiosCada barco, en un solo lugar
    Confianza
    • Página de estadoTiempo de actividad en vivo + incidentes
    • Seguridad + cumplimientoSOC 2 · RGPD · PCI
    • PrivacidadQué recopilamos y por qué
    • TérminosEl contrato, en capítulos
    tinta fresca
    8.400 llamadas medidas.
    Precisión de la recepcionista de IA por idioma, acento y tipo de llamada: los números sin editar.
    Leer la publicación
  • English flagInglés
  • Español flagEspañol
  • Français flagfrancés
  • Deutsch flagalemán
  • Italiano flagitaliano
  • Português flagportugués
  • Nederlands flagPaíses Bajos
  • Русский flagruso
  • Polski flagPolonia
  • Türkçe flagturco
  • العربية flagالعربية
  • हिन्दी flagहिन्दी
  • 简体中文 flag简体中文
  • 日本語 flag日本語
  • 한국어 flag한국어
  • Tiếng Việt flagTiếng Việt
  • Bahasa Indonesia flagBahasa Indonesia
  • ไทย flagไทย
  • Svenska flagSvenská
  • Українська flagUcrania
Iniciar sesiónPrueba gratuita
Teléfono en la nube
Número de teléfono virtualNúmeros locales y gratuitos, en cualquier lugarTeléfono empresarialLlamadas, SMS, vídeo, un inicio de sesiónCompromiso del clienteCada canal, un hiloIA personalCompañero de IA para cada repeticiónSMS y MMSTexto de la línea de negocio principal.Chat de equipoChat interno, vinculado a los clientes.Reuniones por vídeoHabitaciones con notas de IA + resumenFax en líneaFax sin máquina de faxChatbot del sitio webResuelve automáticamente el estado del pedido y las devolucionesSistema telefónicoPBX moderno con IA integrada
Centro de contacto
OmnicanalUna cola para cada canalMarcador salientePredictivo, potencia, vista previaAsistencia de agenteEntrenamiento de susurros en vivoAsistente de supervisorDetecta malas llamadas en tiempo realAnálisis de interacciónAuto-QA, tendencias de temasEmpresaMás de 500 operaciones de asiento
Familia de IA
Voz de AjoxiRecepcionista AI que reserva citasAsistente de IABorradores, resúmenes, seguimientos.IA de conversaciónLee cada llamada para que no te pierdas nada
Recepcionista de IAPrimera respuesta 24 horas al día, 7 días a la semana · 32 idiomasSentimiento de la IAEnruta automáticamente a las personas que llaman molestasAsistencia de agente de IAGuiones de susurros + siguiente mejor acciónInteligencia de conversaciónTranscripciones, sentimiento, objeciones.Grabación de llamadasFidelidad total + búsqueda de palabras claveAsistente automáticoGenerador IVR visual de arrastrar y soltarHerramientas de supervisorEscuchar · susurrar · barcaza · registro de auditoríaNúmeros gratuitos800, 888, 877: aprovisionamiento rápido
FinanzasSOC 2 · Pistas de auditoría listas para FINRAMinoristaOmnicanal + SMS de recuperación de carritoSaaSAPI + IA personal en cada asientoLogísticaEnrutamiento de despacho multisitioEquipos de ventasMarcador potente + entrenamiento de IA en vivoEquipos de soporteMemoria compartida en 8 canalesEquipos remotosMismo número en todos los dispositivosPYMERecepcionista con IA como su recepciónTI empresarialSSO, SCIM, gobernanza multisitio
HubSpotSincronización bidireccional · activadores del ciclo de vidaZohoCRM · Escritorio · Libros · Bigin
Aprender
BlogNotas de ingeniería y productosHistorias de clientesResultados reales, números realesGuíasManuales paso a pasoSeminarios webEn vivo todos los jueves · bajo demandaContáctenosHable con ventas u obtenga soporte
Construir
Documentoscomo funciona todoReferencia APIDESCANSO + webhooksSDKNodo, Python, Go, RubyRegistro de cambiosCada barco, en un solo lugar
Confianza
Página de estadoTiempo de actividad en vivo + incidentesSeguridad + cumplimientoSOC 2 · RGPD · PCIPrivacidadQué recopilamos y por quéTérminosEl contrato, en capítulos
  • English flagInglés
  • Español flagEspañol
  • Français flagfrancés
  • Deutsch flagalemán
  • Italiano flagitaliano
  • Português flagportugués
  • Nederlands flagPaíses Bajos
  • Русский flagruso
  • Polski flagPolonia
  • Türkçe flagturco
  • العربية flagالعربية
  • हिन्दी flagहिन्दी
  • 简体中文 flag简体中文
  • 日本語 flag日本語
  • 한국어 flag한국어
  • Tiếng Việt flagTiếng Việt
  • Bahasa Indonesia flagBahasa Indonesia
  • ไทย flagไทย
  • Svenska flagSvenská
  • Українська flagUcrania
Iniciar sesiónPrueba gratuita
Ajoxi

Teléfono en la nube y centro de contacto con IA en una red de nivel de operador.

SOC 2RGPDPCI-DSS

Suite C, Nivel 7, Torre World Trust,
50 Stanley Street, Centro,
Hong Kong

info@ajoxi.com+1 (512) 612-4425

Teléfono en la nube

  • Teléfono empresarial
  • Compromiso del cliente
  • SMS y MMS
  • Chat de equipo
  • Reuniones por vídeo
  • Sistema telefónico

Centro de contacto

  • Omnicanal
  • Marcador saliente
  • Asistencia de agente
  • Análisis de interacción
  • CCaaS empresarial

AI

  • Plataforma de IA
  • Recepcionista de IA
  • Asistente de IA
  • IA conversacional
  • Sentimiento de la IA
  • Inteligencia de conversación

Soluciones

  • Finanzas
  • Comercio minorista y comercio electrónico
  • SaaS y tecnología
  • Equipos de ventas
  • PYME

Revendedor

  • VoIP al por mayor
  • Venta al por mayor Voz
  • Enlace troncal SIP
  • Rutas CLI

Compañía

  • Precios
  • Acerca de
  • Clientes
  • Contáctenos
  • Códigos de país
  • Códigos de área
  • Documentos
  • Estado
  • Seguridad

© 2026 Ajoxi. Reservados todos los derechos.

Todos los sistemas normales
  • Privacidad
  • Términos
  • Mapa del sitio
Blog/Ingeniería/Misma latencia en mandarín e inglés. Así es como

Misma latencia en mandarín e inglés. Así es como

Lograr la paridad de latencia en 32 idiomas sin inflar el modelo requirió una capa de enrutamiento del modelo que no vimos venir. Notas de la sala de guerra de latencia.

Tabla de contenido
  • 1.Introducción
  • 2.Adónde van realmente los milisegundos
  • 3.La solución de enrutamiento
  • 4.El clasificador que nadie vio venir
  • 5.El lado TTS del problema
  • 6.Medir la paridad, no los promedios
  • 7.lo que sigue siendo lento
  • 8.Lo que haríamos diferente

Introducción

Nuestro producto de voz tuvo dos quejas que no pudimos conciliar internamente. Para los clientes empresariales de habla inglesa, la IA se sintió ágil. Para los clientes que hablaban mandarín (y cada vez más para los clientes que hablaban vietnamita, tagalo e hindi), la IA se sentía lenta. La brecha, medida de un extremo a otro desde el silencio de la persona que llama hasta la primera sílaba de la IA, fue de 260 ms en inglés y de 540 ms en mandarín. Ambos números estaban dentro del presupuesto de latencia publicado.

Sólo uno de ellos se sintió aceptable en una llamada telefónica.

El instinto de cualquier equipo de ingeniería que ve una brecha de latencia es trabajar en el modelo. Inferencia más rápida. Modelo más pequeño. Mejor cuantificación. Hicimos todo eso. Nos dio 60 ms en todos los ámbitos, lo que no cerró nada: la brecha relativa todavía estaba ahí y el inglés se mantuvo dos veces más rápido.

La verdadera solución provino de una observación diferente: tratábamos la latencia como un problema de modelo cuando en realidad era un problema de enrutamiento.

Adónde van realmente los milisegundos

Dividir la respuesta en mandarín de 540 ms en segmentos fue lo primero que aclaró el problema. La contabilidad se veía más o menos así:

  • Captura de audio y localización — 80 ms
  • Primer token de voz a texto — 140 ms
  • Canal de intención + recuperación — 90 ms
  • Primer token de modelo grande (generación) — 180 ms
  • Primer audio de texto a voz — 50 ms

En la ruta inglesa, los mismos segmentos llegaron a 80/60/90/80/40. Los dos segmentos que divergieron dramáticamente fueron la conversión de voz a texto y la generación de modelos grandes. STT fue más lento en mandarín porque el modelo acústico había sido entrenado con una ventana de contexto más larga (necesaria para la desambiguación tonal) que empujaba el primer token en 80 ms.

La generación del modelo fue más lenta porque el tokenizador produjo más tokens por carácter de significado equivalente en mandarín que en inglés.

Tampoco fue un defecto de modelo. Ambas eran compensaciones que habían sido acumuladas silenciosamente por equipos independientes que optimizaban sus propias métricas: STT para precisión, LLM para calidad de generación. El costo de latencia era real, pero no representaba las pérdidas y ganancias de nadie.

La solución de enrutamiento que compró 200 ms

Dejamos de enrutar todos los idiomas a través de un único LLM. En lugar de eso, construimos una fina capa de clasificación delante de la generación que detecta, en menos de 8 ms, tres cosas: el idioma de la expresión entrante, la clase de intención conversacional y si la solicitud es uno de los aproximadamente 40 patrones de alta frecuencia que identificamos al agrupar 2 millones de segmentos de llamadas.

Cuando el clasificador identifica un patrón de alta frecuencia en un idioma distinto del inglés, enrutamos la generación a un modelo más pequeño y especializado en el idioma que maneja ese patrón directamente. El modelo más pequeño se ha destilado en millones de terminaciones del mismo patrón, por lo que su calidad en esos caminos específicos está dentro del ruido del modelo grande, pero su latencia del primer token es aproximadamente un tercio.

Cuando el clasificador ve una intención de cola (cualquier cosa que no esté en los 40 patrones), la solicitud pasa al modelo grande, como antes. La mayor parte de la caída de la latencia se debe al hecho de que los patrones de alta frecuencia son también los patrones que representan ~78% del volumen de llamadas. Los casos de cola pagan la latencia original, pero son raros.

El clasificador que nadie vio venir

El clasificador fino era la parte del proyecto que nadie había presupuestado. Construirlo llevó más tiempo que construir el sistema de enrutamiento en sí, porque los modos de falla eran sutiles. Un clasificador que desvía erróneamente el 1% de las solicitudes a un modelo pequeño que no las maneja produce alucinaciones, no sólo respuestas degradadas.

Tres cosas hicieron que el clasificador funcionara. En primer lugar, se entrenó con tráfico de producción real, no con datos sintéticos. En segundo lugar, arrojó una puntuación de confianza que el enrutador podía alcanzar: cualquier nivel de confianza por debajo de 0,91 pasa automáticamente al modelo grande.

En tercer lugar, lo implementamos en la sombra durante seis semanas en el oleoducto existente, con el modelo grande proporcionando verdad sobre el terreno, antes de que el tráfico se dirigiera realmente a modelos pequeños.

La implementación en la sombra encontró cuatro clases de errores que el conjunto de pruebas fuera de línea no había detectado. Dos fueron fáciles de corregir en los datos de entrenamiento. Se requieren dos reglas de enrutamiento deliberadas: todo lo que toca la verificación de identidad, los pagos o la cancelación de citas siempre va al modelo grande, independientemente de la confianza del clasificador, porque el costo de una alucinación en esos caminos es mayor que la ganancia de latencia.

El lado TTS del problema

Mientras se revisaban los cambios de LLM y STT, un equipo paralelo estaba trabajando en la salida del discurso. El primer audio TTS de 50 ms en inglés fue efectivamente inmejorable; la brecha de 70 ms a 90 ms en la mayoría de los idiomas distintos del inglés se debió a modelos de voz más pequeños, un almacenamiento en caché menos agresivo y un único grupo de GPU compartido que priorizaba el inglés bajo carga.

Dividimos la infraestructura TTS en grupos fijados por idiomas. Mandarin TTS ahora se ejecuta en su propio grupo, con sus propias reglas de escalamiento, en hardware cercano a las regiones donde se origina la mayor parte de nuestro tráfico en mandarín. La latencia cayó de 70-90 ms a 45 ms a las dos semanas de la transición.

Nada de esto fue inteligente; era un trabajo de infraestructura que nadie se había molestado en hacer porque la mejora marginal en cualquier idioma no lo había justificado, de forma aislada.

La lección, y ahora la estamos anotando internamente, es que "no invertimos en esto porque ninguna métrica de cara al usuario lo justificaba" es exactamente el tipo de decisión que se acumula en una brecha de 280 ms entre dos idiomas durante cuatro años.

Medir la paridad, no los promedios

Un cambio pequeño pero importante que hicimos internamente fue la forma en que informa el panel de latencia del equipo. Solíamos realizar un seguimiento de p50 y p95 de la latencia de un extremo a otro, promediados en todos los idiomas, frente a un único SLO. El tablero se veía verde la mayor parte del tiempo.

El nuevo panel informa p50 y p95 por idioma contra un paridad SLO: la brecha entre el lenguaje admitido más lento y el más rápido tiene su propio presupuesto, que se aplica por separado. Establecimos el presupuesto de paridad en 60 ms. Cuando la brecha excede el presupuesto, se llama al personal de guardia.

El panel de paridad hace algo que el panel basado en promedios no podría: hace que las regresiones en el lenguaje más lento sean visibles con la misma urgencia que las regresiones en el lenguaje más rápido. Cuando se hace un promedio de 32 idiomas, una regresión de 200 ms en vietnamita mueve el promedio en 6 ms. Cuando mides la paridad, el tablero se mueve 200 ms.

lo que sigue siendo lento

Después del trabajo de enrutamiento, los grupos de TTS y el panel de paridad, nuestro peor idioma (cantonés, principalmente porque el corpus del modelo acústico de soporte es más pequeño) se sitúa en 320 ms. El inglés está a 220 ms. La brecha restante de 100 ms es real y sabemos aproximadamente dónde se encuentra: el modelo acústico cantonés STT es más antiguo y aún no tiene la nueva arquitectura, y lo volveremos a entrenar en el tercer trimestre.

Pero "el lenguaje más lento está 100 ms detrás del más rápido" es una conversación diferente a "el lenguaje más lento está 280 ms detrás del más rápido". La primera es una regresión conocida con una corrección trimestral prevista. Esta última fue una emergencia en la experiencia del cliente que no sabíamos que teníamos.

Qué haríamos diferente la próxima vez

Tres cosas, en orden de prioridad, si estuviéramos reconstruyendo la pila de latencia desde cero con lo que sabemos ahora.

  • Primero construya el clasificador-enrutador, luego el modelo. La capa de enrutamiento terminó siendo la pieza de mayor apalancamiento. Tratarlo como un "lo agregaremos más tarde si lo necesitamos" resultó significar que vivimos con latencia de modelo único durante 18 meses más de lo necesario.
  • Establezca SLO de paridad antes que los SLO de idioma. La tentación es establecer objetivos por idioma y dejar que surja la paridad. La paridad no surge; diverge, lentamente, en la dirección del idioma principal del equipo.
  • Utilice la infraestructura por idioma como si cada idioma fuera un producto independiente. Mandarin TTS merecía su propio grupo de GPU desde el primer día, no desde el día en que medimos la brecha de latencia.

Nada de esto es una investigación novedosa. Nada de eso requirió un documento. Requirió tratar la paridad de latencia como un compromiso de producto y luego financiar la poco glamorosa infraestructura para respaldar el compromiso. Tenemos la paridad que necesitamos ahora. No lo tuvimos durante cuatro años.

Ejecute su voz en Ajoxi.

Recepcionistas de IA, rutas mayoristas, números virtuales, todo ello integrado en una plataforma con precios transparentes y un NOC 24 horas al día, 7 días a la semana.

Ver precios Habla con nosotros
Sigue leyendo

Lectura relacionada

Próximas lecturas cuidadosamente seleccionadas del blog de Ajoxi.

We measured AI receptionist accuracy across 8,400 real calls
AI

Medimos la precisión de la recepcionista de IA en 8400 llamadas reales

Durante tres meses rastreamos cada llamada que manejaba la IA (por idioma, acento, tipo de llamada) y calificamos la transcripción frente a un revisor humano. Las cifras de precisión fueron mejores de lo que esperábamos. Los modos de falla fueron más interesantes.

Leer artículo
Why we ship STIR/SHAKEN attestation on day one
Cumplimiento

Por qué enviamos la certificación STIR/SHAKEN el primer día

La mayoría de los proveedores de teléfonos en la nube tratan la certificación de identificación de llamadas como una característica de nivel superior. Los transportistas no lo hacen. He aquí por qué lo hicimos predeterminado y qué cambió en las tasas de respuestas salientes.

Leer artículo
The case for ranking calls, not sampling them
Producto

El caso de clasificar las llamadas, no de muestrearlas

El muestreo aleatorio omite las llamadas que realmente importan. Reconstruimos la consola del supervisor en torno a una puntuación de riesgo y dejamos de pretender que el control de calidad era un juego de números.

Leer artículo