Ajoxi
  • Pilastro
    TELEFONO NUVOLA

    Telefono cloud, messaggistica, video, fax, chat: lo stack UCaaS completo.

    • Numero di telefono virtualeNumeri locali e verdi, ovunque
    • Telefono aziendaleChiamate, SMS, video, un accesso
    • Coinvolgimento del clienteOgni canale, un thread
    • IA personaleAssistente AI per ogni ripetizione
    • SMS e MMSTesto dalla linea di business principale
    • Chat di squadraChat interna, legata ai clienti
    • Riunioni videoStanze con note AI + riepilogo
    • Fax in lineaFax senza fax
    • Chatbot del sito webRisolve automaticamente lo stato degli ordini e i resi
    • Sistema telefonicoPBX moderno con AI integrata
    In primo piano
    Tutto incluso.
    Telefono cloud, contact center AI, receptionist AI, SMS, video, oltre 300 integrazioni.
    Vedi piani e prezzi
  • Capacità fondamentali
    • Receptionist dell'AIPrima risposta 24 ore su 24, 7 giorni su 7 · 32 lingue
    • Sentimento dell'IAInstrada automaticamente i chiamanti turbati
    • Assistenza dell'agente AIScript sussurrati + azione successiva
    • Intelligenza della conversazioneTrascrizioni, sentimenti, obiezioni
    • Registrazione delle chiamateFedeltà completa + ricerca per parole chiave
    • Assistente automaticoGeneratore IVR visivo con trascinamento della selezione
    • Strumenti del supervisoreAscolta · sussurra · chiatta · registro di controllo
    • Numeri gratuiti800, 888, 877: provisioning rapido
    Nuovo
    Sentimento AI · punteggi in tempo reale.
    Indirizza i clienti sconvolti agli agenti senior nel momento in cui il sentiment diminuisce. Su ogni piano a pagamento.
    Vedi Sentimento dell'IA
  • Per settore e team
    • FinanzaSOC 2 · Tracce di controllo predisposte per FINRA
    • Vedere al dettaglioSMS omnicanale + recupero carrello
    • SaaSAPI + IA personale su ogni posto
    • LogisticaRouting di spedizione multisito
    • Squadre di venditaDialer potente + coaching AI dal vivo
    • Squadre di supportoMemoria condivisa su 8 canali
    • Team remotiLo stesso numero su ogni dispositivo
    • PMIReceptionist AI come reception
    • IT aziendaleSSO, SCIM, governance multisito
    I più adottati
    Si fida della conformità dello stack chiamante.
    Registrazione delle chiamate, STIR/SHAKEN, sentiment routing. Audit trail predisposti per SOC 2, PCI e FINRA.
    Vedi finanza
  • Sincronizzazione nativa
    • HubSpotSincronizzazione bidirezionale · trigger del ciclo di vita
    • ZohoCRM · Scrivania · Libri · Bigin
    Prossimamente
    Salesforce. Pipedrive. Fresche vendite.
    Tutte e tre le sincronizzazioni bidirezionali native nel terzo trimestre del 2026. Vuoi un avviso al lancio?
    Inviami un'e-mail al momento del lancio
  • Prezzi
  • Imparare
    • BlogNote tecniche e di prodotto
    • Storie dei clientiRisultati reali, numeri reali
    • GuidePlaybook passo dopo passo
    • WebinarIn diretta ogni giovedì · on-demand
    • ContattaciParla con le vendite o ottieni supporto
    Costruire
    • DocumentiCome funziona tutto
    • Riferimento APIRESTO + webhook
    • SDKNodo, Python, Go, Ruby
    • Registro delle modificheOgni nave, in un unico posto
    Fiducia
    • Pagina di statoTempo di attività in tempo reale + incidenti
    • Sicurezza + conformitàSOC 2 · GDPR · PCI
    • PrivacyCosa raccogliamo e perché
    • TerminiIl contratto, in capitoli
    Inchiostro fresco
    8.400 chiamate, misurate.
    Precisione dell'addetto alla reception AI per lingua, accento e tipo di chiamata: i numeri non modificati.
    Leggi il messaggio
  • English flagInglese
  • Español flagEspañol
  • Français flagFrancese
  • Deutsch flagTedesco
  • Italiano flagItaliano
  • Português flagPortuguês
  • Nederlands flagPaesi Bassi
  • Русский flagRusso
  • Polski flagPolski
  • Türkçe flagTürkçe
  • العربية flagالعربية
  • हिन्दी flagहिन्दी
  • 简体中文 flag简体中文
  • 日本語 flag日本語
  • 한국어 flag한국어
  • Tiếng Việt flagTiếng Việt
  • Bahasa Indonesia flagBahasa Indonesia
  • ไทย flagsì
  • Svenska flagSvenska
  • Українська flagУкраїнська
RegistrazioneProva gratuita
Telefono nuvola
Numero di telefono virtualeNumeri locali e verdi, ovunqueTelefono aziendaleChiamate, SMS, video, un accessoCoinvolgimento del clienteOgni canale, un threadIA personaleAssistente AI per ogni ripetizioneSMS e MMSTesto dalla linea di business principaleChat di squadraChat interna, legata ai clientiRiunioni videoStanze con note AI + riepilogoFax in lineaFax senza faxChatbot del sito webRisolve automaticamente lo stato degli ordini e i resiSistema telefonicoPBX moderno con AI integrata
Centro contatti
OmnicanaleUna coda per ogni canaleDialer in uscitaPredittiva, potenza, anteprimaAgente AssistenteCoaching sussurro dal vivoAssistente supervisoreIndividua le chiamate sbagliate in tempo realeAnalisi delle interazioniAuto-QA, tendenze degli argomentiImpresaOperazioni con oltre 500 posti
Famiglia AI
Voce AjoxiReceptionist AI che prenota gli appuntamentiAssistente AIBozze, sintesi, follow-upConversazione AILegge ogni chiamata per non perdere nulla
Receptionist dell'AIPrima risposta 24 ore su 24, 7 giorni su 7 · 32 lingueSentimento dell'IAInstrada automaticamente i chiamanti turbatiAssistenza dell'agente AIScript sussurrati + azione successivaIntelligenza della conversazioneTrascrizioni, sentimenti, obiezioniRegistrazione delle chiamateFedeltà completa + ricerca per parole chiaveAssistente automaticoGeneratore IVR visivo con trascinamento della selezioneStrumenti del supervisoreAscolta · sussurra · chiatta · registro di controlloNumeri gratuiti800, 888, 877: provisioning rapido
FinanzaSOC 2 · Tracce di controllo predisposte per FINRAVedere al dettaglioSMS omnicanale + recupero carrelloSaaSAPI + IA personale su ogni postoLogisticaRouting di spedizione multisitoSquadre di venditaDialer potente + coaching AI dal vivoSquadre di supportoMemoria condivisa su 8 canaliTeam remotiLo stesso numero su ogni dispositivoPMIReceptionist AI come receptionIT aziendaleSSO, SCIM, governance multisito
HubSpotSincronizzazione bidirezionale · trigger del ciclo di vitaZohoCRM · Scrivania · Libri · Bigin
Imparare
BlogNote tecniche e di prodottoStorie dei clientiRisultati reali, numeri realiGuidePlaybook passo dopo passoWebinarIn diretta ogni giovedì · on-demandContattaciParla con le vendite o ottieni supporto
Costruire
DocumentiCome funziona tuttoRiferimento APIRESTO + webhookSDKNodo, Python, Go, RubyRegistro delle modificheOgni nave, in un unico posto
Fiducia
Pagina di statoTempo di attività in tempo reale + incidentiSicurezza + conformitàSOC 2 · GDPR · PCIPrivacyCosa raccogliamo e perchéTerminiIl contratto, in capitoli
  • English flagInglese
  • Español flagEspañol
  • Français flagFrancese
  • Deutsch flagTedesco
  • Italiano flagItaliano
  • Português flagPortuguês
  • Nederlands flagPaesi Bassi
  • Русский flagRusso
  • Polski flagPolski
  • Türkçe flagTürkçe
  • العربية flagالعربية
  • हिन्दी flagहिन्दी
  • 简体中文 flag简体中文
  • 日本語 flag日本語
  • 한국어 flag한국어
  • Tiếng Việt flagTiếng Việt
  • Bahasa Indonesia flagBahasa Indonesia
  • ไทย flagsì
  • Svenska flagSvenska
  • Українська flagУкраїнська
RegistrazioneProva gratuita
Ajoxi

Telefono cloud e contact center AI su un'unica rete carrier-grade.

SOC2GDPRPCI-DSS

Suite C, Livello 7, Torre del World Trust,
50 Stanley Street, Centrale,
Hong Kong

info@ajoxi.com+1 (512) 612-4425

Telefono nuvola

  • Telefono aziendale
  • Coinvolgimento del cliente
  • SMS e MMS
  • Chat di squadra
  • Riunioni video
  • Sistema telefonico

Centro contatti

  • Omnicanale
  • Dialer in uscita
  • Agente Assistente
  • Analisi delle interazioni
  • CCaaS aziendale

AI

  • Piattaforma IA
  • Receptionist dell'AI
  • Assistente AI
  • IA conversazionale
  • Sentimento dell'IA
  • Intelligenza della conversazione

Soluzioni

  • Finanza
  • Vendita al dettaglio ed eCom
  • SaaS e tecnologia
  • Squadre di vendita
  • PMI

Rivenditore

  • VoIP all'ingrosso
  • Voce all'ingrosso
  • Trunk SIP
  • Percorsi CLI

Azienda

  • Prezzi
  • Di
  • Clienti
  • Contattaci
  • Codici Paese
  • Codici di zona
  • Documenti
  • Stato
  • Sicurezza

© 2026 Ajoxi. Tutti i diritti riservati.

Tutti i sistemi normali
  • Privacy
  • Termini
  • Mappa del sito
Blog/Ingegneria/Stessa latenza in mandarino e inglese. Ecco come

Stessa latenza in mandarino e inglese. Ecco come

Raggiungere la parità di latenza in 32 lingue senza gonfiare il modello richiedeva un livello di routing del modello che non avevamo previsto. Appunti dalla stanza della guerra della latenza.

Sommario
  • 1.Introduzione
  • 2.Dove vanno effettivamente i millisecondi
  • 3.La correzione del routing
  • 4.Il classificatore che nessuno si aspettava
  • 5.Il lato TTS del problema
  • 6.Misurare la parità, non le medie
  • 7.Ciò che è ancora lento
  • 8.Cosa faremmo diversamente

Introduzione

Il nostro prodotto vocale presentava due reclami che non riuscivamo a conciliare internamente. Dai clienti aziendali di lingua inglese, l'intelligenza artificiale è sembrata scattante. Dai clienti di lingua mandarina – e sempre più da clienti di lingua vietnamita, tagalog e hindi – l’intelligenza artificiale sembrava lenta. Il divario, misurato end-to-end dal silenzio del chiamante alla prima sillaba dell’IA, è stato di 260 ms in inglese e 540 ms in mandarino. Entrambi i numeri rientravano nel budget di latenza pubblicato.

Solo uno di loro si sentiva accettabile durante una telefonata.

L'istinto di qualsiasi team di ingegneri che vede un gap di latenza è quello di perfezionare il modello. Inferenza più rapida. Modello più piccolo. Migliore quantizzazione. Abbiamo fatto tutto questo. Ci ha fruttato 60 ms su tutta la linea, il che non ha chiuso nulla: il divario relativo era ancora lì e l’inglese è rimasto due volte più veloce.

La vera soluzione è arrivata da un'osservazione diversa: trattavamo la latenza come un problema modello quando in realtà era un problema di routing.

Dove vanno effettivamente i millisecondi

Suddividere in segmenti la risposta in mandarino da 540 ms è stata la prima cosa che ha chiarito il problema. La contabilità era più o meno questa:

  • Acquisizione ed endpointing dell'audio — 80 ms
  • Primo token di sintesi vocale — 140 ms
  • Intento + pipeline di recupero — 90 ms
  • Primo token modello grande (generazione) — 180ms
  • Primo audio della sintesi vocale — 50 ms

Nel percorso inglese, gli stessi segmenti arrivavano a 80 / 60 / 90 / 80 / 40. I due segmenti che divergevano notevolmente erano il parlato in testo e la generazione di modelli di grandi dimensioni. STT era più lento in mandarino perché il modello acustico era stato addestrato con una finestra di contesto più lunga – necessaria per la disambiguazione tonale – che spingeva il primo token di 80 ms.

La generazione del modello è stata più lenta perché il tokenizzatore ha prodotto più token per carattere di significato equivalente in mandarino che in inglese.

Nessuno dei due era un difetto del modello. Entrambi erano compromessi accumulati silenziosamente da team indipendenti che ottimizzavano i propri parametri: STT per l'accuratezza, LLM per la qualità della generazione. Il costo della latenza era reale, ma non era il profitto di nessuno.

La correzione del routing che ha acquistato 200 ms

Abbiamo smesso di instradare tutte le lingue attraverso un singolo LLM. Invece, abbiamo creato un sottile strato di classificazione davanti alla generazione che rileva, in meno di 8 ms, tre cose: la lingua dell'espressione in arrivo, la classe dell'intento conversazionale e se la richiesta è uno dei circa 40 modelli ad alta frequenza che abbiamo identificato raggruppando segmenti di chiamata da 2 milioni.

Quando il classificatore identifica un modello ad alta frequenza in una lingua diversa dall'inglese, indirizziamo la generazione a un modello più piccolo, specializzato nella lingua, che gestisce direttamente quel modello. Il modello più piccolo è stato distillato su milioni di completamenti dello stesso modello, quindi la sua qualità su quei percorsi specifici rientra nel rumore del modello più grande, ma la sua latenza del primo token è circa un terzo.

Quando il classificatore rileva un intento di coda (qualcosa che non rientra nei 40 modelli) la richiesta passa al modello grande, proprio come prima. La maggior parte del calo di latenza deriva dal fatto che i modelli ad alta frequenza lo sono Anche i modelli che rappresentano circa il 78% del volume delle chiamate. I casi di coda pagano la latenza originale, ma sono rari.

Il classificatore che nessuno si aspettava

Il classificatore sottile era la parte del progetto per la quale nessuno aveva previsto un budget. Costruirlo ha richiesto più tempo che costruire il sistema di routing stesso, perché le modalità di fallimento erano sottili. Un classificatore che indirizza erroneamente l'1% delle richieste a un modello di piccole dimensioni che non le gestisce produce allucinazioni, non solo risposte degradate.

Tre cose facevano funzionare il classificatore. Innanzitutto, è stato addestrato sul traffico di produzione reale, non sui dati sintetici. In secondo luogo, ha restituito un punteggio di confidenza che il router può superare: qualsiasi valore di confidenza inferiore a 0,91 passa automaticamente al modello grande.

In terzo luogo, lo abbiamo implementato in modalità shadow per sei settimane rispetto al gasdotto esistente, con il modello grande che forniva la verità sul campo, prima che il traffico venisse effettivamente instradato verso modelli piccoli.

La distribuzione shadow ha rilevato quattro classi di errori non rilevati dal set di test offline. Due erano facili da correggere nei dati di addestramento. Sono necessarie due regole di instradamento deliberate: tutto ciò che riguarda la verifica dell'identità, i pagamenti o la cancellazione di un appuntamento va sempre al grande modello indipendentemente dalla fiducia del classificatore, perché il costo di un'allucinazione su quei percorsi è superiore alla vittoria della latenza.

Il lato TTS del problema

Mentre le modifiche LLM e STT venivano esaminate, un team parallelo stava lavorando sull'output vocale. Il primo audio TTS da 50 ms in inglese era effettivamente imbattibile; il divario di 70 ms-90 ms sulla maggior parte delle lingue diverse dall'inglese è stato causato da modelli vocali più piccoli, caching meno aggressivo e un unico pool di GPU condiviso che dava priorità all'inglese sotto carico.

Abbiamo diviso l'infrastruttura TTS in pool bloccati in base alla lingua. Mandarin TTS ora funziona su un proprio pool, con le proprie regole di dimensionamento, su hardware vicino alle regioni da cui ha origine la maggior parte del nostro traffico Mandarin. La latenza è scesa da 70-90 ms a 45 ms entro due settimane dal cutover.

Niente di tutto questo era intelligente; si trattava di un lavoro infrastrutturale che nessuno si era preso la briga di fare perché il miglioramento marginale su ogni singola lingua non lo aveva, di per sé, giustificato.

La lezione - e ora la stiamo scrivendo internamente - è che "non abbiamo investito in questo perché nessun singolo parametro rivolto all'utente lo giustificava" è esattamente il tipo di decisione che si traduce in un divario di 280 ms tra due lingue in quattro anni.

Misurare la parità, non le medie

Una piccola ma significativa modifica che abbiamo apportato internamente riguardava il modo in cui viene riportato il dashboard sulla latenza del team. In passato monitoravamo i valori p50 e p95 della latenza end-to-end, calcolati in media su tutte le lingue, rispetto a un singolo SLO. Il cruscotto sembrava verde per la maggior parte del tempo.

La nuova dashboard riporta p50 e p95 per lingua contro a parità SLO: il divario tra la lingua supportata più lenta e quella più veloce ha un proprio budget, applicato separatamente. Impostiamo il budget di parità a 60 ms. Quando il divario supera il budget, il reperibile viene chiamato.

Il dashboard di parità fa qualcosa che quello basato sulla media non potrebbe fare: rende visibili le regressioni nella lingua più lenta con la stessa urgenza delle regressioni in quella più veloce. Quando si calcola la media su 32 lingue, una regressione di 200 ms in vietnamita sposta la media di 6 ms. Quando misuri la parità, la dashboard si sposta di 200 ms.

Ciò che è ancora lento

Dopo il lavoro di routing, i pool TTS e il dashboard di parità, la nostra lingua peggiore (il cantonese, principalmente perché il corpus del modello acustico di supporto è più piccolo) si attesta a 320 ms. L'inglese è a 220ms. Il restante divario di 100 ms è reale e sappiamo più o meno dove si trova: il modello acustico cantonese STT è più vecchio e non è ancora sulla nuova architettura, e lo riqualificheremo nel terzo trimestre.

Ma "la lingua più lenta è 100 ms indietro rispetto alla più veloce" è una conversazione diversa da "la lingua più lenta è 280 ms indietro rispetto alla più veloce". La prima è una regressione nota con una correzione trimestrale pianificata. Quest'ultima era un'emergenza relativa all'esperienza del cliente che non sapevamo di avere.

Cosa faremmo diversamente la prossima volta

Tre cose, in ordine di priorità, se stessimo ricostruendo lo stack di latenza da zero con ciò che sappiamo ora.

  • Costruisci prima il classificatore-router, poi il modello. Il livello di routing ha finito per essere l’elemento con la leva più alta. Considerarlo come un "lo aggiungeremo più tardi se ne avremo bisogno" si è rivelato significare che abbiamo convissuto con la latenza del modello singolo per 18 mesi in più del necessario.
  • Imposta gli SLO di parità prima degli SLO della lingua. La tentazione è quella di fissare obiettivi per lingua e lasciare emergere la parità. La parità non emerge; diverge, lentamente, nella direzione della lingua principale della squadra.
  • Fornisci risorse all'infrastruttura per lingua come se ogni lingua fosse un prodotto separato. Mandarin TTS meritava il proprio pool di GPU fin dal primo giorno, non dal giorno in cui abbiamo misurato il gap di latenza.

Niente di tutto questo è una nuova ricerca. Niente di tutto ciò richiedeva un documento. È stato necessario considerare la parità di latenza come un impegno per il prodotto, quindi finanziare l’infrastruttura poco affascinante per sostenere l’impegno. Abbiamo la parità di cui abbiamo bisogno adesso. Non l'abbiamo avuto per quattro anni.

Gestisci la tua voce su Ajoxi.

Receptionist IA, percorsi all'ingrosso, numeri virtuali: tutto su un'unica piattaforma con prezzi trasparenti e NOC 24 ore su 24, 7 giorni su 7.

Vedi i prezzi Parla con noi
Continua a leggere

Lettura correlata

Letture successive selezionate manualmente dal blog Ajoxi.

We measured AI receptionist accuracy across 8,400 real calls
AI

Abbiamo misurato la precisione degli addetti alla reception con intelligenza artificiale su 8.400 chiamate reali

Per tre mesi abbiamo monitorato ogni chiamata gestita dall’intelligenza artificiale – per lingua, accento, tipo di chiamata – e abbiamo valutato la trascrizione rispetto a un revisore umano. I numeri relativi alla precisione erano migliori di quanto ci aspettassimo. Le modalità di fallimento erano più interessanti.

Leggi l'articolo
Why we ship STIR/SHAKEN attestation on day one
Conformità

Perché spediamo l'attestato STIR/SHAKEN il primo giorno

La maggior parte dei fornitori di telefoni cloud tratta l'attestazione dell'ID chiamante come una funzionalità di livello superiore. I vettori no. Ecco perché l'abbiamo reso predefinito e cosa è cambiato per i tassi di risposta in uscita.

Leggi l'articolo
The case for ranking calls, not sampling them
Prodotto

È il caso di classificare le chiamate, non di campionarle

Il campionamento casuale non individua le chiamate che contano davvero. Abbiamo ricostruito la console di supervisione attorno a un punteggio di rischio e abbiamo smesso di fingere che il QA fosse un gioco di numeri.

Leggi l'articolo