Ajoxi
  • Pelare
    MOLNTELEFON

    Molntelefon, meddelanden, video, fax, chatt – hela UCaaS-stacken.

    • Virtuella telefonnummerLokala och avgiftsfria nummer, var som helst
    • FöretagstelefonRinger, SMS, video, en inloggning
    • KundengagemangVarje kanal, en tråd
    • Personlig AIAI-sidekick för varje rep
    • SMS & MMSText från den huvudsakliga affärslinjen
    • TeamchattIntern chatt, knuten till kunder
    • VideomötenRum med AI-anteckningar + sammanfattning
    • Online faxFaxa utan fax
    • Webbplats ChatbotAutomatiskt löser orderstatus och returer
    • TelefonsystemModern PBX med inbyggd AI
    Utvalda
    Allt ingår.
    Molntelefon, AI-kontaktcenter, AI-receptionist, SMS, video, 300+ integrationer.
    Se planer och priser
  • Kärnfunktioner
    • AI receptionist24/7 första svar · 32 språk
    • AI-sentimentRutter stör uppringare automatiskt
    • AI Agent AssistViskmanus + näst bästa action
    • KonversationsintelligensAvskrifter, känslor, invändningar
    • SamtalsinspelningFull trohet + nyckelordssökning
    • Auto-attendantDra och släpp visuell IVR-byggare
    • Handledare VerktygLyssna · viska · pråm · revisionslogg
    • Avgiftsfria nummer800, 888, 877 — tillhandahålls snabbt
    Ny
    AI Sentiment · livescore.
    Rutter gör kunderna upprörda till seniora agenter i samma ögonblick som sentimentet sjunker. På varje betald plan.
    Se AI Sentiment
  • Av industri och team
    • FinansieraSOC 2 · FINRA-färdiga revisionsspår
    • DetaljhandelOmnikanal + vagn-återställnings-SMS
    • SaaSAPI:er + personlig AI på varje plats
    • LogistikUtsändningsrutt på flera platser
    • SäljteamPower dialer + live AI-coaching
    • SupportteamDelat minne över 8 kanaler
    • FjärrlagSamma nummer på alla enheter
    • SMBAI-receptionist som din reception
    • Enterprise ITSSO, SCIM, styrning på flera platser
    De flesta adopterade
    En call stack compliance trusts.
    Samtalsinspelning, STIR/SHAKEN, sentiment routing. SOC 2, PCI och FINRA-färdiga revisionsspår.
    Se ekonomi
  • Native Sync
    • HubSpotTvåvägssynkronisering · livscykelutlösare
    • ZohoCRM · Skrivbord · Böcker · Bigin
    Kommer snart
    Salesforce. Pipedrive. Freshsales.
    Alla tre inbyggda tvåvägssynkroniseringar under tredje kvartalet 2026. Vill du ha en heads-up vid lanseringen?
    Maila mig vid lansering
  • Prissättning
  • Lära sig
    • BloggIngenjörs- och produktanteckningar
    • KundberättelserVerkliga resultat, verkliga siffror
    • GuiderSteg-för-steg spelböcker
    • WebbseminarierLive varje torsdag · on-demand
    • Kontakta ossPrata med säljare eller få support
    Bygga
    • DokumentHur allt fungerar
    • API-referensREST + webhooks
    • SDK:erNode, Python, Go, Ruby
    • ÄndringsloggVarje fartyg, på ett ställe
    Förtroende
    • StatussidaLive upptid + incidenter
    • Säkerhet + efterlevnadSOC 2 · GDPR · PCI
    • PrivatlivVad vi samlar in och varför
    • VillkorKontraktet, i kapitel
    Nytt bläck
    8 400 samtal, uppmätt.
    AI-receptionist noggrannhet efter språk, accent och samtalstyp - de oredigerade numren.
    Läs inlägget
  • English flagengelska
  • Español flagEspañol
  • Français flagFrançais
  • Deutsch flagDeutsch
  • Italiano flagItaliano
  • Português flagPortuguês
  • Nederlands flagnederländska
  • Русский flagРусский
  • Polski flagPolski
  • Türkçe flagTürkçe
  • العربية flagالعربية
  • हिन्दी flagहिन्दी
  • 简体中文 flag简体中文
  • 日本語 flag日本語
  • 한국어 flag한국어
  • Tiếng Việt flagTiếng Việt
  • Bahasa Indonesia flagBahasa Indonesien
  • ไทย flagไทย
  • Svenska flagSvenska
  • Українська flagУкраїнська
Logga inGratis provperiod
Molntelefon
Virtuella telefonnummerLokala och avgiftsfria nummer, var som helstFöretagstelefonRinger, SMS, video, en inloggningKundengagemangVarje kanal, en trådPersonlig AIAI-sidekick för varje repSMS & MMSText från den huvudsakliga affärslinjenTeamchattIntern chatt, knuten till kunderVideomötenRum med AI-anteckningar + sammanfattningOnline faxFaxa utan faxWebbplats ChatbotAutomatiskt löser orderstatus och returerTelefonsystemModern PBX med inbyggd AI
Kontaktcenter
OmnikanalEn kö för varje kanalUtgående uppringarePredictive, power, previewAgent AssistLiveviskning coachingSupervisor AssistUpptäck dåliga samtal i realtidInteraktionsanalysAuto-QA, ämnestrenderFöretag500+ sittplatser
AI familj
Ajoxi VoiceAI-receptionist som bokar mötenAI-assistentUtkast, sammanfattningar, uppföljningarKonversation AILäser varje samtal så att du inte missar någonting
AI receptionist24/7 första svar · 32 språkAI-sentimentRutter stör uppringare automatisktAI Agent AssistViskmanus + näst bästa actionKonversationsintelligensAvskrifter, känslor, invändningarSamtalsinspelningFull trohet + nyckelordssökningAuto-attendantDra och släpp visuell IVR-byggareHandledare VerktygLyssna · viska · pråm · revisionsloggAvgiftsfria nummer800, 888, 877 — tillhandahålls snabbt
FinansieraSOC 2 · FINRA-färdiga revisionsspårDetaljhandelOmnikanal + vagn-återställnings-SMSSaaSAPI:er + personlig AI på varje platsLogistikUtsändningsrutt på flera platserSäljteamPower dialer + live AI-coachingSupportteamDelat minne över 8 kanalerFjärrlagSamma nummer på alla enheterSMBAI-receptionist som din receptionEnterprise ITSSO, SCIM, styrning på flera platser
HubSpotTvåvägssynkronisering · livscykelutlösareZohoCRM · Skrivbord · Böcker · Bigin
Lära sig
BloggIngenjörs- och produktanteckningarKundberättelserVerkliga resultat, verkliga siffrorGuiderSteg-för-steg spelböckerWebbseminarierLive varje torsdag · on-demandKontakta ossPrata med säljare eller få support
Bygga
DokumentHur allt fungerarAPI-referensREST + webhooksSDK:erNode, Python, Go, RubyÄndringsloggVarje fartyg, på ett ställe
Förtroende
StatussidaLive upptid + incidenterSäkerhet + efterlevnadSOC 2 · GDPR · PCIPrivatlivVad vi samlar in och varförVillkorKontraktet, i kapitel
  • English flagengelska
  • Español flagEspañol
  • Français flagFrançais
  • Deutsch flagDeutsch
  • Italiano flagItaliano
  • Português flagPortuguês
  • Nederlands flagnederländska
  • Русский flagРусский
  • Polski flagPolski
  • Türkçe flagTürkçe
  • العربية flagالعربية
  • हिन्दी flagहिन्दी
  • 简体中文 flag简体中文
  • 日本語 flag日本語
  • 한국어 flag한국어
  • Tiếng Việt flagTiếng Việt
  • Bahasa Indonesia flagBahasa Indonesien
  • ไทย flagไทย
  • Svenska flagSvenska
  • Українська flagУкраїнська
Logga inGratis provperiod
Ajoxi

Molntelefon och AI-kontaktcenter i ett nätverk av operatörsklass.

SOC 2GDPRPCI-DSS

Svit C, nivå 7, World Trust Tower,
50 Stanley Street, Central,
Hong Kong

info@ajoxi.com+1 (512) 612-4425

Molntelefon

  • Företagstelefon
  • Kundengagemang
  • SMS & MMS
  • Teamchatt
  • Videomöten
  • Telefonsystem

Kontaktcenter

  • Omnikanal
  • Utgående uppringare
  • Agent Assist
  • Interaktionsanalys
  • Enterprise CCaaS

AI

  • AI-plattform
  • AI receptionist
  • AI-assistent
  • Konversations-AI
  • AI-sentiment
  • Konversationsintelligens

Lösningar

  • Finansiera
  • Detaljhandel & eCom
  • SaaS & Tech
  • Säljteam
  • SMB

Återförsäljare

  • VoIP i grossistledet
  • Grossist röst
  • SIP Trunking
  • CLI rutter

Företag

  • Prissättning
  • Om
  • Kunder
  • Kontakta oss
  • Landskoder
  • Riktnummer
  • Dokument
  • Status
  • Säkerhet

© 2026 Ajoxi. Alla rättigheter reserverade.

Alla system normala
  • Privatliv
  • Villkor
  • Webbplatskarta
Blogg/Teknik/Samma latens på mandarin och engelska. Så här gör du

Samma latens på mandarin och engelska. Så här gör du

Att träffa latensparitet över 32 språk utan att svälla modellen krävde ett modelldirigeringslager som vi inte såg komma. Anteckningar från latenskrigsrummet.

Innehållsförteckning
  • 1.Introduktion
  • 2.Vart millisekunderna faktiskt tar vägen
  • 3.Routingfixen
  • 4.Klassificeraren ingen såg komma
  • 5.TTS-sidan av problemet
  • 6.Mätning av paritet, inte medelvärden
  • 7.Vad är fortfarande långsamt
  • 8.Vad vi skulle göra annorlunda

Introduktion

Vår röstprodukt hade två klagomål som vi inte kunde förena internt. Från engelsktalande företagskunder kändes AI:n smart. Från mandarintalande kunder – och alltmer från vietnamesiska, tagalogiska och hinditalande kunder – kändes AI trög. Avståndet, mätt från början till slut från samtalets tystnad till AI första stavelse, var 260 ms på engelska och 540 ms på mandarin. Båda siffrorna låg inom den publicerade latensbudgeten.

Endast en av dem kände sig acceptabel på ett telefonsamtal.

Instinkten hos alla ingenjörsteam som ser ett latensgap är att mala på modellen. Snabbare slutledning. Mindre modell. Bättre kvantisering. Vi gjorde allt det där. Det köpte oss 60 ms över hela linjen, vilket inte stängde någonting – det relativa gapet fanns fortfarande kvar, och engelskan var dubbelt så snabb.

Den verkliga fixen kom från en annan observation: vi behandlade latens som ett modellproblem när det faktiskt var ett routingproblem.

Vart millisekunderna faktiskt tar vägen

Att dela upp 540ms mandarinsvaret i segment var det första som klargjorde problemet. Bokföringen såg ungefär ut så här:

  • Ljudfångst och slutpunkter — 80 ms
  • Tal-till-text första token — 140 ms
  • Avsikt + hämtning pipeline — 90 ms
  • Stor modell första token (generation) — 180 ms
  • Text-till-tal första ljud — 50 ms

På den engelska vägen kom samma segment in på 80 / 60 / 90 / 80 / 40. De två segmenten som skilde sig dramatiskt var tal-till-text och generering av stora modeller. STT var långsammare på mandarin eftersom den akustiska modellen hade tränats med ett längre sammanhangsfönster – nödvändigt för tonal disambiguation – som pressade första token med 80 ms.

Modellgenereringen var långsammare eftersom tokenizern producerade fler tokens per tecken med motsvarande betydelse på mandarin än på engelska.

Det var inte heller något modellfel. Båda var avvägningar som hade samlats i tysthet av oberoende team som optimerade för sina egna mätvärden - STT för noggrannhet, LLM för generationskvalitet. Latenskostnaden var reell, men det var ingens P&L.

Routingfixen som köpte 200ms

Vi slutade dirigera alla språk genom en enda LLM. Istället byggde vi ett tunt klassificeringsskikt framför generation som detekterar, på mindre än 8 ms, tre saker: språket för det inkommande yttrandet, konversationsavsiktsklassen och om begäran är ett av cirka 40 högfrekventa mönster som vi identifierade genom att gruppera 2M samtalssegment.

När klassificeraren identifierar ett högfrekvent mönster på ett icke-engelsk språk dirigerar vi genereringen till en mindre, språkspecialiserad modell som hanterar det mönstret direkt. Den mindre modellen har destillerats på miljontals slutföranden av samma mönster, så dess kvalitet på de specifika banorna ligger inom bullret från den stora modellen - men dess första token-latens är ungefär en tredjedel.

När klassificeraren ser en svansavsikt - allt som inte ingår i de 40 mönstren - faller förfrågan igenom till den stora modellen, precis som tidigare. Det mesta av latensfallet kommer från det faktum att de högfrekventa mönstren är också mönstren som står för ~78 % av samtalsvolymen. Svansfallen betalar den ursprungliga latensen, men de är sällsynta.

Klassificeraren ingen såg komma

Den tunna klassificeraren var den del av projektet som ingen hade budgeterat för. Att bygga det tog längre tid än att bygga själva routingsystemet, eftersom fellägena var subtila. En klassificerare som feldirigerar 1 % av förfrågningarna till en liten modell som inte hanterar dem producerar hallucinationer, inte bara försämrade svar.

Tre saker fick klassificeraren att fungera. Först tränades den på verklig produktionstrafik, inte syntetisk data. För det andra returnerade det ett konfidenspoäng som routern kunde gränsa - allt under 0,91 konfidens faller automatiskt igenom till den stora modellen.

För det tredje, vi skuggdeployerade den i sex veckor mot den befintliga pipelinen, med den stora modellen som tillhandahåller marken, innan någon trafik faktiskt dirigerades till små modeller.

Skuggdistributionen hittade fyra klasser av misstag som offlinetestset hade missat. Två var lätta att fixa i träningsdata. Två nödvändiga avsiktliga routingregler - allt som rör identitetsverifiering, betalningar eller avbokning av möten går alltid till den stora modellen oavsett klassificerarens förtroende, eftersom kostnaden för en hallucination på dessa vägar är högre än latensvinsten.

TTS-sidan av problemet

Medan ändringarna av LLM och STT genomgick granskning, arbetade ett parallellt team med talutgången. 50ms TTS första ljudet på engelska var faktiskt oslagbart; gapet på 70 ms-90 ms på de flesta icke-engelska språk drevs av mindre röstmodeller, mindre aggressiv cachning och en enda delad GPU-pool som prioriterade engelska under belastning.

Vi delar upp TTS-infrastrukturen i språkanslutna pooler. Mandarin TTS kör nu på sin egen pool, med sina egna skalningsregler, på hårdvara nära de regioner där det mesta av vår mandarintrafik kommer från. Latensen sjönk från 70-90 ms till 45 ms inom två veckor efter cutover.

Inget av detta var smart; det var infrastrukturarbete som ingen hade brytt sig om att göra eftersom den marginella förbättringen på ett enskilt språk inte, isolerat, hade motiverat det.

Lärdomen – och vi skriver nu ner den internt – är att "vi har inte investerat i det här eftersom ingen enskild användarinriktad mätning motiverade det" är exakt den typ av beslut som sammanställer till ett gap på 280 ms mellan två språk under fyra år.

Mätning av paritet, inte medelvärden

En liten men följdändring vi gjorde internt var hur teamets latensinstrumentpanel rapporterar. Vi brukade spåra p50 och p95 av end-to-end latens, i genomsnitt över alla språk, mot en enda SLO. Instrumentpanelen såg grön ut för det mesta.

Den nya instrumentpanelen rapporterar p50 och p95 per språk mot a paritet SLO — klyftan mellan det långsammaste och det snabbaste språket som stöds har sin egen budget, som upprätthålls separat. Vi satte paritetsbudgeten till 60 ms. När gapet överstiger budgeten söks jour.

Paritetsinstrumentpanelen gör något som den genomsnittliga baserade man inte kunde: den gör regressioner på det långsammaste språket synliga med samma brådska som regressioner i det snabbaste. När du snittar över 32 språk, flyttar en 200ms regression på vietnamesiska genomsnittet med 6ms. När du mäter paritet flyttar den instrumentpanelen med 200ms.

Vad är fortfarande långsamt

Efter routingarbetet, TTS-poolerna och paritetsinstrumentpanelen ligger vårt sämsta språk (kantonesiska, främst för att den stödjande akustiska modellens korpus är mindre) på 320ms. Engelska är på 220ms. Det återstående gapet på 100 ms är verkligt och vi vet ungefär var det bor — den kantonesiska STT akustiska modellen är äldre och ännu inte på den nya arkitekturen, och vi kommer att träna om den under Q3.

Men "det långsammaste språket är 100 ms bakom det snabbaste" är en annan konversation än "det långsammaste språket är 280 ms efter det snabbaste." Den förra är en känd regression med en kvartalsvis fix planerad. Det senare var en nödsituation som kunde upplevas som vi inte visste att vi hade.

Vad vi skulle göra annorlunda nästa gång

Tre saker, i prioriterad ordning, om vi skulle bygga om latensstacken från början med det vi vet nu.

  • Bygg först klassificeraren-routern, sedan modellen. Det slutade med att routinglagret var den bit som hade högst hävstång. Att behandla det som ett "vi lägger till det senare om vi behöver det" visade sig betyda att vi levde med singelmodells latens i 18 månader längre än vi behövde.
  • Ställ in paritets-SLO:er före språk-SLO:er. Frestelsen är att sätta upp mål per språk och låta paritet uppstå. Paritet uppstår inte; det divergerar, långsamt, i riktning mot lagets primära språk.
  • Resursera infrastrukturen per språk som om varje språk vore en separat produkt. Mandarin TTS förtjänade sin egen GPU-pool från dag ett, inte från dagen då vi mätte latensgapet.

Inget av detta är ny forskning. Inget av det krävde ett papper. Det krävde att man behandlade latensparitet som ett produktåtagande och sedan finansierade den oglamorösa infrastrukturen för att stödja åtagandet. Vi har den paritet vi behöver nu. Vi hade inte det på fyra år.

Kör din röst på Ajoxi.

AI-receptionister, grossistrutter, virtuella nummer – byggda på en plattform med transparent prissättning och en 24/7 NOC.

Se prissättning Prata med oss
Fortsätt läsa

Relaterad läsning

Handplockad nästa läsning från Ajoxi-bloggen.

We measured AI receptionist accuracy across 8,400 real calls
AI

Vi mätte AI-receptionisternas noggrannhet över 8 400 riktiga samtal

Under tre månader spårade vi varje samtal som AI hanterade – efter språk, efter accent, efter samtalstyp – och betygsatte utskriften mot en mänsklig granskare. Noggrannhetssiffrorna var bättre än vi förväntade oss. Fellägena var mer intressanta.

Läs artikeln
Why we ship STIR/SHAKEN attestation on day one
Efterlevnad

Varför vi skickar STIR/SHAKEN-intyg på dag ett

De flesta molntelefonleverantörer behandlar nummerpresentation som en funktion på högre nivå. Det gör inte transportörerna. Här är anledningen till att vi gjorde det till standard - och vad det ändrade för utgående svarsfrekvens.

Läs artikeln
The case for ranking calls, not sampling them
Produkt

Fallet för att rangordna samtal, inte att sampla dem

Slumpmässigt urval missar de samtal som faktiskt betyder något. Vi byggde om övervakarkonsolen runt en riskpoäng – och slutade låtsas att QA var ett sifferspel.

Läs artikeln