Ajoxi
  • Säule
    Cloud-Telefon

    Cloud-Telefon, Messaging, Video, Fax, Chat – der komplette UCaaS-Stack.

    • Virtuelle TelefonnummerLokale und gebührenfreie Nummern, überall
    • GeschäftstelefonAnrufe, SMS, Video, ein Login
    • KundenbindungJeder Kanal, ein Thread
    • Persönliche KIKI-Sidekick für jede Wiederholung
    • SMS & MMSText aus dem Hauptgeschäftsbereich
    • Team-ChatInterner Chat, gebunden an Kunden
    • VideotreffenRäume mit AI-Notizen + Zusammenfassung
    • Online-FaxFaxen ohne Faxgerät
    • Website-ChatbotBestellstatus und Retouren automatisch auflösen
    • TelefonsystemModerne Telefonanlage mit integrierter KI
    Hervorgehoben
    Alles inklusive.
    Cloud-Telefon, KI-Kontaktcenter, KI-Rezeptionist, SMS, Video, über 300 Integrationen.
    Siehe Pläne und Preise
  • Kernkompetenzen
    • KI-RezeptionistinErste Antwort rund um die Uhr · 32 Sprachen
    • KI-StimmungLeitet verärgerte Anrufer automatisch weiter
    • AI Agent AssistFlüsterskripte + Next-Best-Action
    • KonversationsintelligenzTranskripte, Stimmung, Einwände
    • AnrufaufzeichnungVolle Wiedergabetreue + Stichwortsuche
    • Automatische VermittlungVisueller IVR-Builder per Drag-and-Drop
    • Supervisor-ToolsZuhören · flüstern · bargen · Prüfprotokoll
    • Gebührenfreie Nummern800, 888, 877 – schnell bereitgestellt
    Neu
    KI-Stimmung · Live-Scoring.
    Leitet verärgerte Kunden an leitende Agenten weiter, sobald die Stimmung sinkt. Bei jedem kostenpflichtigen Tarif.
    Siehe KI-Sentiment
  • Nach Branche und Team
    • FinanzenSOC 2 · FINRA-fähige Prüfprotokolle
    • EinzelhandelOmnichannel + Warenkorb-Wiederherstellungs-SMS
    • SaaSAPIs + persönliche KI auf jedem Sitzplatz
    • LogistikDispatch-Routing an mehreren Standorten
    • VertriebsteamsPower Dialer + Live-KI-Coaching
    • Support-TeamsGemeinsamer Speicher über 8 Kanäle
    • Remote-TeamsGleiche Nummer auf jedem Gerät
    • KMUKI-Rezeptionistin als Ihre Rezeption
    • Unternehmens-ITSSO, SCIM, Multi-Site-Governance
    Die meisten adoptiert
    Ein Aufruf-Stack-Compliance-Vertrauensvertrauen.
    Anrufaufzeichnung, STIR/SHAKEN, Sentiment-Routing. SOC 2-, PCI- und FINRA-fähige Prüfprotokolle.
    Siehe Finanzen
  • Native Synchronisierung
    • HubSpotZwei-Wege-Synchronisierung · Lebenszyklus-Trigger
    • ZohoCRM · Schreibtisch · Bücher · Bigin
    Kommt bald
    Salesforce. Pipedrive. Frischverkäufe.
    Alle drei nativen Zwei-Wege-Synchronisierungen im dritten Quartal 2026. Möchten Sie eine Benachrichtigung über die Veröffentlichung erhalten?
    Schicken Sie mir beim Start eine E-Mail
  • Preise
  • Lernen
    • BlogTechnische und Produkthinweise
    • KundengeschichtenEchte Ergebnisse, echte Zahlen
    • FührerSchritt-für-Schritt-Playbooks
    • WebinareLive jeden Donnerstag · On-Demand
    • Kontaktieren Sie unsSprechen Sie mit dem Vertrieb oder holen Sie sich Unterstützung
    Bauen
    • DokumenteWie alles funktioniert
    • API-ReferenzREST + Webhooks
    • SDKsNode, Python, Go, Ruby
    • ÄnderungsprotokollJedes Schiff an einem Ort
    Vertrauen
    • StatusseiteLive-Verfügbarkeit + Vorfälle
    • Sicherheit + ComplianceSOC 2 · DSGVO · PCI
    • PrivatsphäreWas wir sammeln und warum
    • BedingungenDer Vertrag, in Kapiteln
    Frische Tinte
    8.400 Anrufe, gemessen.
    Genauigkeit der KI-Rezeption nach Sprache, Akzent und Anruftyp – die unbearbeiteten Nummern.
    Lesen Sie den Beitrag
  • English flagEnglisch
  • Español flagSpanisch
  • Français flagFranzösisch
  • Deutsch flagDeutsch
  • Italiano flagItalienisch
  • Português flagPortugiesisch
  • Nederlands flagNiederlande
  • Русский flagRussisch
  • Polski flagPolnisch
  • Türkçe flagTürkçe
  • العربية flagالعربية
  • हिन्दी flagJa
  • 简体中文 flag简体中文
  • 日本語 flag日本語
  • 한국어 flag한국어
  • Tiếng Việt flagTiếng Việt
  • Bahasa Indonesia flagBahasa Indonesien
  • ไทย flagไทย
  • Svenska flagSvenska
  • Українська flagUkraine
anmeldenKostenlose Testversion
Cloud-Telefon
Virtuelle TelefonnummerLokale und gebührenfreie Nummern, überallGeschäftstelefonAnrufe, SMS, Video, ein LoginKundenbindungJeder Kanal, ein ThreadPersönliche KIKI-Sidekick für jede WiederholungSMS & MMSText aus dem HauptgeschäftsbereichTeam-ChatInterner Chat, gebunden an KundenVideotreffenRäume mit AI-Notizen + ZusammenfassungOnline-FaxFaxen ohne FaxgerätWebsite-ChatbotBestellstatus und Retouren automatisch auflösenTelefonsystemModerne Telefonanlage mit integrierter KI
Kontaktcenter
OmnichannelEine Warteschlange für jeden KanalOutbound-DialerVorhersage, Leistung, VorschauAgentenassistentLive-Flüster-CoachingSupervisor-AssistentErkennen Sie fehlerhafte Anrufe in EchtzeitInteraktionsanalyseAuto-QA, ThementrendsUnternehmenÜber 500 Sitzplätze
KI-Familie
Ajoxi-StimmeKI-Rezeptionistin, die Termine buchtKI-AssistentEntwürfe, Zusammenfassungen, Follow-upsKonversations-KILiest jeden Anruf, damit Sie nichts verpassen
KI-RezeptionistinErste Antwort rund um die Uhr · 32 SprachenKI-StimmungLeitet verärgerte Anrufer automatisch weiterAI Agent AssistFlüsterskripte + Next-Best-ActionKonversationsintelligenzTranskripte, Stimmung, EinwändeAnrufaufzeichnungVolle Wiedergabetreue + StichwortsucheAutomatische VermittlungVisueller IVR-Builder per Drag-and-DropSupervisor-ToolsZuhören · flüstern · bargen · PrüfprotokollGebührenfreie Nummern800, 888, 877 – schnell bereitgestellt
FinanzenSOC 2 · FINRA-fähige PrüfprotokolleEinzelhandelOmnichannel + Warenkorb-Wiederherstellungs-SMSSaaSAPIs + persönliche KI auf jedem SitzplatzLogistikDispatch-Routing an mehreren StandortenVertriebsteamsPower Dialer + Live-KI-CoachingSupport-TeamsGemeinsamer Speicher über 8 KanäleRemote-TeamsGleiche Nummer auf jedem GerätKMUKI-Rezeptionistin als Ihre RezeptionUnternehmens-ITSSO, SCIM, Multi-Site-Governance
HubSpotZwei-Wege-Synchronisierung · Lebenszyklus-TriggerZohoCRM · Schreibtisch · Bücher · Bigin
Lernen
BlogTechnische und ProdukthinweiseKundengeschichtenEchte Ergebnisse, echte ZahlenFührerSchritt-für-Schritt-PlaybooksWebinareLive jeden Donnerstag · On-DemandKontaktieren Sie unsSprechen Sie mit dem Vertrieb oder holen Sie sich Unterstützung
Bauen
DokumenteWie alles funktioniertAPI-ReferenzREST + WebhooksSDKsNode, Python, Go, RubyÄnderungsprotokollJedes Schiff an einem Ort
Vertrauen
StatusseiteLive-Verfügbarkeit + VorfälleSicherheit + ComplianceSOC 2 · DSGVO · PCIPrivatsphäreWas wir sammeln und warumBedingungenDer Vertrag, in Kapiteln
  • English flagEnglisch
  • Español flagSpanisch
  • Français flagFranzösisch
  • Deutsch flagDeutsch
  • Italiano flagItalienisch
  • Português flagPortugiesisch
  • Nederlands flagNiederlande
  • Русский flagRussisch
  • Polski flagPolnisch
  • Türkçe flagTürkçe
  • العربية flagالعربية
  • हिन्दी flagJa
  • 简体中文 flag简体中文
  • 日本語 flag日本語
  • 한국어 flag한국어
  • Tiếng Việt flagTiếng Việt
  • Bahasa Indonesia flagBahasa Indonesien
  • ไทย flagไทย
  • Svenska flagSvenska
  • Українська flagUkraine
anmeldenKostenlose Testversion
Ajoxi

Cloud-Telefon und KI-Kontaktcenter in einem Netzwerk der Carrier-Klasse.

SOC 2DSGVOPCI-DSS

Suite C, Ebene 7, World Trust Tower,
50 Stanley Street, Central,
Hongkong

info@ajoxi.com+1 (512) 612-4425

Cloud-Telefon

  • Geschäftstelefon
  • Kundenbindung
  • SMS & MMS
  • Team-Chat
  • Videotreffen
  • Telefonsystem

Kontaktcenter

  • Omnichannel
  • Outbound-Dialer
  • Agentenassistent
  • Interaktionsanalyse
  • Enterprise CCaaS

KI

  • KI-Plattform
  • KI-Rezeptionistin
  • KI-Assistent
  • Konversations-KI
  • KI-Stimmung
  • Konversationsintelligenz

Lösungen

  • Finanzen
  • Einzelhandel und E-Commerce
  • SaaS & Tech
  • Vertriebsteams
  • KMU

Wiederverkäufer

  • Großhandels-VoIP
  • Großhandelsstimme
  • SIP-Trunking
  • CLI-Routen

Unternehmen

  • Preise
  • Um
  • Kunden
  • Kontaktieren Sie uns
  • Ländercodes
  • Vorwahlen
  • Dokumente
  • Status
  • Sicherheit

© 2026 Ajoxi. Alle Rechte vorbehalten.

Alle Systeme normal
  • Privatsphäre
  • Bedingungen
  • Sitemap
Blog/Maschinenbau/Gleiche Latenz auf Mandarin und Englisch. Hier erfahren Sie, wie

Gleiche Latenz auf Mandarin und Englisch. Hier erfahren Sie, wie

Um die Latenzparität über 32 Sprachen hinweg zu erreichen, ohne das Modell aufzublähen, war eine Modell-Routing-Ebene erforderlich, die wir nicht erwartet hatten. Notizen aus dem Latency War Room.

Inhaltsverzeichnis
  • 1.Einführung
  • 2.Wohin eigentlich die Millisekunden gehen
  • 3.Der Routing-Fix
  • 4.Der Klassifikator, den niemand kommen sah
  • 5.Die TTS-Seite des Problems
  • 6.Messung der Parität, nicht der Durchschnittswerte
  • 7.Was ist immer noch langsam
  • 8.Was wir anders machen würden

Einführung

Bei unserem Sprachprodukt gab es zwei Beschwerden, die wir intern nicht klären konnten. Bei englischsprachigen Unternehmenskunden fühlte sich die KI bissig an. Bei Kunden, die Mandarin sprechen – und zunehmend auch bei Kunden, die Vietnamesisch, Tagalog und Hindi sprechen – fühlte sich die KI träge an. Die Lücke, gemessen vom Schweigen des Anrufers bis zur ersten Silbe der KI, betrug 260 ms auf Englisch und 540 ms auf Mandarin. Beide Zahlen lagen innerhalb des veröffentlichten Latenzbudgets.

Nur einer von ihnen fühlte sich bei einem Telefonat akzeptabel.

Der Instinkt eines jeden Entwicklungsteams, das eine Latenzlücke erkennt, besteht darin, das Modell zu bearbeiten. Schnellere Schlussfolgerung. Kleineres Modell. Bessere Quantisierung. Das haben wir alles gemacht. Es verschaffte uns auf der ganzen Linie 60 ms, was nichts brachte – der relative Abstand war immer noch da und Englisch blieb doppelt so schnell.

Die eigentliche Lösung ergab sich aus einer anderen Beobachtung: Wir behandelten die Latenz als Modellproblem, obwohl es sich tatsächlich um ein Routing-Problem handelte.

Wohin eigentlich die Millisekunden gehen

Die Aufteilung der 540-ms-Mandarin-Antwort in Segmente war das erste, was das Problem klärte. Die Abrechnung sah ungefähr so ​​aus:

  • Audioaufnahme und Endpointing — 80 ms
  • Speech-to-Text-First-Token — 140 ms
  • Absicht + Abrufpipeline — 90 ms
  • Großes Modell des ersten Tokens (Generation) — 180 ms
  • Text-to-Speech-First-Audio — 50 ms

Auf dem englischen Weg kamen die gleichen Segmente bei 80/60/90/80/40 vor. Die beiden Segmente, die dramatisch voneinander abwichen, waren Speech-to-Text und Large-Model-Generierung. STT war in Mandarin langsamer, weil das akustische Modell mit einem längeren Kontextfenster trainiert wurde – notwendig für die tonale Disambiguierung –, das den ersten Token um 80 ms verschob.

Die Modellgenerierung war langsamer, da der Tokenisierer auf Mandarin mehr Token pro Zeichen mit gleicher Bedeutung erzeugte als auf Englisch.

Beides war kein Modellfehler. Beides waren Kompromisse, die von unabhängigen Teams stillschweigend angesammelt wurden, um ihre eigenen Metriken zu optimieren – STT für Genauigkeit, LLM für Generierungsqualität. Die Latenzkosten waren real, aber es war niemandes Gewinn- und Verlustrechnung.

Der Routing-Fix, der 200 ms eingespart hat

Wir haben aufgehört, alle Sprachen über ein einziges LLM zu leiten. Stattdessen haben wir vor der Generierung eine dünne Klassifizierungsschicht aufgebaut, die in weniger als 8 ms drei Dinge erkennt: die Sprache der eingehenden Äußerung, die Konversationsabsichtsklasse und ob die Anfrage eines von etwa 40 Hochfrequenzmustern ist, die wir durch Clustering von 2 Millionen Anrufsegmenten identifiziert haben.

Wenn der Klassifikator ein Hochfrequenzmuster in einer nicht-englischen Sprache identifiziert, leiten wir die Generierung an ein kleineres, sprachspezialisiertes Modell weiter, das dieses Muster direkt verarbeitet. Das kleinere Modell wurde auf Millionen von Vervollständigungen desselben Musters destilliert, sodass seine Qualität auf diesen spezifischen Pfaden im Rahmen des Rauschens des großen Modells liegt – aber seine Latenz beim ersten Token beträgt etwa ein Drittel.

Wenn der Klassifikator eine Endabsicht erkennt – alles, was nicht in den 40 Mustern liegt – wird die Anfrage wie zuvor an das große Modell weitergeleitet. Der größte Teil des Latenzabfalls ist auf die Tatsache zurückzuführen, dass die Hochfrequenzmuster vorhanden sind Auch die Muster, die etwa 78 % des Anrufvolumens ausmachen. Die Tail Cases zahlen die ursprüngliche Latenz, sind aber selten.

Der Klassifikator, den niemand kommen sah

Der Dünnsichter war der Teil des Projekts, für den niemand ein Budget hatte. Der Aufbau dauerte länger als der Aufbau des Routingsystems selbst, da die Fehlermöglichkeiten subtil waren. Ein Klassifikator, der 1 % der Anfragen fehlleitet und an ein kleines Modell weiterleitet, das sie nicht verarbeitet, erzeugt Halluzinationen und nicht nur verschlechterte Antworten.

Drei Dinge sorgten dafür, dass der Klassifikator funktionierte. Zunächst wurde das Training auf realem Produktionsverkehr und nicht auf synthetischen Daten durchgeführt. Zweitens wurde ein Konfidenzwert zurückgegeben, den der Router als Schwellenwert festlegen konnte – alles unter einem Konfidenzwert von 0,91 fällt automatisch auf das große Modell durch.

Drittens haben wir es sechs Wochen lang im Schatten der bestehenden Pipeline eingesetzt, wobei das große Modell die Wahrheit lieferte, bevor der Datenverkehr tatsächlich an kleine Modelle weitergeleitet wurde.

Bei der Schattenbereitstellung wurden vier Klassen von Fehlern gefunden, die der Offline-Testsatz übersehen hatte. Zwei davon ließen sich in den Trainingsdaten leicht beheben. Zwei erforderliche bewusste Routing-Regeln: Alles, was Identitätsprüfung, Zahlungen oder Terminstornierung betrifft, geht immer an das große Modell, unabhängig von der Zuverlässigkeit des Klassifikators, da die Kosten einer Halluzination auf diesen Pfaden höher sind als der Latenzgewinn.

Die TTS-Seite des Problems

Während die LLM- und STT-Änderungen überprüft wurden, arbeitete ein paralleles Team an der Sprachausgabe. Das 50 ms lange TTS-Erstaudio auf Englisch war praktisch unschlagbar; Die Lücke von 70 bis 90 ms bei den meisten nicht-englischen Sprachen wurde durch kleinere Sprachmodelle, weniger aggressives Caching und einen einzigen gemeinsamen GPU-Pool verursacht, der Englisch unter Last Vorrang einräumte.

Wir teilen die TTS-Infrastruktur in sprachgebundene Pools auf. Mandarin TTS läuft jetzt in einem eigenen Pool mit eigenen Skalierungsregeln auf Hardware in der Nähe der Regionen, aus denen der Großteil unseres Mandarin-Verkehrs stammt. Die Latenz sank innerhalb von zwei Wochen nach der Umstellung von 70–90 ms auf 45 ms.

Nichts davon war klug; Es handelte sich um eine Infrastrukturarbeit, um die sich niemand die Mühe gemacht hatte, weil die geringfügige Verbesserung einer einzelnen Sprache sie für sich genommen nicht gerechtfertigt hatte.

Die Lektion – und wir schreiben sie jetzt intern nieder – ist, dass „wir nicht in diese Investition investiert haben, weil keine einzelne benutzerorientierte Kennzahl dies rechtfertigte“ genau die Art von Entscheidung ist, die über einen Zeitraum von vier Jahren zu einer Lücke von 280 ms zwischen zwei Sprachen führt.

Messung der Parität, nicht der Durchschnittswerte

Eine kleine, aber folgenreiche Änderung, die wir intern vorgenommen haben, betraf die Art und Weise, wie das Latenz-Dashboard des Teams Berichte erstellt. Früher haben wir die p50 und p95 der End-to-End-Latenz, gemittelt über alle Sprachen, anhand eines einzelnen SLO verfolgt. Das Armaturenbrett sah die meiste Zeit grün aus.

Das neue Dashboard meldet p50 und p95 pro Sprache gegen a Parität SLO – die Lücke zwischen der langsamsten und der schnellsten unterstützten Sprache hat ein eigenes Budget, das separat durchgesetzt wird. Wir legen das Paritätsbudget auf 60 ms fest. Wenn die Lücke das Budget übersteigt, wird der Bereitschaftsdienst gerufen.

Das Paritäts-Dashboard macht etwas, was das durchschnittliche Dashboard nicht konnte: Es macht Regressionen in der langsamsten Sprache mit der gleichen Dringlichkeit sichtbar wie Regressionen in der schnellsten. Wenn Sie über 32 Sprachen mitteln, verschiebt eine 200-ms-Regression in Vietnamesisch den Durchschnitt um 6 ms. Wenn Sie die Parität messen, wird das Dashboard um 200 ms verschoben.

Was ist immer noch langsam

Nach der Routing-Arbeit, den TTS-Pools und dem Paritäts-Dashboard liegt unsere schlechteste Sprache (Kantonesisch, hauptsächlich weil der unterstützende Akustikmodellkorpus kleiner ist) bei 320 ms. Englisch ist bei 220 ms. Die verbleibende Lücke von 100 ms ist real und wir wissen ungefähr, wo sie liegt – das kantonesische STT-Akustikmodell ist älter und noch nicht auf der neuen Architektur, und wir werden es im dritten Quartal neu trainieren.

Aber „die langsamste Sprache ist 100 ms hinter der schnellsten“ ist eine andere Konversation als „die langsamste Sprache ist 280 ms hinter der schnellsten“. Ersteres ist eine bekannte Regression mit einer geplanten vierteljährlichen Korrektur. Letzteres war ein kundenbedingter Notfall, von dem wir nicht wussten, dass wir ihn hatten.

Was wir das nächste Mal anders machen würden

Drei Dinge, in der Reihenfolge ihrer Priorität, wenn wir den Latenzstapel mit dem, was wir jetzt wissen, von Grund auf neu aufbauen würden.

  • Erstellen Sie zuerst den Klassifikator-Router und dann das Modell. Am Ende war die Routing-Schicht das Bauteil mit der höchsten Hebelwirkung. Es stellte sich heraus, dass die Formulierung „Wir werden es später hinzufügen, wenn wir es benötigen“ dazu führte, dass wir 18 Monate länger als nötig mit der Latenz eines einzelnen Modells gelebt haben.
  • Legen Sie Paritäts-SLOs vor Sprach-SLOs fest. Die Versuchung besteht darin, Ziele pro Sprache festzulegen und Parität entstehen zu lassen. Parität entsteht nicht; es divergiert langsam in Richtung der Hauptsprache des Teams.
  • Ressourcen für die Infrastruktur pro Sprache bereitstellen, als ob jede Sprache ein separates Produkt wäre. Mandarin TTS hatte vom ersten Tag an einen eigenen GPU-Pool verdient, nicht von dem Tag an, an dem wir die Latenzlücke gemessen haben.

Nichts davon ist eine neuartige Forschung. Nichts davon erforderte ein Papier. Es war erforderlich, die Latenzparität als Produktverpflichtung zu behandeln und dann die unrühmliche Infrastruktur zu finanzieren, um die Verpflichtung zu unterstützen. Wir haben jetzt die Parität, die wir brauchen. Wir hatten es vier Jahre lang nicht.

Führen Sie Ihre Stimme auf Ajoxi aus.

KI-Rezeptionisten, Großhandelsrouten, virtuelle Nummern – aufgebaut auf einer Plattform mit transparenten Preisen und einem 24/7-NOC.

Siehe Preise Sprechen Sie mit uns
Lesen Sie weiter

Verwandte Lektüre

Handverlesene nächste Lesungen aus dem Ajoxi-Blog.

We measured AI receptionist accuracy across 8,400 real calls
KI

Wir haben die Genauigkeit der KI-Rezeption bei 8.400 echten Anrufen gemessen

Drei Monate lang verfolgten wir jeden Anruf, den die KI bearbeitete – nach Sprache, Akzent, Anruftyp – und bewerteten das Transkript anhand eines menschlichen Prüfers. Die Genauigkeitswerte waren besser als wir erwartet hatten. Interessanter waren die Fehlermodi.

Artikel lesen
Why we ship STIR/SHAKEN attestation on day one
Einhaltung

Warum wir die STIR/SHAKEN-Bescheinigung bereits am ersten Tag versenden

Die meisten Anbieter von Cloud-Telefonen betrachten die Anrufer-ID-Bestätigung als eine höherstufige Funktion. Carrier nicht. Hier erfahren Sie, warum wir es als Standard festgelegt haben – und was sich dadurch für die ausgehenden Antwortraten geändert hat.

Artikel lesen
The case for ranking calls, not sampling them
Produkt

Es geht darum, Anrufe zu klassifizieren und nicht zu sampeln

Durch Zufallsstichproben werden die wirklich wichtigen Anrufe übersehen. Wir haben die Supervisor-Konsole um eine Risikobewertung herum umgestaltet – und haben aufgehört, so zu tun, als wäre Qualitätssicherung ein Spiel mit Zahlen.

Artikel lesen