STIR/SHAKEN 証明書を初日に発送する理由
ほとんどのクラウド電話ベンダーは、発信者 ID 構成証明を上位層の機能として扱います。通信事業者はそうではありません。これをデフォルトにした理由と、それによってアウトバウンド応答率がどのように変化したかを説明します。
3 か月間、AI が処理したすべての通話を言語、アクセント、通話の種類ごとに追跡し、その記録を人間の審査員に照らして採点しました。精度の数値は予想よりも優れていました。失敗モードはさらに興味深いものでした。
マーケティングコピーに書かれている「AI の精度」に関する数値のほとんどは、まったく意味がありません。彼らはクリーンなデータセットでモデルをベンチマークし、データセット自体に対してスコアを付け、顧客が騒々しい倉庫から電話をかけ、一度に 3 つの質問をする火曜日の午後のシステムのパフォーマンスとはほとんど関係のない数値を生成します。
私たちは何かを意味する数字を求めていました。そのため、2026 年 1 月から 3 月までの 3 か月間、生産フリート全体で AI 受付係が処理したすべての通話 (合計 8,427 件) が書き起こされ、AI によってリアルタイムで採点され、その後、AI の判定を見たことのない人間の審査員によって独立して再採点されました。
私たちは、言語、アクセント(識別可能な場合)、通話の種類、時刻、長さ、会話がたどった具体的な経路を追跡しました。
重要なのは、お世辞にも数字を発表しないことでした。重要なのは、AI が成功したと思っていて間違っていたコールと、AI が顧客の問題を真に解決したが、内部指標によって失敗とマークされていたコールを見つけることでした。どちらのクラスも予想以上に人数が多かったです。
ルールは3つありました。まず、一部の通話は選択されません。会話中にクラッシュした 47 件の通話と、最初の 15 秒以内に人間に転送された 312 件を含む、期間中のすべての通話が対象となりました。第二に、人間の審査員は AI の自己評価に盲目でした。彼らは、AI が行ったと主張するものではなく、顧客が述べた意図に照らしてトランスクリプトを採点しました。
第三に、ルーブリックはデータが検討される前に公開され、数字が出た後で私たちが静かに「成功」を再定義するのを防ぐためです。
各コールは 3 つの独立した次元でスコア付けされました。
コールは、正しい意図、タスクの完了、衛生スコア 4 または 5 の 3 つすべてをクリアした場合にのみ「勝利」としてカウントされます。3 番目のゲートは、成功と呼ばれるコールを静かに排除するゲートです。
8,427 件の通話データセット全体にわたって、AI は 3 つのゲートをすべてクリアしました。 91.4% 通話の数。この数字は私たちが社内で予測したよりも高く、私たちのほとんどは 85 ~ 88% の範囲で賭けていました。
私たちの予測と結果の間のギャップは、モデルが予想よりも良くなったということではありません。それは、私たちの直感が記憶に残る呼びかけによって形作られているということであり、それは不釣り合いに悪いものでした。
通話の種類ごとに分類すると、差異は顕著でした。
私たちが注目したのは、苦情と複数の問題の数です。 96% の予約率は、取引を獲得するために提供されるものです。複数の問題の通話における 72% という数字は、それらを維持するために出荷されたものです。
当社は 32 の言語で事業を展開しており、言語ごとに単一の精度数値を公開しています。最も優れた言語 (英語-米国) と最も悪いサポート対象言語 (ベトナム語) の間の合計の差は 4.1 パーセント ポイントで、これは予想よりも狭く、公開されている学術ベンチマークで報告されているよりも狭かったです。
しかし、言語スコアを集計すると、実際に重要な問題の部分、つまり単一言語内のアクセントの差異が隠されてしまいます。米国で処理された英語の通話のスコアは 92.7% でした。インド系英語を話す顧客からの英語通話のスコアは 91.3% で、騒音の範囲内に十分収まりました。 ~からの英語の電話 地域性が強い スコットランド系英語話者のスコアは 83.4% でした。これは 9 ポイントの差であり、その差は完全に「英語」というラベルの付いた列内に収まります。
重要なのは、私たちのモデルがスコットランド英語が苦手だということではありません。重要なのは、アクセントの差異を測定しないまま言語ごとの番号を公開することが、AI が失敗している通話を隠す方法であるということです。現在、アクセントの差異を社内で報告しており、2 四半期以内に社外に公開する予定です。
723 件の不在着信 (データセットの 8.6%) をクラスタリングしたところ、5 つの障害モードがそのうちの 81% を占めていました。これまでに音声 AI を出荷したことのある人はこれらのどれも驚かないでしょうが、相対的な重みには私たちは驚きました。
呼び出し元には 2 つ以上のインテントがあり、AI は 2 番目のインテントを記述し終わる前に最初のインテントをコミットします。 「予定を変更したいのですが、X-100 モデルも販売してくれませんか」は、まさに会話状態を活性化する種類の入力です。
発信者は、名前、価格、日付など、AI がコンテキストとして保存しなかった会話の前半の発言を参照します。これは、次世代コンテキスト ウィンドウが最も直接的に対処する障害モードです。
エンドポイントの失敗。 AI が話し始め、発信者がその上で話し、AI は発信者の声と混ざり合った自分の声を聞き、入力の半分が欠けているトランスクリプトを生成します。
発信者は電話番号または住所を指示します。 AIがそれを読み戻します。発信者は 1 桁を修正します。 AI が間違った桁を更新します。これは、構造化データの確認プロンプトが表示される 100% 修正可能な問題であり、2 月に出荷されました。
AI は通話を解決できないことを正しく認識して転送しますが、転送ルーティングにより通話が間違ったキューに送信されます。これは実際には AI の失敗ではありません。 AI が明らかにするのは、ダイヤル プランの障害です。
出荷された 3 つの変更は研究から直接得られたもので、4 つ目は開発中です。私たちは、学術的に最も興味深い修正ではなく、障害モードごとに最も活用度の高い修正を出荷しようとしました。
4 番目の変更 (暗黙的コンテキスト ドロップに対処する、より豊富な通話ごとのコンテキスト バッファー) は 4 つの変更の中で最も複雑で、ライブになる前にホールドアウトされたコール セットに対してシャドウ モードで試用されています。
名前を挙げる価値のある小さな発見の 1 つは、ルーブリックが公開されているにもかかわらず、人間の査読者が 3 か月にわたって漂流していたということです。 1 か月目に、レビュー担当者は通話の 87% を成功とマークしました。 3 か月目に、同じレビュー担当者が 1 か月目にランダムに抽出されたコールを 2 度目に採点し、91% が成功とマークしました。トランスクリプトは変更されていませんでした。
この漂流は悪意ではなかった。それは親しみやすさでした。査読者が AI の表現に慣れるにつれて、会話の衛生面に関してより寛大になるようになりました。私たちは、1 か月目のコールの 5% サンプルを 3 か月目に再スコアリングすることでこの問題を発見し、見出しの数値を修正しました。上で報告された 91.4% はドリフト補正された数値です。生の数値は 92.1% でした。
ベンダーが人間によるグレーダーのドリフトをどのように制御したかを説明せずに精度の数値を公開した場合、その数値はデフォルトで疑わしいものになります。この問題は私たちが発明したわけではありません。私たちはそれに注意を払っただけです。
優先順位としては 3 つあります。まず、主要なサポート対象言語ごとのアクセント解決の精度、そして方法論が安定したら公開するという公約です。 2 つ目は、通話後の結果の精度です。通話の発信者は、実際に目的のものを受け取ったかどうかを、通話の 7 日後と 30 日後に顧客の下流システムと照合して測定しました。
3 番目は、精度と 1 分あたりの経済性を組み合わせた解決通話あたりのコストです。これは、ほとんどすべての実際のビジネスにおいて、1 分あたり 1.40 ドルかかる 98% 精度の AI は、0.18 ドルかかる 92% 精度の AI に負けてしまうためです。
次の数値セットは第 3 四半期に発表される予定です。後退が見られる場合は、それも公開します。このことを測定するポイントは、お世辞を言うグラフを見つけることではありません。それは、まだ間違えられている電話を見つけることです。