実際の 8,400 件の通話で AI 受付係の精度を測定しました
3 か月間、AI が処理したすべての通話を言語、アクセント、通話の種類ごとに追跡し、その記録を人間の審査員に照らして採点しました。精度の数値は予想よりも優れていました。失敗モードはさらに興味深いものでした。
ランダム サンプリングでは、実際に重要な呼び出しが見逃されます。私たちはリスク スコアを中心にスーパーバイザ コンソールを再構築し、QA が数字遊びであるかのように振る舞うのをやめました。
20 年間、コンタクト センター業界は、あるプロセスについて合意しました。スーパーバイザーが、録音された通話の少数 (通常、エージェントあたり週に 2 ~ 5 件) をランダムにサンプリングし、30 行のルーブリックに照らしてスコアを付け、そのスコアをコーチング レポートにまとめるというものです。業界全体がこの慣行に基づいて構築されました。ベンダーはスコアカードを販売しました。監査人はルーブリックを検証しました。カンファレンスにはそのためのトラックがありました。
数学は決してうまくいきませんでした。 1,000 人のエージェントがいるコンタクト センターで、週に 200,000 件のコールを処理し、エージェントあたり 2% をサンプリングすると、スコアリングされたコールは 40,000 件になります。サンプリングが 99% 問題のないコール全体で均一にランダムであることに気づくまでは、これは多くのように思えます。
40,000 件のランダムな会話をサンプリングして、エージェントがコンプライアンス違反を犯した 60 件の通話を見つけるのは、干し草の山の中の 1 本の針のようなものです。干し草の山が整理されるまでに、エージェントは異動し、顧客は離反し、違反は悪化しました。
QA の目的は、平均的なコールをスコアリングすることではありません。それは、重要な通話、つまり失敗、保存、エッジケース、エージェントが例外的または憂慮すべきことを行った会話を見つけることでした。ランダム サンプリングは構造的に、これらを見つけるのが苦手です。
古いモデルが明らかに壊れるほどの変更が 2 つありました。まず、書き起こしの品質が有用性のしきい値を超えました。ほとんどの主要言語において、書き起こしは人間の耳だけでなくソフトウェアでも採点できるほど信頼できるものになりました。
第 2 に、大規模な言語モデルは教師あり分類において十分な性能を備えており、カスタム トレーニングされたモデルは 30 次元の呼び出しを 4 秒以内に 1 ペニー未満でスコアリングできます。
これらを総合すると、コンタクト センター史上初めて、すべての通話をルーブリックに対してスコア付けできるようになりました (2% や 5% ではなく、100%)。すべての通話がスコアリングされると、「どの通話をサンプリングするか?」という質問はなくなります。そして、「どの電話が人間の監督者の注意を払うに値するか?」になります。
それは解決する価値のある問題であり、それはランキングの問題であり、サンプリングの問題ではありません。
すべてのコールを 3 つの独立した次元でスコア付けし、それらを 1 つのランクに結合し、スーパーバイザーがコンソールに表示します。
3 つのディメンションは均等に重み付けされておらず、顧客間で重み付けが同じではありません。債権回収業者は、コンプライアンス リスクを最も重視します。ハイタッチのエンタープライズ SaaS サポート チームは、結果のリスクを重視します。トレーニングを重視する新人研修チームは、コーチングの価値を重視します。重みはスーパーバイザ設定で公開され、業界ごとに適切なデフォルトを設定します。
コンソールは、古い「ランダム サンプル キュー」UI とは意図的に異なっています。最近の通話のページ分けされたリストではなく、結合されたリスク スコアによって並べ替えられた単一のランク付けされたキューであり、2 分ごとに更新されます。キューの先頭は、今日注意が必要な 20 件ほどのコールです。以下はすべてロングテールです。
各コール カードには 3 つのサブスコア、通話内容の 90 秒の要約、およびモデルがフラグを立てた特定のスニペットが含まれています。スーパーバイザは、通話全体を聞くことなく、スニペットを聞くことができます。スニペットがストーリー全体である場合、そしてほとんどの場合、スーパーバイザーは 30 秒以内にフラグを確認または拒否し、次に進みます。
ランダム サンプル QA には、1 回の通話につき平均 8 分かかっていました。ランク付けされたキューの平均時間は 2 分 40 秒です。コールごとの QA コストは低下しました。カバレッジは 2% から 100% になりました。スーパーバイザは、実際にメトリクスを変更する呼び出しに時間を費やしています。
設計パートナーの顧客の QA リーダーにランク付けされたキューを見せたところ、一貫して 3 つの反対意見がありました。
抽象的には真実です。実際にはほとんどが誤りです。モデルは人間が見落としているものを見逃している スペシャリスト 同じコールをレビューするコンプライアンス監査人は、モデルがフラグを立てていない微妙な点を見つける可能性があります。しかし、この比較は専門家に対するものではありません。これは、スーパーバイザーがコールの 2% をランダムにサンプリングすることに反対します。モデルは 100% をレビューし、明らかな 5% にフラグを立てます。専門家が 5% をレビューします。
ネットのカバレッジは古いシステムよりもはるかに優れています。
おそらく本当でしょう。注目を集める指標はすべてゲーム化されます。防御には 2 つの要素があります。スコアは多次元であるため、1 つの軸でゲームを進めると、別の軸を押し上げることができます。また、スコアはエージェントのパフォーマンス レビューではありません。スコアはスーパーバイザーにとってのトリアージ信号です。パフォーマンスレビューは、スーパーバイザーが実際の通話を聞いた後に結論を下すものです。
私たちはスコアボードではなくキューとしてスコアを販売します。
それも事実であり、それについては正直に言うべきです。ランク付けされたキューのコンタクト センターのスーパーバイザは、30 行のルーブリックに基づいてコールをスコアリングする時間を短縮し、コーチング、エスカレーション、介入により多くの時間を費やすことができます。古い仕事、つまりその几帳面でスコアカード主導の部分が好きだった上司は、必ずしも新しい仕事に興奮しているわけではありません。
私たちは発売前に、これについてデザインパートナーの運用リーダーと率直に話し合いました。これは単なるツールの変更ではなく、ワークフローの変更です。
ランク付けされたキューを 90 日間独占的に実行した 4 つの設計パートナー全体で、スーパーバイザー チームは、保持またはコンプライアンスに関するコールを 1 週間あたり、ランダム サンプリングの場合の 4.7 倍にエスカレーションしました。この増加は「精査の強化」効果ではなかった。ほぼ完全に、ランダム サンプリングが構造的に見逃された呼び出しでした。
ある顧客は、債務回収スクリプトのドリフトを発見しました。つまり、1 人のエージェントが通話の約 9% で FDCPA の境界を越える言葉遣いを使い始めたということです。その無作為サンプリングは 11 週間表面化していませんでした。これらの特定のコールのコンプライアンス リスク スコアがエージェントのベースラインを 2 標準偏差上回っていたため、ランク付けされたキューはドリフト開始から 48 時間以内にそれを表面化しました。
別の顧客は、ランダム サンプリング システムがパフォーマンスが最も低いとフラグを立てたエージェントが、実際にはパフォーマンスが最も低いのではなく、単に声が最も大きかっただけであることを発見しました。結果のリスクに基づいて評価されたランク付けされたキューにより、静かではあるが一貫してパフォーマンスが低いエージェントが 2 人特定され、そのエージェントの通話は他の全員と同じレートでサンプリングされ、「平均」の山に分類されていました。
3つのこと、意図的に。
キューの出力でエージェントの自動スコアリングは行いません。スコアはトリアージの合図です。エージェントのパフォーマンス評価は依然としてスーパーバイザーを介して行われます。私たちが意図的に人間に情報を伝え続けているのは、モデルがそれを実行できないからではなく、自動スコアリングされたシステムが信頼を損なうのを十分に観察してきたため、このパターンを完全に回避したいと考えているからです。
通話中にエージェントのリアルタイム スコアがエージェントに表示されることはありません。エージェントは自分のコーチングスコアをリアルタイムで確認すべきだという考え方があります。そうすることで通話の品質が低下するという、より強力な学派があります。私たちは2番目の学校の側にいます。
デフォルトでは、スコアはパフォーマンス管理システムにエクスポートされません。スコアを別の HR ツールに接続したいお客様は、明示的な構成を使用してこれを行うことができますが、デフォルトをより安全な選択とします。スプレッドシート上の数値が必要な場合は、意図的にそれを要求する必要があります。