Solusi Contact Center: Fitur, Manfaat & Cara Memilih
Apa itu pusat kontak, perbedaannya dengan pusat panggilan, fitur inti, manfaat cloud, cara memilih platform, dan KPI yang mengukur kinerja.
Selama tiga bulan kami melacak setiap panggilan yang ditangani AI — berdasarkan bahasa, aksen, jenis panggilan — dan menilai transkripnya berdasarkan peninjau manusia. Angka akurasinya lebih baik dari yang kami harapkan. Mode kegagalan lebih menarik.
Sebagian besar angka "akurasi AI" yang Anda baca di salinan pemasaran tidak ada artinya. Mereka melakukan benchmark pada model pada kumpulan data yang bersih, menilai kumpulan data tersebut terhadap kumpulan data itu sendiri, dan menghasilkan angka yang hampir tidak ada hubungannya dengan kinerja sistem pada Selasa sore ketika pelanggan menelepon dari gudang yang berisik dan menanyakan tiga pertanyaan sekaligus.
Kami menginginkan nomor yang berarti. Jadi selama tiga bulan antara Januari dan Maret 2026, setiap panggilan yang ditangani resepsionis AI kami di seluruh armada produksi — total 8.427 panggilan — ditranskrip, dinilai oleh AI secara real-time, kemudian dinilai ulang secara independen oleh peninjau manusia yang tidak pernah melihat keputusan AI.
Kami melacak bahasa, aksen (jika dapat diidentifikasi), jenis panggilan, waktu, durasi, dan jalur spesifik percakapan.
Intinya bukanlah untuk mempublikasikan angka yang menyanjung. Intinya adalah untuk menemukan panggilan-panggilan yang menurut AI telah berhasil namun ternyata salah, dan panggilan-panggilan yang AI-nya benar-benar memecahkan masalah pelanggan namun metrik internal kami telah menandainya sebagai kegagalan. Kedua kelas lebih besar dari yang kami harapkan.
Ada tiga aturan. Pertama, tidak boleh pilih-pilih: setiap panggilan selama periode tersebut memenuhi syarat, termasuk 47 panggilan yang terhenti di tengah percakapan dan 312 panggilan yang dialihkan ke manusia dalam 15 detik pertama. Kedua, peninjau manusia tidak mengetahui penilaian mandiri yang dilakukan AI — mereka menilai transkrip berdasarkan maksud yang dinyatakan pelanggan, bukan berdasarkan apa pun yang diklaim AI telah dilakukan.
Ketiga, rubrik ini diterbitkan sebelum data apa pun diperiksa, agar kita tidak diam-diam mendefinisikan ulang “kesuksesan” begitu angkanya masuk.
Setiap panggilan dinilai pada tiga dimensi independen:
Sebuah panggilan hanya dihitung sebagai "kemenangan" jika berhasil menyelesaikan ketiganya: niat benar, tugas selesai, skor kebersihan 4 atau 5. Gerbang ketiga adalah gerbang yang secara diam-diam menghilangkan panggilan yang seharusnya kita sebut sukses.
Dari seluruh kumpulan data 8.427 panggilan, AI berhasil mengaktifkan ketiga gerbang tersebut 91.4% panggilan. Angka tersebut lebih tinggi dari perkiraan kami secara internal — sebagian besar dari kami bertaruh pada kisaran 85–88%.
Kesenjangan antara prediksi kami dan hasilnya bukanlah model yang lebih baik dari yang kami harapkan; intuisi kita dibentuk oleh panggilan-panggilan yang kita ingat, yang sebagian besar merupakan panggilan-panggilan buruk.
Dipecah berdasarkan jenis panggilan, perbedaannya signifikan:
Nomor pengaduan dan multi-masalah adalah yang kami fokuskan. Angka 96% pada pemesanan janji temu adalah apa yang kami kirimkan untuk memenangkan kesepakatan; angka 72% pada panggilan multi-masalah adalah apa yang kami kirimkan untuk mempertahankannya.
Kami beroperasi dalam 32 bahasa dan kami menerbitkan satu angka akurasi per bahasa. Kesenjangan agregat antara bahasa terbaik kami (Inggris-AS) dan bahasa yang paling tidak didukung (Vietnam) adalah 4,1 poin persentase — lebih kecil dari perkiraan kami, dan lebih sempit dari yang kami lihat dalam tolok ukur akademik yang dipublikasikan.
Namun skor agregat bahasa menyembunyikan bagian dari masalah yang sebenarnya penting: varians aksen dalam satu bahasa. Panggilan berbahasa Inggris yang ditangani di Amerika Serikat memperoleh skor 92,7%. Panggilan berbahasa Inggris dari pelanggan berbahasa India-Inggris memperoleh skor 91,3% — termasuk dalam tingkat kebisingan. Panggilan bahasa Inggris dari sangat regional Penutur bahasa Skotlandia-Inggris mendapat skor 83,4%. Itu adalah selisih 9 poin, dan seluruhnya berada di dalam kolom berlabel "Bahasa Inggris".
Intinya bukan karena model kita buruk dalam bahasa Inggris Skotlandia. Intinya adalah memublikasikan nomor per bahasa, sambil membiarkan varian aksen tidak terukur, adalah cara menyembunyikan panggilan yang gagal dilakukan oleh AI Anda. Kami sekarang melaporkan varian aksen secara internal, dan kami berharap dapat mempublikasikannya secara eksternal dalam waktu dua kuartal.
Saat kami mengelompokkan 723 panggilan tidak terjawab (8,6% dari kumpulan data), lima mode kegagalan menyumbang 81% di antaranya. Semua ini tidak akan mengejutkan siapa pun yang pernah mengirimkan AI suara sebelumnya, tetapi bobot relatifnya memang mengejutkan kami.
Penelepon memiliki dua maksud atau lebih dan AI berkomitmen pada maksud pertama sebelum mereka selesai menyatakan maksud kedua. "Saya ingin menjadwal ulang janji temu saya dan apakah Anda juga menjual model X-100" adalah masukan yang tepat untuk menghentikan pembicaraan.
Penelepon merujuk pada sesuatu yang dikatakan sebelumnya dalam percakapan yang tidak disimpan oleh AI sebagai konteks – nama, harga, tanggal. Ini adalah mode kegagalan yang paling langsung ditangani oleh jendela konteks generasi berikutnya.
Mengakhiri kegagalan. AI mulai berbicara, penelepon membicarakannya, AI mendengar suaranya sendiri bercampur dengan suara penelepon dan menghasilkan transkrip yang kehilangan separuh inputnya.
Penelepon menentukan nomor telepon atau alamat. AI membacanya kembali. Penelepon mengoreksi satu digit. AI memperbarui digit yang salah. Ini adalah masalah yang 100% dapat diperbaiki dengan permintaan konfirmasi data terstruktur, dan kami mengirimkannya pada bulan Februari.
AI dengan tepat mengidentifikasi bahwa ia tidak dapat menyelesaikan panggilan dan transfer — tetapi perutean transfer mengirimkannya ke antrean yang salah. Ini sebenarnya bukan kegagalan AI; ini adalah kegagalan dial-plan yang diungkap oleh AI.
Tiga perubahan yang dikirimkan merupakan hasil langsung dari penelitian ini, dan perubahan keempat sedang dalam pengembangan. Kami mencoba memberikan mode perbaikan per kegagalan dengan leverage tertinggi, bukan mode yang paling menarik secara akademis.
Perubahan keempat – buffer konteks per panggilan yang lebih kaya yang mengatasi penurunan konteks implisit – adalah yang paling kompleks dari keempatnya, dan sedang diuji coba dalam mode bayangan terhadap set panggilan yang ditunda sebelum diterapkan.
Satu temuan kecil yang patut disebutkan: para pengulas manusia, meskipun rubriknya diterbitkan, hanya bertahan selama tiga bulan. Pada bulan pertama, pengulas menandai 87% panggilan berhasil. Pada bulan ketiga, pengulas yang sama, yang menilai panggilan bulan pertama secara acak untuk kedua kalinya, menandai 91% sebagai berhasil. Transkripnya tidak berubah.
Penyimpangan tersebut bukanlah itikad buruk; itu adalah keakraban. Saat pengulas terbiasa dengan ungkapan AI, mereka menjadi lebih bermurah hati pada dimensi kebersihan percakapan. Kami menangkap hal ini dengan menilai ulang 5% sampel panggilan bulan pertama di bulan ketiga, dan kami mengoreksi nomor judulnya. 91,4% yang dilaporkan di atas adalah angka yang dikoreksi penyimpangan. Angka mentahnya adalah 92,1%.
Jika vendor memublikasikan nomor akurasi tanpa menjelaskan cara mereka mengontrol penyimpangan penilai manusia, secara default nomor tersebut dicurigai. Kami tidak menciptakan masalah ini; kami hanya memperhatikannya.
Tiga hal, dalam urutan prioritas. Pertama, akurasi penyelesaian aksen dalam setiap bahasa utama yang didukung — dan komitmen publik untuk mempublikasikannya setelah metodologinya stabil. Kedua, akurasi hasil pasca panggilan: apakah penelepon benar-benar menerima barang yang mereka datangi, diukur 7 dan 30 hari setelah panggilan dengan melakukan rekonsiliasi dengan sistem hilir pelanggan.
Ketiga, jumlah biaya per panggilan yang diselesaikan yang menggabungkan akurasi dengan keekonomian per menit — karena AI yang 98% akurat dengan biaya $1,40/menit kalah dengan AI 92% akurat yang berharga $0,18/menit, untuk hampir semua bisnis nyata.
Kami akan mempublikasikan kumpulan angka berikutnya di Q3. Jika mereka menunjukkan kemunduran, kami akan mempublikasikannya juga. Tujuan mengukur hal ini bukanlah untuk menemukan grafik yang bagus; itu untuk menemukan panggilan yang masih salah.
Resepsionis AI, rute grosir, nomor virtual — dibangun dalam satu platform dengan harga transparan dan NOC 24/7.