İletişim Merkezi Çözümleri: Özellikler, Avantajlar ve Nasıl Seçilir
İletişim merkezi nedir, çağrı merkezinden farkı, temel özellikleri, bulut avantajları, platformun nasıl seçileceği ve performansı ölçen KPI'lar.
Üç ay boyunca yapay zekanın ele aldığı her çağrıyı dile, aksanına, çağrı türüne göre izledik ve transkripti bir insan incelemeciye göre derecelendirdik. Doğruluk rakamları beklediğimizden daha iyiydi. Arıza modları daha ilginçti.
Pazarlama metinlerinde okuduğunuz "Yapay Zeka doğruluğu" rakamlarının çoğu oldukça anlamsızdır. Bir modeli temiz bir veri kümesi üzerinde kıyaslarlar, veri kümesini kendisine göre puanlarlar ve bir müşterinin gürültülü bir depodan arayıp aynı anda üç soru sorduğu Salı öğleden sonra sistemin performansıyla neredeyse hiçbir ilgisi olmayan bir sayı üretirler.
Bir anlamı olan bir sayı istedik. Yani Ocak ve Mart 2026 arasındaki üç ay boyunca, yapay zeka resepsiyonistimizin üretim filosunda ele aldığı her çağrı (toplamda 8.427 çağrı) yazıya geçirildi, gerçek zamanlı olarak yapay zeka tarafından derecelendirildi ve ardından yapay zeka kararını hiç görmeyen bir insan incelemeci tarafından bağımsız olarak yeniden derecelendirildi.
Dili, aksanı (tanımlanabildiği yerde), çağrı türünü, günün saatini, uzunluğunu ve konuşmanın izlediği yolu takip ettik.
Önemli olan gurur verici bir sayı yayınlamak değildi. Önemli olan, yapay zekanın başarılı olduğunu ve hatalı olduğunu düşündüğü çağrıları ve yapay zekanın müşterinin sorununu gerçekten çözdüğü ancak dahili ölçümlerimizin bunu kaçırılmış olarak işaretlediği çağrıları bulmaktı. Her iki sınıf da beklediğimizden daha büyüktü.
Üç kural vardı. Birincisi, rastgele seçim yok: Konuşmanın ortasında kesilen 47 çağrı ve ilk 15 saniye içinde bir insana aktarılan 312 çağrı da dahil olmak üzere, dönem boyunca her çağrı uygundu. İkincisi, insan incelemeciler yapay zekanın öz değerlendirmesine karşı kördü; transkripti, yapay zekanın yaptığını iddia ettiği şeye göre değil, müşterinin belirttiği niyetine göre derecelendirdiler.
Üçüncüsü, rakamlar geldikten sonra "başarıyı" sessizce yeniden tanımlamamızı engellemek için değerlendirme listesi herhangi bir veriye bakılmadan önce yayınlandı.
Her çağrı üç bağımsız boyutta puanlandı:
Bir çağrı yalnızca üçünü de giderirse "kazanç" olarak sayılırdı: doğru niyet, görevi tamamlama, 4 veya 5 hijyen puanı. Üçüncü kapı, normalde başarı diyeceğimiz çağrıları sessizce ortadan kaldıran kapıdır.
Yapay zeka, 8.427 çağrı veri kümesinin tamamında üç kapıyı da temizledi. 91.4% aramaların. Bu sayı dahili olarak tahmin ettiğimizden daha yüksekti; çoğumuzun bahisleri %85-88 aralığındaydı.
Tahminimizle sonuç arasındaki fark beklediğimizden daha iyi çıkan bir model olmadı; Sezgilerimiz, orantısız olarak kötü olan, hatırladığımız çağrılar tarafından şekilleniyordu.
Çağrı türüne göre bakıldığında fark önemliydi:
Şikayet ve çoklu konu numaraları odaklandığımız numaralardır. Randevu rezervasyonunda %96'lık bir rakam, anlaşma kazanmak için gönderdiğimiz şeydir; Çoklu konu çağrılarında %72'lik bir rakam, onları korumak için gönderdiğimiz şeydir.
32 dilde faaliyet gösteriyoruz ve her dil için tek bir doğruluk numarası yayınlıyoruz. En iyi dilimiz (İngilizce-ABD) ile en kötü desteklenen dilimiz (Vietnamca) arasındaki toplam fark yüzde 4,1 idi; beklediğimizden daha dardı ve yayınlanmış akademik kıyaslamalarda bildirilenden daha dardı.
Ancak toplam dil puanları, sorunun gerçekten önemli olan kısmını gizler: tek bir dildeki aksan farklılığı. Amerika Birleşik Devletleri'nde yapılan İngilizce aramaların oranı %92,7 oldu. Hintçe-İngilizce konuşan müşterilerden gelen İngilizce çağrılar %91,3 puan aldı; bu da gürültünün oldukça dahilinde. İngilizce çağrılar son derece bölgesel İskoç İngilizcesi konuşanlar %83,4 puan aldı. Bu 9 puanlık bir farktır ve tamamen "İngilizce" etiketli sütunun içinde yer almaktadır.
Mesele modelimizin İskoç İngilizcesinin kötü olması değil. Mesele şu ki, dil başına bir sayı yayınlamak, aksan farkını ölçülmeden bırakmak, yapay zekanızın başarısız olduğu çağrıları gizlemenin bir yoludur. Şu anda aksan farklılıklarını dahili olarak rapor ediyoruz ve bunu iki çeyrek içinde harici olarak yayınlamayı bekliyoruz.
723 cevapsız çağrıyı (veri kümesinin %8,6'sı) kümelediğimizde, bunların %81'ini beş hata modu oluşturuyordu. Bunların hiçbiri daha önce sesli yapay zeka gönderen kimseyi şaşırtmayacaktır, ancak göreceli ağırlıklar bizi şaşırttı.
Arayanın iki veya daha fazla amacı var ve yapay zeka, ikinciyi belirtmeyi bitirmeden ilkini taahhüt ediyor. "Randevumu yeniden planlamak istiyorum ve ayrıca X-100 modelini satıyor musunuz?" tam olarak konuşma durumunu bozan türden bir girdidir.
Arayan kişi, konuşmanın başında söylenen ve yapay zekanın bağlam olarak saklamadığı bir şeye (isim, fiyat, tarih) atıfta bulunuyor. Bu, yeni nesil bağlam penceresinin en doğrudan ele aldığı arıza modudur.
Uç nokta hataları. Yapay zeka konuşmaya başlar, arayan kişi bunun üzerine konuşur, yapay zeka kendi sesini arayanın sesiyle karıştırılarak duyar ve girdinin yarısının eksik olduğu bir transkript üretir.
Arayan bir telefon numarası veya adresi belirler. AI bunu geri okur. Arayan bir rakamı düzeltir. AI yanlış rakamı güncelliyor. Bu, yapılandırılmış veri onay istemiyle %100 çözülebilir bir sorundur ve Şubat ayında bir tane gönderdik.
Yapay zeka, çağrıyı ve aktarımları çözemediğini doğru bir şekilde tespit ediyor ancak aktarım yönlendirmesi bunu yanlış kuyruğa gönderiyor. Bu aslında bir yapay zeka hatası değil; Yapay zekanın ortaya çıkardığı bir arama planı hatasıdır.
Gönderilen üç değişiklik doğrudan çalışmadan çıktı ve dördüncüsü geliştirme aşamasında. Akademik açıdan en ilgi çekici olandan ziyade, başarısızlık modu başına en yüksek kaldıraçlı düzeltmeyi sunmaya çalıştık.
Dördüncü değişiklik (örtük bağlam düşüşünü ele alan, çağrı başına daha zengin bir bağlam arabelleği), dördü arasında en karmaşık olanıdır ve yayınlanmadan önce ertelenen bir çağrı kümesine karşı gölge modunda denenmektedir.
Adlandırmaya değer küçük bir bulgu: İnsan incelemeciler, yayınlanmış bir değerlendirme tablosuna rağmen üç ay boyunca sürüklendiler. Birinci ayda incelemeciler çağrıların %87'sini başarılı olarak işaretledi. Üçüncü ayda, aynı incelemeciler rastgele seçilen birinci ay çağrılarını ikinci kez puanlayarak %91'i başarılı olarak işaretlediler. Transkriptler değişmemişti.
Bu sürüklenme kötü niyetli değildi; bu bir aşinalıktı. İncelemeciler yapay zekanın ifadelerine alıştıkça, konuşma hijyeni boyutu konusunda daha cömert olmaya başladılar. Bunu, üçüncü aydaki birinci ay aramalarının %5'lik bir örneğini yeniden puanlayarak yakaladık ve bunun başlık numarasını düzelttik. Yukarıda bildirilen %91,4, sürüklenmeyle düzeltilmiş rakamdır. Ham sayı %92,1 idi.
Bir satıcı, insan tasnif makinesinin sapmasını nasıl kontrol ettiğini açıklamadan bir doğruluk numarası yayınlarsa, bu sayı varsayılan olarak şüphelidir. Bu sorunu biz icat etmedik; biz sadece ona dikkat ettik.
Öncelik sırasına göre üç şey. İlk olarak, desteklenen her ana dildeki aksan çözümlemeli doğruluk ve metodoloji stabil hale geldikten sonra bunu yayınlamaya yönelik kamu taahhüdü. İkincisi, arama sonrası sonuç doğruluğu: Arayanın, almak istediği şeyi gerçekten alıp almadığı, müşterinin alt sistemiyle mutabakata varılarak aramadan 7 ve 30 gün sonra ölçülmüştür.
Üçüncüsü, doğruluğu dakika başına ekonomiyle birleştiren çözümlenen çağrı başına maliyet sayısıdır; çünkü neredeyse tüm gerçek işlerde, maliyeti 1,40 ABD doları/dakika olan %98 doğru bir yapay zeka, 0,18 ABD doları/dakika maliyeti olan %92 doğru bir yapay zekaya yenilir.
Bir sonraki sayı grubunu 3. çeyrekte yayınlayacağız. Eğer gerileme gösterirlerse onu da yayınlayacağız. Bu şeyleri ölçmenin amacı gurur verici bir tablo bulmak değil; hala yanlış yaptığımız çağrıları bulmaktır.
Yapay zekalı resepsiyon görevlileri, toptan satış rotaları, sanal numaralar; şeffaf fiyatlandırma ve 7/24 NOC ile tek bir platform üzerinde oluşturulmuştur.