giriiş
Pazarlama metinlerinde okuduğunuz "Yapay Zeka doğruluğu" rakamlarının çoğu oldukça anlamsızdır. Bir modeli temiz bir veri kümesi üzerinde kıyaslarlar, veri kümesini kendisine göre puanlarlar ve bir müşterinin gürültülü bir depodan arayıp aynı anda üç soru sorduğu Salı öğleden sonra sistemin performansıyla neredeyse hiçbir ilgisi olmayan bir sayı üretirler.
Bir anlamı olan bir sayı istedik. Yani Ocak ve Mart 2026 arasındaki üç ay boyunca, yapay zeka resepsiyonistimizin üretim filosunda ele aldığı her çağrı (toplamda 8.427 çağrı) yazıya geçirildi, gerçek zamanlı olarak yapay zeka tarafından derecelendirildi ve ardından yapay zeka kararını hiç görmeyen bir insan incelemeci tarafından bağımsız olarak yeniden derecelendirildi.
Dili, aksanı (tanımlanabildiği yerde), çağrı türünü, günün saatini, uzunluğunu ve konuşmanın izlediği yolu takip ettik.
Önemli olan gurur verici bir sayı yayınlamak değildi. Önemli olan, yapay zekanın başarılı olduğunu ve hatalı olduğunu düşündüğü çağrıları ve yapay zekanın müşterinin sorununu gerçekten çözdüğü ancak dahili ölçümlerimizin bunu kaçırılmış olarak işaretlediği çağrıları bulmaktı. Her iki sınıf da beklediğimizden daha büyüktü.
Çağrıları nasıl örnekledik ve derecelendirdik?
Üç kural vardı. Birincisi, rastgele seçim yok: Konuşmanın ortasında kesilen 47 çağrı ve ilk 15 saniye içinde bir insana aktarılan 312 çağrı da dahil olmak üzere, dönem boyunca her çağrı uygundu. İkincisi, insan incelemeciler yapay zekanın öz değerlendirmesine karşı kördü; transkripti, yapay zekanın yaptığını iddia ettiği şeye göre değil, müşterinin belirttiği niyetine göre derecelendirdiler.
Üçüncüsü, rakamlar geldikten sonra "başarıyı" sessizce yeniden tanımlamamızı engellemek için değerlendirme listesi herhangi bir veriye bakılmadan önce yayınlandı.
Her çağrı üç bağımsız boyutta puanlandı:
- Niyet yakalama — Yapay zeka, arayanın gerçekte ne yapmaya çalıştığını doğru bir şekilde tanımladı mı? (İkili: evet/hayır.)
- Görev tamamlama - Arayanın belirttiği ihtiyaç bu çağrıda gerçekten çözülmüş müydü, yoksa arayanın istemediği bir insan takibini mi gerektiriyordu?
- Konuşma hijyeni — Transkript halüsinasyonlardan, sahte vaatlerden veya çelişkilerden arınmış mıydı? İncelemeyi yapan kişi tarafından 1-5 arasında derecelendirildi.
Bir çağrı ancak üçünü de giderirse "kazanç" olarak sayılırdı: doğru niyet, görevi tamamlama, 4 veya 5 hijyen puanı. Üçüncü kapı, normalde başarı diyeceğimiz çağrıları sessizce ortadan kaldıran kapıdır.
Başlık numaraları
Yapay zeka, 8.427 çağrı veri kümesinin tamamında üç kapıyı da temizledi. 91.4% aramaların. Bu sayı dahili olarak tahmin ettiğimizden daha yüksekti; çoğumuzun bahisleri %85-88 aralığındaydı.
Tahminimizle sonuç arasındaki fark beklediğimizden daha iyi çıkan bir model olmadı; Sezgilerimiz, orantısız olarak kötü olan, hatırladığımız çağrılar tarafından şekilleniyordu.
Çağrı türüne göre bakıldığında fark önemliydi:
- Randevu rezervasyonu — %96,1 (en basit yol, iyi prova edilmiş niyet)
- Genel bilgi — %93,8 (saat, konum, hizmetler)
- Fiyatlandırma soruları — %89,2 (bazı fiyatlandırma yolları belirsizliğin netleştirilmesini gerektiriyor)
- İptal / yeniden planlama — 87.6%
- Şikayetler ve üst kademelere iletmeler — 78.3%
- Çok konulu aramalar — %71,9 (aynı çağrıda iki veya daha fazla bağımsız niyet)
Şikayet ve çoklu konu numaraları odaklandığımız numaralardır. Randevu rezervasyonunda %96'lık bir rakam, anlaşma kazanmak için gönderdiğimiz şeydir; Çoklu konu çağrılarında %72'lik bir rakam, onları korumak için gönderdiğimiz şeydir.
Dil ve aksan: sürprizlerin yaşandığı yer
32 dilde faaliyet gösteriyoruz ve her dil için tek bir doğruluk numarası yayınlıyoruz. En iyi dilimiz (İngilizce-ABD) ile en kötü desteklenen dilimiz (Vietnamca) arasındaki toplam fark yüzde 4,1 idi; beklediğimizden daha dardı ve yayınlanmış akademik kıyaslamalarda bildirilenlerden daha dardı.
Ancak toplam dil puanları, sorunun gerçekten önemli olan kısmını gizler: tek bir dildeki aksan farklılığı. Amerika Birleşik Devletleri'nde yapılan İngilizce aramaların oranı %92,7 oldu. Hintçe-İngilizce konuşan müşterilerden gelen İngilizce çağrılar %91,3 puan aldı; bu da gürültünün oldukça dahilinde. İngilizce çağrılar son derece bölgesel İskoç İngilizcesi konuşanlar %83,4 puan aldı. Bu 9 puanlık bir farktır ve tamamen "İngilizce" etiketli sütunun içinde yer almaktadır.
Mesele modelimizin İskoç İngilizcesinin kötü olması değil. Önemli olan nokta, her dil için bir sayı yayınlamanın, aksan farkını ölçülmeden bırakmanın, yapay zekanızın başarısız olduğu çağrıları gizlemenin bir yolu olmasıdır. Şu anda aksan farklılıklarını dahili olarak rapor ediyoruz ve bunu iki çeyrek içinde harici olarak yayınlamayı bekliyoruz.
Kaçırılanların %80'ini açıklayan beş arıza modu
723 cevapsız çağrıyı (veri kümesinin %8,6'sı) kümelediğimizde, bunların %81'ini beş hata modu oluşturuyordu. Bunların hiçbiri daha önce sesli yapay zeka gönderen kimseyi şaşırtmayacaktır, ancak göreceli ağırlıklar bizi şaşırttı.
1. Niyet yığınlama (ıskalamaların %29'u)
Arayanın iki veya daha fazla amacı var ve yapay zeka, ikinciyi belirtmeyi bitirmeden ilkini taahhüt ediyor. "Randevumu yeniden planlamak istiyorum ve ayrıca X-100 modelini satıyor musunuz?" tam olarak konuşma durumunu bozan türden bir girdidir.
2. Örtülü bağlam düşüşü (%22)
Arayan kişi, konuşmanın başında söylenen ve yapay zekanın bağlam olarak saklamadığı bir şeye (isim, fiyat, tarih) atıfta bulunuyor. Bu, yeni nesil bağlam penceresinin en doğrudan ele aldığı arıza modudur.
3. Arayan kişi istem hakkında konuştu (%15)
Uç nokta hataları. Yapay zeka konuşmaya başlar, arayan kişi bunun üzerine konuşur, yapay zeka kendi sesini arayanın sesiyle karıştırılarak duyar ve girdinin yarısının eksik olduğu bir transkript üretir.
4. Sayı okuma hataları (%9)
Arayan bir telefon numarası veya adresi belirler. AI bunu geri okur. Arayan bir rakamı düzeltir. AI yanlış rakamı güncelliyor. Bu, yapılandırılmış veri onay istemiyle %100 çözülebilir bir sorundur ve Şubat ayında bir tane gönderdik.
5. Yanlış aktarım (%6)
Yapay zeka, çağrıyı ve aktarımları çözemediğini doğru bir şekilde tespit ediyor ancak aktarım yönlendirmesi bunu yanlış kuyruğa gönderiyor. Bu aslında bir yapay zeka hatası değil; Yapay zekanın ortaya çıkardığı bir arama planı hatasıdır.
Bu çalışma nedeniyle gönderdiklerimiz
Gönderilen üç değişiklik doğrudan çalışmadan çıktı ve dördüncüsü geliştirme aşamasında. Akademik açıdan en ilgi çekici olandan ziyade, başarısızlık modu başına en yüksek kaldıraçlı düzeltmeyi sunmaya çalıştık.
- Çok amaçlı dedektör. Niyet yakalamayla paralel çalışan ve iki veya daha fazla bağımsız amaç içeren ifadeleri işaretleyen küçük bir sınıflandırıcı. İşaretlendiğinde konuşma duraklıyor ve yapay zeka açıkça şunu sıralıyor: "Yeniden planlamak istediğinizi duydum ve ayrıca X-100 hakkında da soru sordunuz. Önce yeniden planlamayı yapalım - olur mu?" Sınıflandırıcı, 11 ms gecikme ekledi ve niyet istifleme hatalarını %64 oranında azalttı.
- Yapılandırılmış numara onayı. Herhangi bir telefon numarası, adres veya tutar artık tek haneli düzenleme işleyicisi ile tekrar okuma sırasında haneli olarak onaylanıyor. Sayı tekrarı kaçırmaları %88 azaldı.
- Uç nokta yeniden kalibrasyonu. Sessizlik eşiğini dil başına yeniden ayarladık ve "bu düşünceyi bitirdin mi?" şüpheli kesilme durumunda iyileşme. Konuşma başarısızlıkları, ıskalama setinin %15'inden %9'una düştü.
Dördüncü değişiklik (örtük bağlam düşüşünü ele alan, çağrı başına daha zengin bir bağlam arabelleği), dördü arasında en karmaşık olanıdır ve yayınlanmadan önce ertelenen bir çağrı kümesine karşı gölge modunda denenmektedir.
İnsan tasnif makinesinin sürüklenmesi üzerine bir not
Adlandırmaya değer küçük bir bulgu: İnsan incelemeciler, yayınlanmış bir değerlendirme tablosuna rağmen üç ay boyunca sürüklendiler. Birinci ayda incelemeciler çağrıların %87'sini başarılı olarak işaretledi. Üçüncü ayda, aynı incelemeciler rastgele seçilen birinci ay çağrılarını ikinci kez puanlayarak %91'i başarılı olarak işaretlediler. Transkriptler değişmemişti.
Bu sürüklenme kötü niyetli değildi; bu bir aşinalıktı. İncelemeciler yapay zekanın ifadelerine alıştıkça, konuşma hijyeni boyutu konusunda daha cömert olmaya başladılar. Bunu, üçüncü aydaki birinci ay aramalarının %5'lik bir örneğini yeniden puanlayarak yakaladık ve bunun başlık numarasını düzelttik. Yukarıda bildirilen %91,4, sürüklenmeyle düzeltilmiş rakamdır. Ham sayı %92,1 idi.
Bir satıcı, insan tasnif makinesinin sapmasını nasıl kontrol ettiğini açıklamadan bir doğruluk numarası yayınlarsa, bu sayı varsayılan olarak şüphelidir. Bu sorunu biz icat etmedik; biz sadece ona dikkat ettik.
Bundan sonra neyi ölçeceğiz
Öncelik sırasına göre üç şey. İlk olarak, desteklenen her ana dildeki aksan çözümlemeli doğruluk ve metodoloji stabil hale geldikten sonra bunu yayınlamaya yönelik kamu taahhüdü. İkincisi, arama sonrası sonuç doğruluğu: Arayanın, almak istediği şeyi gerçekten alıp almadığı, müşterinin alt sistemiyle mutabakata varılarak aramadan 7 ve 30 gün sonra ölçülmüştür.
Üçüncüsü, doğruluğu dakika başına ekonomiyle birleştiren çözümlenen çağrı başına maliyet sayısıdır; çünkü neredeyse tüm gerçek işlerde, maliyeti 1,40 ABD doları/dakika olan %98 doğru bir yapay zeka, 0,18 ABD doları/dakika maliyeti olan %92 doğru bir yapay zekaya yenilir.
Bir sonraki sayı grubunu 3. çeyrekte yayınlayacağız. Eğer gerileme gösterirlerse onu da yayınlayacağız. Bu şeyleri ölçmenin amacı gurur verici bir tablo bulmak değil; hala yanlış yaptığımız çağrıları bulmaktır.