เหตุใดเราจึงจัดส่งใบรับรอง STIR/SHAKEN ในวันแรก
ผู้จำหน่ายโทรศัพท์ระบบคลาวด์ส่วนใหญ่ถือว่าการยืนยันหมายเลขผู้โทรเป็นคุณสมบัติระดับที่สูงกว่า ผู้ให้บริการไม่ได้ นี่คือเหตุผลที่เรากำหนดให้เป็นค่าเริ่มต้น และสิ่งที่เปลี่ยนแปลงสำหรับอัตราการตอบกลับขาออก
เป็นเวลาสามเดือนที่เราติดตามทุกการโทรที่ AI จัดการ — ตามภาษา ตามสำเนียง ตามประเภทการโทร — และให้คะแนนการถอดเสียงโดยเทียบกับผู้ตรวจสอบที่เป็นมนุษย์ ตัวเลขที่แม่นยำดีกว่าที่เราคาดไว้ โหมดความล้มเหลวมีความน่าสนใจมากขึ้น
ตัวเลข "ความแม่นยำของ AI" ส่วนใหญ่ที่คุณอ่านในสำเนาทางการตลาดนั้นไม่มีความหมายเลย พวกเขาเปรียบเทียบแบบจำลองบนชุดข้อมูลที่สะอาด ให้คะแนนชุดข้อมูลเทียบกับตัวมันเอง และสร้างตัวเลขที่แทบไม่เกี่ยวข้องกับประสิทธิภาพของระบบในบ่ายวันอังคารที่ลูกค้าโทรมาจากโกดังที่มีเสียงดังและถามคำถามสามข้อพร้อมกัน
เราต้องการตัวเลขที่มีความหมายบางอย่าง ดังนั้นเป็นเวลาสามเดือนระหว่างเดือนมกราคมถึงมีนาคม 2026 ทุกสายเรียกเข้าที่พนักงานต้อนรับ AI ของเราจัดการทั่วทั้งกลุ่มการผลิต - รวมสายทั้งหมด 8,427 สาย - ได้รับการถอดเสียง ให้คะแนนโดย AI แบบเรียลไทม์ จากนั้นจึงให้คะแนนใหม่อย่างอิสระโดยผู้ตรวจสอบที่เป็นมนุษย์ซึ่งไม่เคยเห็นคำตัดสินของ AI เลย
เราติดตามภาษา สำเนียง (หากระบุได้) ประเภทการโทร เวลาของวัน ความยาว และเส้นทางเฉพาะของการสนทนา
ประเด็นไม่ได้อยู่ที่การเผยแพร่ตัวเลขที่ประจบประแจง ประเด็นก็คือการค้นหาการโทรที่ AI คิดว่าสำเร็จและผิดพลาด และการเรียกร้องที่ AI แก้ไขปัญหาของลูกค้าได้อย่างแท้จริง แต่ตัวชี้วัดภายในของเราได้ทำเครื่องหมายว่าพลาด ทั้งสองชั้นเรียนมีขนาดใหญ่กว่าที่เราคาดไว้
มีกฎสามข้อ ประการแรก ไม่มีการเลือกเชอร์รี่: ทุกการโทรในช่วงเวลานั้นมีสิทธิ์ รวมถึงการโทร 47 สายที่ทำให้การสนทนากลางคันขัดข้อง และ 312 ที่ถูกโอนไปยังมนุษย์ภายใน 15 วินาทีแรก ประการที่สอง ผู้ตรวจสอบที่เป็นมนุษย์มองข้ามการประเมินตนเองของ AI โดยให้คะแนนการถอดเสียงตามความตั้งใจของลูกค้าที่ระบุไว้ ไม่ใช่เทียบกับสิ่งที่ AI อ้างว่าได้ทำไป
ประการที่สาม มีการเผยแพร่รูบริกก่อนที่จะดูข้อมูลใดๆ เพื่อป้องกันไม่ให้เราให้นิยาม "ความสำเร็จ" ใหม่อย่างเงียบๆ เมื่อมีตัวเลขเข้ามา
การโทรแต่ละครั้งได้รับคะแนนในสามมิติที่เป็นอิสระ:
การโทรจะนับเป็น "ชัยชนะ" เท่านั้นหากเคลียร์ทั้งสามรายการได้: ความตั้งใจที่ถูกต้อง งานที่สมบูรณ์ คะแนนสุขอนามัย 4 หรือ 5 ประตูที่สามคือประตูที่ตัดสายอย่างเงียบๆ ที่เราอาจจะเรียกว่าประสบความสำเร็จ
ในชุดข้อมูลการโทร 8,427 สายทั้งหมด AI สามารถเคลียร์เกตทั้งสามได้ 91.4% ของการโทร ตัวเลขนั้นสูงกว่าที่เราคาดการณ์ภายใน – พวกเราส่วนใหญ่มีการเดิมพันในช่วง 85–88%
ช่องว่างระหว่างการคาดการณ์ของเรากับผลลัพธ์ไม่ใช่แบบจำลองที่ดีกว่าที่เราคาดไว้ เป็นเพราะสัญชาตญาณของเราถูกกำหนดโดยเสียงเรียกที่เราจำได้ ซึ่งเป็นเสียงเรียกที่ไม่ดีอย่างไม่สมส่วน
เมื่อแยกตามประเภทการโทร ความแปรปรวนมีนัยสำคัญ:
จำนวนการร้องเรียนและปัญหาหลายประเด็นคือสิ่งที่เรามุ่งเน้น จำนวน 96% ในการจองการนัดหมายคือสิ่งที่เราจัดส่งเพื่อรับข้อเสนอ จำนวน 72% ของการโทรหลายประเด็นคือสิ่งที่เราจัดส่งเพื่อรักษาไว้
เราดำเนินงานใน 32 ภาษา และเผยแพร่ตัวเลขความแม่นยำเพียงตัวเลขเดียวต่อภาษา ช่องว่างรวมระหว่างภาษาที่ดีที่สุดของเรา (อังกฤษ-สหรัฐอเมริกา) และภาษาที่รองรับแย่ที่สุด (เวียดนาม) คือ 4.1 เปอร์เซ็นต์ ซึ่งแคบกว่าที่เราคาดไว้ และแคบกว่าที่เราเคยเห็นในรายงานในเกณฑ์มาตรฐานทางวิชาการที่เผยแพร่
แต่คะแนนภาษาโดยรวมจะซ่อนส่วนหนึ่งของปัญหาที่สำคัญจริงๆ นั่นก็คือ ความแปรปรวนของสำเนียงภายในภาษาเดียว การโทรด้วยภาษาอังกฤษในสหรัฐอเมริกาได้คะแนน 92.7% การโทรภาษาอังกฤษจากลูกค้าที่พูดภาษาอินเดีย-อังกฤษได้คะแนน 91.3% ซึ่งอยู่ในเสียงรบกวน ภาษาอังกฤษโทรจาก ในระดับภูมิภาคอย่างเข้มแข็ง ผู้พูดภาษาอังกฤษแบบสก็อตแลนด์ได้คะแนน 83.4% นั่นคือช่องว่าง 9 จุด และอยู่ภายในคอลัมน์ที่มีป้ายกำกับว่า "ภาษาอังกฤษ" ทั้งหมด
ประเด็นไม่ใช่ว่าแบบจำลองของเราไม่ดีในภาษาอังกฤษแบบสก็อต ประเด็นก็คือการเผยแพร่หมายเลขต่อภาษา โดยที่ไม่ต้องวัดความแปรปรวนของสำเนียง ก็เป็นวิธีการซ่อนการโทรที่ AI ของคุณล้มเหลว ขณะนี้เรากำลังรายงานความแปรปรวนของสำเนียงภายใน และคาดว่าจะเผยแพร่ภายนอกภายในสองไตรมาส
เมื่อเรารวมกลุ่มสายที่ไม่ได้รับ 723 สาย (8.6% ของชุดข้อมูล) โหมดความล้มเหลว 5 โหมดคิดเป็น 81% สิ่งเหล่านี้จะไม่ทำให้ใครก็ตามที่เคยส่ง AI ด้วยเสียงมาก่อน แต่น้ำหนักสัมพัทธ์ทำให้เราประหลาดใจ
ผู้โทรมีเจตนาตั้งแต่สองอย่างขึ้นไป และ AI กระทำต่อสิ่งแรกก่อนที่จะระบุเจตนาที่สองเสร็จ "ฉันต้องการกำหนดเวลาการนัดหมายใหม่และคุณจะขายรุ่น X-100 ด้วย" เป็นข้อมูลประเภทหนึ่งที่ทำให้เกิดสถานะการสนทนา
ผู้โทรอ้างอิงถึงบางสิ่งที่กล่าวไว้ก่อนหน้านี้ในการสนทนาว่า AI ไม่ได้จัดเก็บไว้เป็นบริบท เช่น ชื่อ ราคา วันที่ นี่คือโหมดความล้มเหลวที่หน้าต่างบริบทรุ่นถัดไประบุโดยตรงที่สุด
ความล้มเหลวในการสิ้นสุด AI เริ่มพูด ผู้โทรพูดถึงเสียงนั้น AI ได้ยินเสียงของตัวเองผสมกับเสียงของผู้โทร และสร้างข้อความถอดเสียงที่ขาดอินพุตไปครึ่งหนึ่ง
ผู้โทรบอกหมายเลขโทรศัพท์หรือที่อยู่ AI จะอ่านกลับ ผู้โทรแก้ไขตัวเลขหนึ่งหลัก AI อัพเดตตัวเลขผิด นี่เป็นปัญหาที่แก้ไขได้ 100% ด้วยข้อความแจ้งการยืนยันข้อมูลที่มีโครงสร้าง และเราจัดส่งไปในเดือนกุมภาพันธ์
AI ระบุได้อย่างถูกต้องว่าไม่สามารถแก้ปัญหาการโทรและการโอนได้ แต่เส้นทางการโอนจะส่งไปยังคิวที่ไม่ถูกต้อง นี่ไม่ใช่ความล้มเหลวของ AI จริงๆ มันเป็นความล้มเหลวของแผนการโทรที่ AI เปิดโปง
การเปลี่ยนแปลงที่จัดส่งไปแล้วสามรายการมาจากการศึกษาโดยตรง และการเปลี่ยนแปลงที่สี่อยู่ในระหว่างการพัฒนา เราพยายามจัดส่งการแก้ไขที่มีเลเวอเรจสูงสุดต่อโหมดความล้มเหลว แทนที่จะเป็นแบบที่น่าสนใจทางวิชาการมากที่สุด
การเปลี่ยนแปลงครั้งที่สี่ — บัฟเฟอร์บริบทต่อการโทรที่สมบูรณ์ยิ่งขึ้น ซึ่งจัดการกับการลดลงของบริบทโดยนัย — ถือเป็นการเปลี่ยนแปลงที่ซับซ้อนที่สุดในสี่ประการนี้ และกำลังถูกทดลองใช้ในโหมดเงากับชุดการโทรที่ถูกพักไว้ก่อนที่จะใช้งานจริง
การค้นพบเล็กๆ น้อยๆ อย่างหนึ่งที่ควรค่าแก่การเอ่ยชื่อ: ผู้ตรวจสอบที่เป็นมนุษย์ แม้จะมีรูบริกที่เผยแพร่แล้ว แต่ก็เลื่อนลอยไปตลอดสามเดือน ในเดือนที่หนึ่ง ผู้ตรวจสอบทำเครื่องหมายว่าการโทร 87% ประสบความสำเร็จ ในเดือนที่สาม ผู้ตรวจสอบคนเดิมซึ่งสุ่มให้คะแนนการโทรเดือนที่หนึ่งเป็นครั้งที่สอง ถือว่าประสบความสำเร็จ 91% การถอดเสียงไม่ได้เปลี่ยนแปลง
การล่องลอยไม่ใช่ความศรัทธาที่ไม่ดี มันเป็นความคุ้นเคย เมื่อผู้ตรวจสอบคุ้นเคยกับการใช้ถ้อยคำของ AI พวกเขาก็เริ่มมีน้ำใจมากขึ้นในมิติด้านสุขอนามัยของการสนทนา เราตรวจพบสิ่งนี้โดยการให้คะแนนตัวอย่างการโทร 5% ของเดือนแรกในเดือนที่สาม และเราได้แก้ไขหมายเลขพาดหัวสำหรับการโทรดังกล่าว 91.4% ที่รายงานข้างต้นเป็นตัวเลขที่แก้ไขดริฟท์แล้ว จำนวนดิบอยู่ที่ 92.1%
หากผู้จำหน่ายเผยแพร่หมายเลขความแม่นยำโดยไม่ได้อธิบายวิธีการควบคุมการเคลื่อนตัวของตัวให้คะแนนโดยมนุษย์ หมายเลขนั้นจะถูกสงสัยตามค่าเริ่มต้น เราไม่ได้สร้างปัญหานี้ขึ้นมา เราแค่ให้ความสนใจกับมัน
สามสิ่งตามลำดับความสำคัญ ประการแรก ความแม่นยำที่ได้รับการแก้ไขตามสำเนียงภายในภาษาหลักแต่ละภาษาที่รองรับ และความมุ่งมั่นสาธารณะในการเผยแพร่เมื่อวิธีการมีเสถียรภาพ ประการที่สอง ความแม่นยำของผลลัพธ์หลังการโทร: ผู้โทรได้รับสิ่งที่พวกเขาต้องการจริงหรือไม่ โดยวัดผลใน 7 และ 30 วันหลังการโทร โดยการกระทบยอดกับระบบดาวน์สตรีมของลูกค้า
ประการที่สาม หมายเลขต้นทุนต่อการโทรที่ได้รับการแก้ปัญหาที่รวมความแม่นยำเข้ากับการประหยัดต่อนาที เนื่องจาก AI ที่แม่นยำ 98% ซึ่งมีราคา 1.40 ดอลลาร์สหรัฐฯ/นาที สูญเสีย AI ที่แม่นยำ 92% ซึ่งมีราคา 0.18 ดอลลาร์/นาที สำหรับเกือบทุกธุรกิจจริง
เราจะเผยแพร่ตัวเลขชุดถัดไปในไตรมาสที่ 3 หากพวกเขาแสดงการถดถอยเราจะเผยแพร่สิ่งนั้นด้วย จุดประสงค์ของการวัดสิ่งนี้ไม่ใช่การหาแผนภูมิที่ประจบประแจง มันคือการค้นหาการโทรที่เรายังคงผิดพลาด
พนักงานต้อนรับ AI เส้นทางการค้าส่ง หมายเลขเสมือน สร้างขึ้นบนแพลตฟอร์มเดียวด้วยราคาที่โปร่งใส และ NOC ตลอด 24 ชั่วโมงทุกวัน