परिचय
मार्केटिंग कॉपी में आपके द्वारा पढ़े गए अधिकांश "एआई सटीकता" नंबर चुपचाप अर्थहीन हैं। वे एक स्वच्छ डेटासेट पर एक मॉडल को बेंचमार्क करते हैं, डेटासेट को उसके विरुद्ध स्कोर करते हैं, और एक संख्या उत्पन्न करते हैं जिसका इस बात से लगभग कोई लेना-देना नहीं है कि सिस्टम मंगलवार की दोपहर को कैसा प्रदर्शन करता है जब कोई ग्राहक शोरगुल वाले गोदाम से कॉल कर रहा होता है और एक साथ तीन प्रश्न पूछ रहा होता है।
हम एक ऐसा नंबर चाहते थे जिसका कुछ मतलब हो। इसलिए जनवरी और मार्च 2026 के बीच तीन महीनों के लिए, हमारे एआई रिसेप्शनिस्ट द्वारा उत्पादन बेड़े में संभाली गई प्रत्येक कॉल - कुल मिलाकर 8,427 कॉल - को ट्रांसक्राइब किया गया, वास्तविक समय में एआई द्वारा वर्गीकृत किया गया, फिर एक मानव समीक्षक द्वारा स्वतंत्र रूप से पुन: वर्गीकृत किया गया, जिसने एआई फैसले को कभी नहीं देखा।
हमने भाषा, उच्चारण (जहां पहचान योग्य हो), कॉल का प्रकार, दिन का समय, लंबाई और बातचीत के विशिष्ट मार्ग को ट्रैक किया।
मुद्दा एक चापलूसी संख्या प्रकाशित करने का नहीं था। मुद्दा उन कॉलों को ढूंढना था जहां एआई ने सोचा था कि यह सफल हो गया था और गलत था, और उन कॉलों को ढूंढना था जहां एआई ने वास्तव में ग्राहक की समस्या का समाधान किया था लेकिन हमारे आंतरिक मेट्रिक्स ने इसे मिस के रूप में चिह्नित किया था। दोनों कक्षाएँ हमारी अपेक्षा से अधिक बड़ी थीं।
हमने कॉल का नमूना और वर्गीकरण कैसे किया
तीन नियम थे. सबसे पहले, कोई चेरी-पिकिंग नहीं: इस अवधि के दौरान प्रत्येक कॉल योग्य थी, जिसमें 47 कॉल शामिल थीं जो बातचीत के बीच में क्रैश हो गईं और 312 कॉल जो पहले 15 सेकंड के भीतर एक मानव को स्थानांतरित कर दी गई थीं। दूसरा, मानव समीक्षक एआई के आत्म-मूल्यांकन के प्रति अंधे थे - उन्होंने प्रतिलेख को ग्राहक के घोषित इरादे के विरुद्ध वर्गीकृत किया, न कि एआई ने जो भी दावा किया था उसके विरुद्ध।
तीसरा, किसी भी डेटा को देखने से पहले रूब्रिक प्रकाशित किया गया था, ताकि संख्याएं आने के बाद हमें चुपचाप "सफलता" को फिर से परिभाषित करने से रोका जा सके।
प्रत्येक कॉल को तीन स्वतंत्र आयामों पर स्कोर किया गया:
- इरादे पर कब्जा - क्या एआई ने सही ढंग से पहचाना कि कॉल करने वाला वास्तव में क्या करने की कोशिश कर रहा था? (बाइनरी: हाँ/नहीं।)
- कार्य पूर्ण होना - क्या वास्तव में इस कॉल पर कॉल करने वाले की बताई गई आवश्यकता का समाधान हो गया था, या क्या इसके लिए मानवीय अनुवर्ती कार्रवाई की आवश्यकता थी जो कॉल करने वाले ने नहीं मांगी थी?
- वार्तालाप स्वच्छता - क्या प्रतिलेख मतिभ्रम, झूठे वादों या विरोधाभासों से मुक्त था? समीक्षक द्वारा 1-5 ग्रेड दिया गया।
एक कॉल को केवल "जीत" के रूप में गिना जाता था यदि यह तीनों को पूरा करती: सही इरादा, पूरा कार्य, 4 या 5 का स्वच्छता स्कोर। तीसरा द्वार वह है जिसने चुपचाप कॉल को समाप्त कर दिया जिसे हम अन्यथा सफलता कहते।
शीर्षक संख्याएँ
संपूर्ण 8,427-कॉल डेटासेट में, एआई ने सभी तीन गेटों को साफ़ कर दिया 91.4% कॉल की. यह संख्या हमारी आंतरिक भविष्यवाणी से अधिक थी - हममें से अधिकांश ने 85-88% रेंज में दांव लगाए थे।
हमारी भविष्यवाणी और परिणाम के बीच का अंतर हमारी अपेक्षा से बेहतर होने वाला मॉडल नहीं था; ऐसा यह था कि हमारा अंतर्ज्ञान उन कॉलों से आकार ले रहा था जो हमें याद थीं, जो कि बहुत बुरी थीं।
कॉल प्रकार के अनुसार विभाजित, भिन्नता महत्वपूर्ण थी:
- अपॉइंटमेंट बुकिंग - 96.1% (सबसे सरल मार्ग, अच्छी तरह से अभ्यास किया गया इरादा)
- सामान्य जानकारी — 93.8% (घंटे, स्थान, सेवाएँ)
- मूल्य निर्धारण संबंधी पूछताछ - 89.2% (कुछ मूल्य निर्धारण पथों को स्पष्ट करने की आवश्यकता है)
- रद्दीकरण/पुनर्निर्धारण — 87.6%
- शिकायतें और वृद्धि — 78.3%
- बहु-मुद्दे वाली कॉलें - 71.9% (एक ही कॉल में दो या दो से अधिक स्वतंत्र इरादे)
शिकायत और बहु-मुद्दे संख्याएँ वे हैं जिन पर हमने ध्यान केंद्रित किया है। अपॉइंटमेंट बुकिंग पर 96% संख्या वह है जिसे हम सौदे जीतने के लिए भेजते हैं; बहु-मुद्दे कॉलों पर 72% नंबर वह है जो हम उन्हें रखने के लिए भेजते हैं।
भाषा और उच्चारण: जहां आश्चर्य रहते थे
हम 32 भाषाओं में काम करते हैं और हम प्रति भाषा एक सटीकता संख्या प्रकाशित करते हैं। हमारी सबसे अच्छी भाषा (अंग्रेजी-यूएस) और हमारी सबसे खराब समर्थित भाषा (वियतनामी) के बीच कुल अंतर 4.1 प्रतिशत अंक था - हमारी अपेक्षा से कम, और प्रकाशित अकादमिक बेंचमार्क में रिपोर्ट की तुलना में कम।
लेकिन कुल भाषा स्कोर समस्या के उस हिस्से को छिपाते हैं जो वास्तव में मायने रखता है: एक ही भाषा के भीतर उच्चारण भिन्नता। संयुक्त राज्य अमेरिका में प्रबंधित अंग्रेजी कॉलों का स्कोर 92.7% था। भारतीय-अंग्रेज़ी भाषी ग्राहकों की अंग्रेज़ी कॉलों का स्कोर 91.3% रहा - शोर के भीतर भी। अंग्रेजी से कॉल दृढ़ता से क्षेत्रीय स्कॉटिश-अंग्रेजी बोलने वालों ने 83.4% अंक प्राप्त किये। यह 9-बिंदु का अंतर है, और यह पूरी तरह से "अंग्रेजी" लेबल वाले कॉलम के अंदर रहता है।
मुद्दा यह नहीं है कि स्कॉटिश अंग्रेजी में हमारा मॉडल खराब है। मुद्दा यह है कि उच्चारण भिन्नता को बिना मापे छोड़कर, प्रति-भाषा संख्या प्रकाशित करना, उन कॉलों को छिपाने का एक तरीका है जिन पर आपका एआई विफल हो रहा है। अब हम आंतरिक रूप से उच्चारण भिन्नता की रिपोर्ट कर रहे हैं, और हम इसे दो तिमाहियों के भीतर बाहरी रूप से प्रकाशित करने की उम्मीद करते हैं।
पाँच विफलता मोड जो 80% चूकों की व्याख्या करते हैं
जब हमने 723 मिस्ड कॉल (डेटासेट का 8.6%) को क्लस्टर किया, तो उनमें से 81% के लिए पांच विफलता मोड जिम्मेदार थे। इनमें से कोई भी किसी को आश्चर्यचकित नहीं करेगा जिसने पहले वॉयस एआई भेजा है, लेकिन सापेक्ष वजन ने हमें आश्चर्यचकित किया है।
1. इरादा-स्टैकिंग (29% चूक)
कॉल करने वाले के दो या दो से अधिक इरादे होते हैं और एआई दूसरे इरादे को समाप्त करने से पहले पहले वाले को प्रतिबद्ध करता है। "मैं अपनी नियुक्ति को पुनर्निर्धारित करना चाहता हूं और क्या आप एक्स-100 मॉडल भी बेचते हैं" ठीक उसी तरह का इनपुट है जो बातचीत की स्थिति को प्रभावित करता है।
2. निहित-संदर्भ ड्रॉप (22%)
कॉल करने वाला बातचीत में पहले कही गई किसी बात का संदर्भ देता है जिसे एआई ने संदर्भ के रूप में संग्रहीत नहीं किया है - एक नाम, एक कीमत, एक तारीख। यह विफलता मोड है जिसे अगली पीढ़ी की संदर्भ विंडो सबसे सीधे संबोधित करती है।
3. कॉल करने वाले ने प्रॉम्प्ट पर बात की (15%)
समापन बिंदु विफलताएँ. एआई बोलना शुरू करता है, कॉल करने वाला उस पर बात करता है, एआई कॉल करने वाले के साथ मिश्रित अपनी आवाज सुनता है और एक प्रतिलेख तैयार करता है जिसमें आधा इनपुट गायब होता है।
4. संख्या-रीडबैक त्रुटियाँ (9%)
कॉल करने वाला फ़ोन नंबर या पता बताता है. एआई इसे वापस पढ़ता है। कॉल करने वाला एक अंक सही करता है. एआई गलत अंक अपडेट करता है। यह संरचित-डेटा पुष्टिकरण प्रॉम्प्ट के साथ 100%-ठीक करने योग्य समस्या है, और हमने इसे फरवरी में भेज दिया था।
5. गलत हथकंडा (6%)
एआई सही ढंग से पहचानता है कि यह कॉल और ट्रांसफर को हल नहीं कर सकता है - लेकिन ट्रांसफर रूटिंग इसे गलत कतार में भेजती है। यह वास्तव में AI विफलता नहीं है; यह एक डायल-प्लान विफलता है जिसे एआई उजागर करता है।
इस अध्ययन के कारण हमने जो भेजा
भेजे गए तीन परिवर्तन सीधे अध्ययन से सामने आए, और चौथा विकास में है। हमने अकादमिक रूप से सबसे दिलचस्प मोड के बजाय प्रति विफलता मोड में उच्चतम-लीवरेज फिक्स शिप करने का प्रयास किया।
- मल्टी-इंटेंट डिटेक्टर. एक छोटा क्लासिफायरियर जो इरादे को पकड़ने के समानांतर चलता है और उन कथनों को चिह्नित करता है जिनमें दो या दो से अधिक स्वतंत्र इरादे होते हैं। जब फ़्लैग किया जाता है, तो बातचीत रुक जाती है और AI स्पष्ट रूप से बताता है: "मैंने सुना है कि आप पुनर्निर्धारित करना चाहते हैं और आपने X-100 के बारे में भी पूछा है। आइए पहले पुनर्निर्धारित करें - क्या यह ठीक है?" क्लासिफायर ने 11ms विलंबता जोड़ी और इंटेंट-स्टैकिंग मिस को 64% तक कम कर दिया।
- संरचित संख्या पुष्टिकरण. किसी भी फ़ोन नंबर, पते या राशि की अब एकल-अंकीय संपादन हैंडलर के साथ, रीडबैक पर अंक-दर-अंक पुष्टि की जाती है। नंबर-रीडबैक चूक में 88% की कमी आई है।
- समापन बिंदु पुनर्अंशांकन. हमने प्रति भाषा मौन सीमा को फिर से समायोजित किया और "क्या आपने वह विचार पूरा कर लिया?" जोड़ा। संदिग्ध काट-छाँट पर वसूली. टॉक-ओवर विफलताएं मिस सेट के 15% से गिरकर 9% हो गईं।
चौथा परिवर्तन - एक समृद्ध प्रति-कॉल संदर्भ बफर जो अंतर्निहित-संदर्भ ड्रॉप को संबोधित करता है - चार में से सबसे जटिल है, और इसे लाइव होने से पहले एक हेल्ड-आउट कॉल सेट के खिलाफ छाया मोड में परीक्षण किया जा रहा है।
मानव ग्रेडर बहाव पर एक नोट
एक छोटी सी खोज जो नाम देने लायक है: मानव समीक्षक, एक प्रकाशित रूब्रिक के बावजूद, तीन महीनों में भटक गए। पहले महीने में, समीक्षकों ने 87% कॉलों को सफल बताया। तीसरे महीने में, उन्हीं समीक्षकों ने, बेतरतीब ढंग से खींची गई महीने-एक कॉल को दूसरी बार स्कोर करते हुए, 91% को सफल के रूप में चिह्नित किया। प्रतिलेख नहीं बदले थे.
बहाव बुरा विश्वास नहीं था; यह अपनापन था. जैसे-जैसे समीक्षकों को एआई के वाक्यांशों की आदत हो गई, वे बातचीत-स्वच्छता आयाम पर अधिक उदार हो गए। हमने तीसरे महीने में महीने-एक कॉल के 5% नमूने को दोबारा स्कोर करके इसे पकड़ा, और हमने इसके लिए शीर्षक संख्या को सही किया। ऊपर बताया गया 91.4% बहाव-सुधारित आंकड़ा है। कच्ची संख्या 92.1% थी।
यदि कोई विक्रेता यह बताए बिना सटीकता संख्या प्रकाशित करता है कि उन्होंने मानव ग्रेडर बहाव को कैसे नियंत्रित किया है, तो संख्या डिफ़ॉल्ट रूप से संदिग्ध है। हमने इस समस्या का आविष्कार नहीं किया; हमने बस इस पर ध्यान दिया।
हम आगे क्या माप रहे हैं
तीन चीज़ें, प्राथमिकता क्रम में. सबसे पहले, प्रत्येक प्रमुख समर्थित भाषा के भीतर उच्चारण-समाधान सटीकता - और कार्यप्रणाली स्थिर होने पर इसे प्रकाशित करने की सार्वजनिक प्रतिबद्धता। दूसरा, कॉल के बाद परिणाम की सटीकता: क्या कॉल करने वाले को वास्तव में वह चीज़ प्राप्त हुई जिसके लिए वह आया था, ग्राहक के डाउनस्ट्रीम सिस्टम के साथ सामंजस्य स्थापित करके कॉल के 7 और 30 दिन बाद मापा गया।
तीसरा, लागत-प्रति-समाधान-कॉल नंबर जो सटीकता को प्रति मिनट की अर्थव्यवस्था के साथ जोड़ता है - क्योंकि 98% सटीक एआई जिसकी लागत $1.40/मिनट है, 92% सटीक एआई से हार जाता है जिसकी लागत लगभग किसी भी वास्तविक व्यवसाय के लिए $0.18/मिनट है।
हम संख्याओं का अगला सेट Q3 में प्रकाशित करेंगे। यदि वे प्रतिगमन दिखाते हैं तो हम उसे भी प्रकाशित करेंगे। इस चीज़ को मापने का उद्देश्य कोई आकर्षक चार्ट ढूंढना नहीं है; यह उन कॉलों का पता लगाना है जो हमें अभी भी गलत मिल रही हैं।