परिचय
दो दशकों से संपर्क-केंद्र उद्योग एक प्रक्रिया पर सहमत है: एक पर्यवेक्षक बेतरतीब ढंग से रिकॉर्ड की गई कॉलों का एक छोटा प्रतिशत नमूना करेगा - आम तौर पर प्रति एजेंट प्रति सप्ताह 2 से 5 - उन्हें 30-पंक्ति रूब्रिक के विरुद्ध स्कोर करें, और स्कोर को एक कोचिंग रिपोर्ट में रोल करें। पूरा उद्योग इसी प्रथा के इर्द-गिर्द बनाया गया था। विक्रेताओं ने स्कोरकार्ड बेचे। लेखापरीक्षकों ने रुब्रिक्स को मान्य किया। सम्मेलनों में इसके लिए ट्रैक होते थे।
गणित कभी काम नहीं आया. एक 1,000-एजेंट संपर्क केंद्र एक सप्ताह में 200,000 कॉल संभालता है, प्रति एजेंट 2% नमूनाकरण, आपको 40,000 स्कोर किए गए कॉल देता है - जो तब तक बहुत अधिक लगता है जब तक आप यह महसूस नहीं करते कि नमूना 99% सौम्य कॉलों में समान रूप से यादृच्छिक है।
उन 60 कॉलों का पता लगाने के लिए 40,000 यादृच्छिक वार्तालापों का नमूना लेना जहां एजेंट ने अनुपालन उल्लंघन किया है, भूसे के ढेर में सुई की परिभाषा है। जब तक भूसे का ढेर छांटा जाता है, एजेंट आगे बढ़ चुका होता है, ग्राहक मंथन कर चुका होता है और उल्लंघन बढ़ जाता है।
क्यूए का उद्देश्य कभी भी औसत कॉल स्कोर करना नहीं था। यह उन कॉलों को ढूंढना था जो मायने रखती थीं - विफलताएं, बचत, किनारे के मामले, बातचीत जहां एजेंट ने कुछ असाधारण या चिंताजनक किया था। उनमें से किसी को भी खोजने में यादृच्छिक नमूनाकरण संरचनात्मक रूप से खराब है।
पिछले 18 महीनों में क्या बदला
दो चीज़ें इतनी बदल गईं कि पुराना मॉडल स्पष्ट रूप से टूट गया। सबसे पहले, प्रतिलेखन गुणवत्ता ने उपयोगिता सीमा को पार कर लिया है - अधिकांश प्रमुख भाषाओं में, प्रतिलेख अब केवल मानव कानों के साथ ही नहीं, बल्कि सॉफ्टवेयर के साथ स्कोर करने के लिए पर्याप्त विश्वसनीय हैं।
दूसरा, बड़े भाषा मॉडल पर्यवेक्षित वर्गीकरण में इतने अच्छे हो गए कि एक कस्टम-प्रशिक्षित मॉडल एक पैसे से भी कम समय में 4 सेकंड में 30 आयामों पर कॉल कर सकता है।
इनका एक साथ मतलब यह हुआ कि संपर्क केंद्र के इतिहास में पहली बार, प्रत्येक कॉल को रूब्रिक के विरुद्ध स्कोर किया जा सकता है - 2% नहीं, 5% नहीं, बल्कि 100%। एक बार जब प्रत्येक कॉल स्कोर हो जाती है, तो यह प्रश्न बंद हो जाता है कि "हम कौन सी कॉल का नमूना लेते हैं?" और बन जाता है "कौन सी कॉलें मानव पर्यवेक्षक के ध्यान के योग्य हैं?"
यह हल करने लायक प्रश्न है, और यह एक रैंकिंग समस्या है, नमूनाकरण समस्या नहीं।
जोखिम स्कोर में क्या जाता है
हम प्रत्येक कॉल को तीन स्वतंत्र आयामों पर स्कोर करते हैं, फिर उन्हें एक रैंक में जोड़ते हैं जिसे पर्यवेक्षक अपने कंसोल में देखता है।
- अनुपालन जोखिम — क्या कॉल में ऐसी भाषा शामिल थी जो विनियामक एक्सपोज़र को ट्रिगर करती है? मिनी-मिरांडा, टीसीपीए सहमति, ऋण-वसूली एफडीसीपीए सीमाएं, संरक्षित स्वास्थ्य खुलासे। यह आयाम बाइनरी-ईश है - अधिकांश कॉल का स्कोर शून्य के करीब होता है, एक छोटी पूंछ का स्कोर उच्च होता है।
- परिणाम जोखिम — क्या इस ग्राहक के इस कॉल के परिणामस्वरूप मंथन, शिकायत या तनाव बढ़ने की संभावना है? भावना प्रक्षेपवक्र, अनसुलझे मुद्दे के संकेत, स्पष्ट शिकायत भाषा और ग्राहक के खाता-स्तरीय मूल्य को जोड़ती है।
- कोचिंग का मूल्य - क्या इस कॉल को देखने वाला पर्यवेक्षक कुछ सीखेगा जो वे सिखा सकते हैं? उच्च-रैंक कोचिंग कॉल असामान्य बचत, स्वच्छ हैंडऑफ़ और नियंत्रित डी-एस्केलेशन हैं। वे असफल नहीं हैं; वे उदाहरण हैं.
तीनों आयामों का भार समान रूप से नहीं है और सभी ग्राहकों का भार समान नहीं है। एक ऋण-वसूली संचालक अनुपालन जोखिम को सबसे अधिक महत्व देता है। एक उच्च-स्पर्श उद्यम SaaS समर्थन टीम परिणाम जोखिम को महत्व देती है। एक प्रशिक्षण-भारी ऑनबोर्डिंग टीम कोचिंग मूल्य को महत्व देती है। वज़न पर्यवेक्षक सेटिंग्स में उजागर होते हैं और हम प्रति उद्योग समझदार डिफ़ॉल्ट निर्धारित करते हैं।
पर्यवेक्षक कंसोल: एक रैंक वाली कतार
कंसोल पुराने "यादृच्छिक नमूना कतार" यूआई से जानबूझकर अलग दिखता है। हाल की कॉलों की पृष्ठांकित सूची के बजाय, यह एक एकल रैंक वाली कतार है, जिसे संयुक्त जोखिम स्कोर के आधार पर क्रमबद्ध किया जाता है, जो हर दो मिनट में ताज़ा होती है। कतार में सबसे ऊपर 20 या उससे अधिक कॉलें हैं जिन पर आज ध्यान देने की आवश्यकता है। नीचे सब कुछ एक लंबी पूंछ है।
प्रत्येक कॉल कार्ड में तीन उप-स्कोर, कॉल किस बारे में थी इसका 90 सेकंड का सारांश और मॉडल द्वारा चिह्नित विशिष्ट स्निपेट होते हैं। एक पर्यवेक्षक पूरी कॉल सुने बिना स्निपेट सुन सकता है। यदि स्निपेट पूरी कहानी है - और अधिकांश समय यह है - पर्यवेक्षक 30 सेकंड में ध्वज की पुष्टि या अस्वीकार करता है और आगे बढ़ता है।
रैंडम-सैंपल QA में प्रति कॉल औसतन 8 मिनट लगते थे। रैंक की गई कतार का औसत 2 मिनट 40 सेकंड है। प्रति कॉल क्यूए की लागत गिर गई है। कवरेज 2% से 100% हो गया है। पर्यवेक्षक अपना समय उन कॉलों पर खर्च कर रहा है जो वास्तव में मीट्रिक को स्थानांतरित करती हैं।
हमने जो आपत्तियां सुनीं
जब हमने डिज़ाइन-साझेदार ग्राहकों पर क्यूए नेताओं को रैंक वाली कतार दिखाई, तो लगातार तीन आपत्तियाँ सामने आईं।
आपत्ति 1: "मॉडल उन चीज़ों को मिस कर देगा जिन्हें एक इंसान पकड़ सकता है।"
अमूर्त में सत्य; व्यवहार में अधिकतर झूठ। मॉडल एक इंसान की तरह चीजों को याद करती है SPECIALIST पकड़ में आ जाएगा - एक ही कॉल की समीक्षा करने वाला एक अनुपालन लेखा परीक्षक उन सूक्ष्मताओं का पता लगा सकता है जिन्हें मॉडल चिह्नित नहीं करता है। लेकिन तुलना किसी विशेषज्ञ से नहीं है. यह एक पर्यवेक्षक द्वारा 2% कॉलों का बेतरतीब ढंग से नमूना लेने के विरुद्ध है। मॉडल 100% समीक्षा करता है और स्पष्ट 5% चिह्नित करता है। विशेषज्ञ 5% की समीक्षा करता है।
नेट कवरेज पुरानी व्यवस्था से कहीं बेहतर है।
आपत्ति 2: "एजेंट स्कोर खेलेंगे।"
शायद सही। कोई भी मीट्रिक जिस पर ध्यान जाता है, उस पर ध्यान दिया जाता है। बचाव दुगना है: स्कोर बहु-आयामी है, इसलिए एक धुरी पर गेम खेलने से आपको दूसरी धुरी पर ऊपर धकेल दिया जाता है; और स्कोर एजेंट की प्रदर्शन समीक्षा नहीं है। स्कोर पर्यवेक्षक के लिए एक ट्राइएज सिग्नल है। पर्यवेक्षक वास्तविक कॉल सुनने के बाद प्रदर्शन समीक्षा का निष्कर्ष निकालता है।
हम स्कोर को कतार के रूप में बेचते हैं, स्कोरबोर्ड के रूप में नहीं।
आपत्ति 3: "यह पर्यवेक्षक की नौकरी बदल देता है।"
यह भी सच है और हमें इसके प्रति ईमानदार रहना चाहिए। रैंक-कतार संपर्क केंद्र का पर्यवेक्षक 30-पंक्ति रूब्रिक के विरुद्ध कॉल स्कोर करने में कम समय खर्च करता है और अधिक समय कोचिंग, आगे बढ़ने और हस्तक्षेप करने में खर्च करता है। जिन पर्यवेक्षकों को पुराना काम पसंद आया - व्यवस्थित, स्कोरकार्ड-संचालित हिस्सा - जरूरी नहीं कि वे नए से रोमांचित हों।
लॉन्च से पहले हमने डिज़ाइन-पार्टनर ऑप्स लीडर्स से इस बारे में खुलकर बात की। यह एक वर्कफ़्लो परिवर्तन है, न कि केवल एक उपकरण परिवर्तन।
पहले 90 दिनों में नई प्रणाली को क्या मिला?
उन चार डिज़ाइन साझेदारों में, जिन्होंने विशेष रूप से 90 दिनों के लिए रैंक कतार को चलाया, पर्यवेक्षक टीमों ने यादृच्छिक नमूने के मुकाबले प्रति सप्ताह 4.7 गुना अधिक कॉल को प्रतिधारण या अनुपालन के लिए बढ़ाया। यह वृद्धि "अधिक जांच" प्रभाव नहीं थी; यह लगभग पूरी तरह से ऐसी कॉलें थीं जिनमें यादृच्छिक नमूनाकरण संरचनात्मक रूप से छूट गया था।
एक ग्राहक ने ऋण-वसूली स्क्रिप्ट में गड़बड़ी पकड़ी - एक एकल एजेंट ने लगभग 9% कॉलों पर एफडीसीपीए सीमा को पार करने वाली भाषा का उपयोग करना शुरू कर दिया था - यादृच्छिक नमूनाकरण 11 सप्ताह तक सामने नहीं आया था। रैंक वाली कतार बहाव शुरू होने के 48 घंटों के भीतर सामने आ गई, क्योंकि उन विशिष्ट कॉलों पर अनुपालन-जोखिम स्कोर एजेंट की आधार रेखा से दो मानक विचलन ऊपर पहुंच गया।
एक अन्य ग्राहक ने पाया कि रैंडम-सैंपल सिस्टम ने जिन एजेंटों को सबसे कम प्रदर्शन करने वाले के रूप में चिह्नित किया था, वे वास्तव में सबसे कम प्रदर्शन करने वाले नहीं थे - वे सिर्फ सबसे ऊंचे थे। रैंक की गई कतार, जिसे परिणाम जोखिम के आधार पर मूल्यांकित किया गया, ने दो शांत लेकिन लगातार खराब प्रदर्शन करने वाले एजेंटों की पहचान की, जिनकी कॉल का नमूना अन्य सभी के समान दर पर लिया गया था और "औसत" ढेर में आ गए थे।
हम जानबूझकर स्कोर के साथ क्या नहीं करेंगे
तीन बातें, जानबूझ कर।
हम कतार के आउटपुट पर एजेंटों को ऑटो-स्कोर नहीं देंगे। स्कोर एक ट्राइएज सिग्नल है। एजेंट प्रदर्शन रेटिंग अभी भी पर्यवेक्षक के माध्यम से जाती है। हम जानबूझकर इंसान को लूप में रख रहे हैं, इसलिए नहीं कि मॉडल ऐसा नहीं कर सकता, बल्कि इसलिए क्योंकि हमने देखा है कि कई ऑटोस्कोर्ड सिस्टम विश्वास को खत्म कर देते हैं और पैटर्न से पूरी तरह बचना चाहते हैं।
हम कॉल के दौरान एजेंट का वास्तविक समय स्कोर नहीं बताएंगे। एक विचारधारा है जो कहती है कि एजेंटों को वास्तविक समय में अपने स्वयं के कोचिंग स्कोर देखना चाहिए। एक मजबूत विचारधारा है जो कहती है कि ऐसा करने से कॉल खराब हो जाती है। हम दूसरे स्कूल के पक्ष में हैं।
हम डिफ़ॉल्ट रूप से स्कोर को प्रदर्शन-प्रबंधन सिस्टम में निर्यात नहीं करेंगे। जो ग्राहक स्कोर को एक अलग एचआर टूल में जोड़ना चाहते हैं, वे स्पष्ट कॉन्फ़िगरेशन के साथ ऐसा कर सकते हैं, लेकिन हम डिफ़ॉल्ट को सुरक्षित विकल्प बनाते हैं। यदि आप किसी स्प्रेडशीट पर कोई नंबर चाहते हैं, तो आपको इसे जानबूझकर मांगना होगा।