Giới thiệu
Hầu hết các con số "độ chính xác của AI" bạn đọc trong bản quảng cáo tiếp thị đều vô nghĩa. Họ đánh giá một mô hình trên một tập dữ liệu sạch, chấm điểm tập dữ liệu đó và đưa ra một con số gần như không liên quan gì đến cách hệ thống hoạt động vào chiều thứ Ba khi khách hàng gọi điện từ một nhà kho ồn ào và hỏi ba câu hỏi cùng một lúc.
Chúng tôi muốn một con số có ý nghĩa gì đó. Vì vậy, trong ba tháng từ tháng 1 đến tháng 3 năm 2026, mọi cuộc gọi mà nhân viên tiếp tân AI của chúng tôi xử lý trong toàn bộ nhóm sản xuất — tổng cộng 8.427 cuộc gọi — đều được AI chép lại, chấm điểm theo thời gian thực, sau đó được đánh giá lại một cách độc lập bởi con người, người chưa bao giờ nhìn thấy phán quyết của AI.
Chúng tôi đã theo dõi ngôn ngữ, giọng nói (có thể nhận dạng được), loại cuộc gọi, thời gian trong ngày, độ dài và lộ trình cụ thể mà cuộc trò chuyện đã diễn ra.
Vấn đề không phải là công bố một con số tâng bốc. Vấn đề là tìm ra những cuộc gọi mà AI cho rằng nó đã thành công và sai, cũng như những cuộc gọi mà AI đã thực sự giải quyết được vấn đề của khách hàng nhưng các số liệu nội bộ của chúng tôi đã đánh dấu nó là sai sót. Cả hai lớp đều đông hơn chúng tôi mong đợi.
Cách chúng tôi lấy mẫu và phân loại cuộc gọi
Có ba quy tắc. Đầu tiên, không cần chọn lựa: mọi cuộc gọi trong suốt thời gian đó đều đủ điều kiện, bao gồm 47 cuộc gọi bị hỏng giữa cuộc trò chuyện và 312 cuộc gọi được chuyển đến con người trong vòng 15 giây đầu tiên. Thứ hai, những người đánh giá là con người không nhìn thấy khả năng tự đánh giá của AI - họ chấm điểm bản ghi theo ý định đã nêu của khách hàng chứ không phải theo bất cứ điều gì AI tuyên bố rằng nó đã làm.
Thứ ba, bảng đánh giá được xuất bản trước khi xem xét bất kỳ dữ liệu nào, để ngăn chúng ta lặng lẽ định nghĩa lại "thành công" một khi các con số xuất hiện.
Mỗi cuộc gọi được tính điểm trên ba khía cạnh độc lập:
- Nắm bắt ý định — AI có xác định chính xác điều người gọi thực sự đang cố gắng làm không? (Nhị phân: có/không.)
- Hoàn thành nhiệm vụ - nhu cầu đã nêu của người gọi có thực sự được giải quyết trong cuộc gọi này hay nó yêu cầu sự theo dõi của con người mà người gọi không yêu cầu?
- Vệ sinh cuộc trò chuyện - bản ghi chép có chứa ảo giác, lời hứa hão huyền hoặc mâu thuẫn không? Người đánh giá cho điểm 1–5.
Một cuộc gọi chỉ được tính là "thắng" nếu nó đáp ứng được cả ba điều kiện: đúng ý định, hoàn thành nhiệm vụ, điểm vệ sinh là 4 hoặc 5. Cổng thứ ba là cổng đã âm thầm loại bỏ các cuộc gọi mà lẽ ra chúng ta gọi là thành công.
Những con số tiêu đề
Trên toàn bộ tập dữ liệu 8.427 cuộc gọi, AI đã xóa cả ba cổng trên 91.4% của các cuộc gọi. Con số đó cao hơn dự đoán nội bộ của chúng tôi — hầu hết chúng tôi đều đặt cược trong phạm vi 85–88%.
Khoảng cách giữa dự đoán của chúng tôi và kết quả không phải là mô hình trở nên tốt hơn chúng tôi mong đợi; đó là trực giác của chúng ta đang được định hình bởi những cuộc gọi mà chúng ta nhớ được, phần lớn là những cuộc gọi tồi tệ.
Chia nhỏ theo loại cuộc gọi, phương sai rất đáng kể:
- Đặt lịch hẹn — 96,1% (con đường đơn giản nhất, mục đích được luyện tập kỹ lưỡng)
- Thông tin chung — 93,8% (giờ, địa điểm, dịch vụ)
- Hỏi giá — 89,2% (một số đường dẫn giá yêu cầu định hướng)
- Hủy/đổi lịch — 87.6%
- Khiếu nại và leo thang — 78.3%
- Cuộc gọi đa vấn đề — 71,9% (hai hoặc nhiều ý định độc lập trong cùng một cuộc gọi)
Các khiếu nại và số lượng nhiều vấn đề là những vấn đề chúng tôi tập trung vào. Con số 96% khi đặt lịch hẹn là những gì chúng tôi gửi để giành được giao dịch; con số 72% cho các cuộc gọi đa vấn đề là số tiền chúng tôi gửi để giữ chân họ.
Ngôn ngữ và giọng nói: nơi chứa đựng những điều bất ngờ
Chúng tôi hoạt động bằng 32 ngôn ngữ và chúng tôi công bố một con số chính xác duy nhất cho mỗi ngôn ngữ. Khoảng cách tổng hợp giữa ngôn ngữ tốt nhất của chúng tôi (tiếng Anh-Mỹ) và ngôn ngữ được hỗ trợ kém nhất (tiếng Việt) là 4,1 điểm phần trăm - hẹp hơn chúng tôi mong đợi và hẹp hơn những gì chúng tôi thấy trong báo cáo về điểm chuẩn học thuật được công bố.
Nhưng điểm ngôn ngữ tổng hợp ẩn giấu phần thực sự quan trọng của vấn đề: sự khác biệt về giọng điệu trong một ngôn ngữ. Các cuộc gọi bằng tiếng Anh được xử lý tại Hoa Kỳ đạt 92,7%. Cuộc gọi bằng tiếng Anh từ khách hàng nói tiếng Anh gốc Ấn Độ đạt 91,3% — ngay cả trong tiếng ồn. Cuộc gọi tiếng Anh từ mang tính khu vực mạnh mẽ Những người nói tiếng Anh gốc Scotland đạt 83,4%. Đó là khoảng cách 9 điểm và nó hoàn toàn nằm trong cột có nhãn "Tiếng Anh".
Vấn đề không phải là mô hình của chúng tôi kém tiếng Anh Scotland. Vấn đề là việc xuất bản số cho mỗi ngôn ngữ, trong khi không đo lường được phương sai giọng, là một cách để che giấu các cuộc gọi mà AI của bạn không thực hiện được. Chúng tôi hiện đang báo cáo sự khác biệt về giọng nói trong nội bộ và chúng tôi dự kiến sẽ xuất bản báo cáo này ra bên ngoài trong vòng hai quý.
Năm chế độ thất bại giải thích 80% số lần bỏ lỡ
Khi chúng tôi phân nhóm 723 cuộc gọi nhỡ (8,6% tập dữ liệu), 5 chế độ lỗi chiếm 81% trong số đó. Không điều nào trong số này có thể gây ngạc nhiên cho những người đã sử dụng AI giọng nói trước đây, nhưng trọng số tương đối đã làm chúng tôi ngạc nhiên.
1. Xếp chồng ý định (29% số lần bỏ lỡ)
Người gọi có hai ý định trở lên và AI cam kết ý định đầu tiên trước khi họ nêu xong ý định thứ hai. "Tôi muốn lên lịch lại cuộc hẹn của mình và bạn cũng có bán mẫu X-100 không" chính xác là loại đầu vào làm thay đổi trạng thái cuộc trò chuyện.
2. Giảm ngữ cảnh ngầm định (22%)
Người gọi tham chiếu điều gì đó đã nói trước đó trong cuộc trò chuyện mà AI không lưu trữ dưới dạng ngữ cảnh - tên, giá, ngày tháng. Đây là chế độ lỗi mà cửa sổ ngữ cảnh thế hệ tiếp theo giải quyết trực tiếp nhất.
3. Người gọi nói qua lời nhắc (15%)
Điểm cuối thất bại. AI bắt đầu nói, người gọi nói qua nó, AI nghe thấy giọng nói của chính nó trộn lẫn với giọng của người gọi và tạo ra một bản ghi bị thiếu một nửa đầu vào.
4. Lỗi đọc lại số (9%)
Người gọi ra lệnh cho số điện thoại hoặc địa chỉ. AI đọc lại nó. Người gọi sửa một chữ số. AI cập nhật sai chữ số. Đây là sự cố có thể khắc phục được 100% nhờ lời nhắc xác nhận dữ liệu có cấu trúc và chúng tôi đã gửi một sự cố vào tháng 2.
5. Chuyển giao sai (6%)
AI xác định chính xác rằng nó không thể giải quyết cuộc gọi và chuyển cuộc gọi — nhưng định tuyến chuyển cuộc gọi sẽ gửi cuộc gọi đến sai hàng đợi. Đây thực sự không phải là một thất bại của AI; đó là lỗi kế hoạch quay số mà AI bộc lộ.
Những gì chúng tôi đã vận chuyển nhờ nghiên cứu này
Ba thay đổi được thực hiện trực tiếp từ nghiên cứu và thay đổi thứ tư đang được phát triển. Chúng tôi đã cố gắng đưa ra bản sửa lỗi có đòn bẩy cao nhất cho mỗi chế độ lỗi thay vì bản sửa lỗi thú vị nhất về mặt học thuật.
- Máy dò đa mục đích. Một trình phân loại nhỏ chạy song song với việc nắm bắt ý định và gắn cờ các phát ngôn có chứa hai ý định độc lập trở lên. Khi được gắn cờ, cuộc trò chuyện sẽ tạm dừng và AI liệt kê rõ ràng: "Tôi nghe nói bạn muốn lên lịch lại và bạn cũng đã hỏi về X-100. Trước tiên hãy lên lịch lại - có được không?" Trình phân loại đã thêm 11 mili giây độ trễ và giảm 64% lỗi xếp chồng ý định.
- Xác nhận số có cấu trúc. Mọi số điện thoại, địa chỉ hoặc số tiền hiện đã được xác nhận từng chữ số khi đọc lại bằng trình xử lý chỉnh sửa một chữ số. Tỷ lệ đọc lại số đã giảm 88%.
- Kết thúc việc hiệu chuẩn lại. Chúng tôi đã điều chỉnh lại ngưỡng im lặng cho mỗi ngôn ngữ và thêm câu hỏi "bạn đã hoàn thành suy nghĩ đó chưa?" phục hồi khi bị nghi ngờ cắt ngắn. Tỷ lệ lỗi nói chuyện đã giảm từ 15% xuống 9% số lần bỏ lỡ.
Thay đổi thứ tư — bộ đệm ngữ cảnh cho mỗi cuộc gọi phong phú hơn nhằm giải quyết tình trạng bỏ ngữ cảnh ngầm định — là thay đổi phức tạp nhất trong bốn thay đổi và nó đang được thử nghiệm ở chế độ ẩn đối với một cuộc gọi được tổ chức trước khi nó đi vào hoạt động.
Một lưu ý về sự trôi dạt của học sinh lớp 1
Một phát hiện nhỏ đáng được nêu tên: những người đánh giá là con người, mặc dù có một phiếu đánh giá đã được xuất bản, nhưng vẫn trôi dạt trong suốt ba tháng. Trong tháng đầu tiên, người đánh giá đã đánh dấu 87% cuộc gọi là thành công. Trong tháng thứ ba, những người đánh giá tương tự, chấm điểm các cuộc gọi được rút ngẫu nhiên trong tháng một lần thứ hai, đánh dấu 91% là thành công. Biên bản không có gì thay đổi.
Sự trôi dạt không phải là đức tin xấu; đó là sự quen thuộc. Khi người đánh giá đã quen với cách diễn đạt của AI, họ trở nên hào phóng hơn trong khía cạnh vệ sinh cuộc trò chuyện. Chúng tôi đã nắm bắt được điều này bằng cách tính lại 5% mẫu cuộc gọi trong tháng đầu tiên vào tháng thứ ba và chúng tôi đã sửa số tiêu đề cho nó. Con số 91,4% được báo cáo ở trên là con số đã điều chỉnh độ lệch. Số liệu thô là 92,1%.
Nếu một nhà cung cấp công bố con số chính xác mà không mô tả cách họ kiểm soát độ lệch của học sinh, thì con số đó sẽ bị nghi ngờ theo mặc định. Chúng tôi không phát minh ra vấn đề này; chúng tôi chỉ chú ý đến nó.
Những gì chúng tôi đang đo lường tiếp theo
Ba điều, theo thứ tự ưu tiên. Đầu tiên, độ chính xác được giải quyết bằng giọng nói trong từng ngôn ngữ được hỗ trợ chính — và cam kết công khai sẽ xuất bản ngôn ngữ đó sau khi phương pháp luận ổn định. Thứ hai, độ chính xác của kết quả sau cuộc gọi: người gọi có thực sự nhận được thứ họ cần hay không, được đo lường 7 và 30 ngày sau cuộc gọi bằng cách đối chiếu với hệ thống tiếp theo của khách hàng.
Thứ ba, số chi phí cho mỗi cuộc gọi được giải quyết kết hợp độ chính xác với tính kinh tế mỗi phút - bởi vì AI chính xác 98% có giá 1,40 USD/phút sẽ thua AI chính xác 92% có giá 0,18 USD/phút đối với hầu hết mọi hoạt động kinh doanh thực tế.
Chúng tôi sẽ công bố bộ số tiếp theo trong Quý 3. Nếu họ cho thấy sự hồi quy, chúng tôi cũng sẽ công bố điều đó. Mục đích của việc đo lường những thứ này không phải là tìm ra một biểu đồ tâng bốc; đó là tìm ra những cuộc gọi mà chúng ta vẫn đang mắc sai lầm.