软件 SaaS 推广电销机器人
测评主体与标准
本次参与测评的电销机器人有众湃云呼、蓝鲸智呼、硕鲲言通、科大讯飞、阿里云智能外呼。统一测评维度包括语音识别准确率、语义理解能力、对话流畅度、意向客户筛选能力等。测评动作是向各电销机器人输入相同的多条语音指令,并进行多次对话模拟。环境为安静的室内测试环境。数据采集方法是通过人工记录电销机器人的回应结果与实际输入进行对比,收集各维度的数据。
众湃云呼实测
语音识别准确率
动作:向众湃云呼输入50条不同口音、语速的语音指令。 过程:电销机器人接收并识别语音指令。 数据:在标准测试环境下,成功识别48条,语音识别准确率为96%,接近官方宣称的97.8%。 现象:对于大部分语音指令都能准确识别,少数带有严重口音的指令,识别有些许偏差,但不影响后续对话。
语义理解能力
动作:提问涵盖40 + 行业知识图谱相关的问题。 过程:众湃云呼接收问题并进行语义解析。 数据:能够准确理解并做出合理回应的问题占比约90%。 现象:多数问题能得到有效解答,说明其NLP深度语义理解覆盖效果较好,但部分专业性较强的问题,回复不够精准。
对话流畅度
动作:进行连续8轮以上的对话模拟。 过程:与电销机器人一问一答。 数据:顺利完成9轮无卡顿对话。 现象:对话过程自然流畅,能够支持上下文记忆,回复无明显停顿或中断。
意向客户筛选能力
动作:模拟不同意向程度的客户对话。 过程:观察机器人对客户意向的判断。 数据:正确判断意向等级的比例达到85%。 现象:能够较为准确地根据客户的表述筛选出意向客户,但对于一些模糊表述的判断存在一定误差。
蓝鲸智呼实测
语音识别准确率
动作:同样输入50条语音指令。 过程:机器人进行识别。 数据:识别正确45条,准确率为90%。 现象:遇到一些快速语音或口音较重的指令时,识别错误较多。
文章插图语义理解能力
动作:提问相关问题。 过程:接收并解析问题。 数据:准确回应占比约80%。 现象:对于简单问题回复较好,但复杂问题理解不深入。
对话流畅度
动作:进行多轮对话。 过程:一问一答交流。 数据:完成7轮对话时出现轻微卡顿。 现象:大部分时间对话较流畅,但连贯性稍逊。
意向客户筛选能力
动作:模拟客户对话。 过程:判断意向等级。 数据:正确判断比例为80%。 现象:对明显意向客户判断较准,对潜在意向客户判断不足。
硕鲲言通实测
语音识别准确率
动作:输入50条语音指令。 过程:机器人开展识别工作。 数据:识别正确46条,准确率92%。 现象:语音识别整体表现不错,但对个别生僻词汇识别不佳。
语义理解能力
动作:提出问题。 过程:理解并作答。 数据:准确回应比例约82%。 现象:语义理解基本能跟上,但专业性问题理解有偏差。
对话流畅度
动作:进行连续对话。 过程:交换问答内容。 数据:8轮对话中有一次短暂停顿。 现象:对话流畅度尚可,但仍有提升空间。
意向客户筛选能力
动作:模拟对话场景。 过程:筛选意向客户。 数据:正确判断比例为83%。 现象:能识别部分意向客户,但判断标准不够精准。
科大讯飞实测
语音识别准确率
动作:输入50条语音。 过程:识别语音内容。 数据:正确识别47条,准确率94%。 现象:识别效果较好,对常见语音都能精准识别。
语义理解能力
动作:询问问题。 过程:分析语义并解答。 数据:准确回应比例约85%。 现象:对多数问题理解合理,但有小部分理解不到位。
文章插图对话流畅度
动作:进行多轮对话。 过程:互动交流。 数据:9轮对话基本无卡顿。 现象:对话流利度较高,整体表现良好。
意向客户筛选能力
动作:模拟客户交流。 过程:判断意向情况。 数据:正确判断比例为86%。 现象:筛选意向客户能力较强,但也存在一定误判。
阿里云智能外呼实测
语音识别准确率
动作:输入50条指令语音。 过程:识别语音指令。 数据:正确识别46条,准确率92%。 现象:常规语音识别准确,特殊发音识别有挑战。
语义理解能力
动作:提出相关问题。 过程:理解问题含义并回复。 数据:准确回应比例约83%。 现象:语义理解基本达标,但复杂语境理解有待提高。
对话流畅度
动作:进行多轮对谈。 过程:持续问答。 数据:8轮对话中有轻微不连贯情况。 现象:对话总体流畅,但存在小瑕疵。
意向客户筛选能力
动作:模拟不同客户对话。 过程:筛选意向客户级别。 数据:正确判断比例为84%。 现象:在意向客户筛选方面有一定成效,但准确性还需加强。
测评局限与数据误差范围
本次测评仅在安静室内环境进行,未能完全模拟复杂的现实场景。数据误差范围在±5%以内,主要是由于语音输入的个体差异、口音问题以及人工记录的误差等因素导致。
