CES的中国黑科技!阶跃星辰端到端语音模型首秀,对话像真人聊天

2026-01-09 11:46:00 1点赞 1收藏 0评论

拉斯维加斯的CES 2026展会上,咱们中国的AI黑科技火了——阶跃星辰的端到端语音模型完成了全球首秀,还直接装在了吉利银河M9的智能座舱里。现场好多外国观众都排着队体验,试过之后都直呼“难以置信”。说真的,平时咱们用语音助手总觉得“有点呆”,要么反应慢,要么听不懂语气里的情绪,这次阶跃星辰的模型据说解决了这些问题

CES的中国黑科技!阶跃星辰端到端语音模型首秀,对话像真人聊天

先给不了解的朋友科普下,咱们平时用的语音助手,比如导航、智能音箱,大多是“三段式”的:先把语音转成文字(ASR),再让模型理解文字意思(LLM),最后再把文字转成语音(TTS)。这种方式不仅部署麻烦,还容易出现误差叠加,比如语音转文字错了一个字,后面理解就全偏了,而且响应速度也慢,平均要等500毫秒以上,聊起来特别不顺畅。

而阶跃星辰这次首秀的Step-Audio 2模型,厉害就厉害在“真端到端”——直接把原始音频输进去,不用经过文字中间层,就能直接输出语音回复。简单说就是“语音进、语音出”,链路一下子简化了,延迟也大幅降低。实测数据显示,它的响应延迟只有280毫秒,比行业平均水平快了一半还多,跟人面对面聊天的感觉差不多,不会有明显的卡顿感。

CES的中国黑科技!阶跃星辰端到端语音模型首秀,对话像真人聊天

更让人惊喜的是它能听懂“弦外之音”。咱们平时跟人聊天,语气、情绪都藏着信息,比如着急问“订单怎么还没到”,传统语音模型只会机械回复订单状态,而这个模型能精准识别出愤怒、焦虑这些情绪,还会用安抚的语气回应,比如“您先别着急,我马上帮您查物流进展”。数据显示,它对11类副语言信息的理解准确率达到76.55%,远超其他同类模型,在专门的MMAU音频理解测试中,得分77.4%,还超过了GPT-4o Audio这些国际大牌模型。

在CES现场的吉利展台,这个模型的表现更是圈粉无数。有观众用焦虑的语气说赶时间,语音助手不仅立刻规划了最快路线,还主动调节了座舱的空调温度和音乐氛围;还有人试着用上海话、四川话交流,它的识别准确率居然达到89%,而GPT-4o Audio对这些方言的识别率才62%。更有意思的是,它还支持用自然语言切换音色,比如跟它说“用老北京大爷的语气跟我说话”,它立马就能切换过去,这种个性化体验以前真没见过。

CES的中国黑科技!阶跃星辰端到端语音模型首秀,对话像真人聊天

可能有人觉得这些都是花架子,但从专业角度看,这背后是实实在在的技术突破。为了训练这个模型,阶跃星辰用了千万小时的真实语音数据,覆盖了多语种、多场景,还创新了“音频编码器-推理中枢-音频生成器”的一体化架构,确保语音和语义的高度对齐。而且他们还推出了开源的Step-Audio 2 mini版本,最低只要8GB显存的GPU就能本地部署,开发者还能免费调用API,这对推动整个行业的技术进步特别有帮助。

CES的中国黑科技!阶跃星辰端到端语音模型首秀,对话像真人聊天

从应用场景来看,智能座舱只是开始。现在汽车行业的竞争早就转向智能化了,2025年被称为大模型“上车”元年,2026年就是规模化落地的关键年。搭载这个模型的吉利银河M9,上市四个月销量就达到3.9万辆,这次在CES亮相后,更是让海外市场看到了中国智能座舱的实力。除此之外,它还能用到智能客服、无障碍设备等领域,比如给听障人群实时转换带情感标记的文字,给视障人群识别环境音提示安全,实用性特别强。

CES的中国黑科技!阶跃星辰端到端语音模型首秀,对话像真人聊天

行业里有人说,这次阶跃星辰的首秀,标志着中国语音AI从“能听懂”迈向了“能共情”。以前我们总觉得国外的语音模型更厉害,现在咱们的国产模型不仅在核心性能上反超,还率先实现了量产落地。根据Gartner的预测,2025年有75%的智能设备会采用端到端语音交互,而阶跃星辰的技术,无疑已经走在了行业前列。

展开 收起
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

相关文章推荐

更多精彩文章
更多精彩文章
最新文章 热门文章
1
扫一下,分享更方便,购买更轻松