张大妈

面壁智能开源全模态模型MiniCPM-o4.5,边看边听还能主动抢答

源自今日头条:量子位

02-07 10:34

AI的交互模式正迎来颠覆性变革。新模型实现了边听、边看、主动说的全双工对话,彻底打破传统一问一答的局限。这种连续感知与即时响应的能力,不仅是体验升级,更是AI从“问答机”向“在场伙伴”进化的关键一步,为端侧智能的现实应用打开了全新可能。

面壁智能开源全模态模型MiniCPM-o4.5,边看边听还能主动抢答智能速览

  • 模型实现了边听边看还能主动说的全双工交互。

  • 通过全双工多模态实时流机制,解决了I/O阻塞问题。

  • 模型能持续感知环境,在1Hz频率下主动判断对话时机。

  • 在仅9B参数规模下,多项Benchmark测试达到领先水平。

  • 面壁智能坚持端侧路线,强调软硬一体协同发展。

面壁智能开源全模态模型MiniCPM-o4.5,边看边听还能主动抢答精华内容

从一问一答的回合制,到边说边听的临场反应,AI交互的底层逻辑正被重塑。全双工,正是这场变革的核心技术驱动力。

告别回合制问答

AI的交互体验正变得如真人般流畅。以往模型只能等待用户说完再处理,形成“你问一句,它答一句”的回合制模式。现在,新模型可以像身边的朋友一样,在你逛超市时持续盯着变化的货架,随口问一句价格,它能立刻接上。

更关键的是,它能主动介入。在厨房,空气炸锅“叮”的一声,人还没反应,AI已经先开口提醒“好了”。在电梯里,它能持续识别楼层变化,主动提醒该下车。这种能力让AI从一个被动工具,变成了一个时刻在线的“在场伙伴”。

全双工实时流技术

实现这一切的核心是全双工多模态实时流技术。传统模型是串行处理,听完音频输入后,思考,再输出语音,一旦开始输出,对外界的感知就被暂停,形成I/O阻塞。新模型将多模态编码器解码器升级为支持流式输入/输出的在线版本,实现了视频和音频输入与语音或文本输出的并行处理。

模型通过时分复用机制,在毫秒级时间线上对齐多模态的输入与输出。同时,它不再依赖检测静音的VAD机制来判断对话时机,而是以1Hz的频率进行持续语义判断,从而能自然打断,甚至主动发起对话。

端侧部署的领先性能

这款模型在性能上同样出色。在仅9B的参数规模下,其在全模态理解、视觉理解、文档解析、语音理解与生成等多个方向的Benchmark测试中,均达到了当前领先水平。

将如此强大的模型部署在端侧,解决了云端方案的隐私风险、延迟和稳定性问题。这种“全天候伴随”的AI形态,天然适合在手机、汽车、机器人等终端上运行,为用户提供更可靠、更私密的智能服务。

只做端,做到极致

这背后是面壁智能长期坚持的端侧AI路线。公司强调“软硬一体”,从模型训练阶段就以端侧芯片为目标,打造“端原生模型”,并与芯片厂商深度协同,在设计阶段就确保架构匹配。

为此,面壁计划推出名为松果派(Pinea Pi)的AI原生端侧智能开发板,与新模型配套,实现“开箱即用”。这种策略旨在打通端侧模型到应用的最后一公里,让开发者和终端厂商能快速将能力落地到具体场景中。

MiniCPM-o4.5的出现,标志着AI正从云端走向终端,从被动问答走向主动感知。全双工交互不仅是技术突破,更是AI融入现实连续世界的分水岭。当AI真正成为一个“在场”的智能体,我们的生活与工作又将被如何重新定义?

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章