当前位置:
AIGC文章详情

蓝心小V两天拿下两个榜单第一,却还有老用户吐槽"小V你废了":这份榜单该信多少,对了6个信源说清楚

源自59位全网作者

00:51

这两天,vivo 的 AI 算是结结实实刷了一波屏。

8月21日,SuperCLUE 放出 AgentCLUE-Mobile 手机 GUI 智能体基准测评,蓝心小V第一次参赛就以总分92.11分登顶,复杂指令拆解、屏幕界面识别、跨APP连续执行三个维度全是第一。微博第二天,OnDevice 端侧大模型榜单也更新了,蓝心 BlueLM-3.5-Nano-3B 以89.86分拿下端侧第一——这是个只有3B参数的小模型,而排在它前面的只剩云端巨头:谷歌 Gemini 3.6 Flash 93.64分、豆包 Doubao Seed 2.1 pro 92.99分、千问 Qwen3.8 Max 92.25分,分差只有3.78分。知乎翻译成人话:你手机里那个"小V",在"替你点屏幕干活"的考试里拿了第一,顺带它本地跑的小模型,分数已经快够到云端大模型了。

蓝心小V两天拿下两个榜单第一,却还有老用户吐槽

但我劝你先别急着自豪。不是黑,是这份榜单有三个特别容易被误读的地方。

第一,这个榜单是月更的,王座不姓vivo。 6月那期手机GUI智能体榜单,登顶的是中兴的GUI手机智能体,91.29分,当时还拿了"全部维度第一"。微博所以92.11是"本期第一",不是"终局胜利"。手机智能体还在快速迭代期,下个月谁登顶真不好说。

蓝心小V两天拿下两个榜单第一,却还有老用户吐槽

第二,榜单内部的差距,比你想的夸张。 就看6月那期的数据,第一名91.29分,最后一名只有30.19分,首尾差距超过60分——最强的和最基本的,根本不在一个世界。微博SuperCLUE 自己也把话说得很明白:"单次测评只代表基准测试表现,实际日常使用,还要看厂商的系统调优。"还有一句更直接:"跑分是分,体验是体验,别把榜单当购买指南。"这是出榜人自己说的。知乎

第三,整个赛道都还在早期。 学术圈对 GUI 智能体的态度更冷:OSWorld 基准上,人类能完成72%的任务,最好的模型只有12%。知乎CVPR 2026 上针对专业软件的测试里,最强智能体多步任务成功率只有20.6%,跨软件工作流直接归零。这些测试比手机场景难得多,但至少说明"AI替你干活"这件事,全行业都还没解出来。今年初有团队实测过6款AI手机,能完整把外卖点成功的智能体,不超过3家。微博

那真实体验到底怎么样?我翻了一圈存量用户的帖子,评价是明确两半。

觉得好用的,场景都很具体:小V快捷指令的"超级按钮"一键唤起支付入口,结账快人一步;圈搜识别升级后讨论度很高;今年初接入 DeepSeek 之后,评论区一度很热闹。小红书觉得难用的,槽点也很具体:小V完成指令后不会自己退下,让它退出反而直接返回主屏幕;有老用户吐槽从 Jovi 升级成蓝心小V之后,简单指令也要"深度思考"半天,反而不如从前利索。小红书

蓝心小V两天拿下两个榜单第一,却还有老用户吐槽

所以我的判断是:这个双榜第一的含金量不低——首参评、三维度全第一、端侧3B做到逼近云端,vivo 在智能体上是真下了功夫,尤其是把3B小模型塞进天玑骁龙的NPU、靠硬件协同压榨性能这条路线,确实是工程活。但跑分和日常体验的落差也是真的,用户骂的那些点,多数不是模型"智商"问题,而是工程细节——该退出的时候退出,该快的时候快。这类问题不靠模型变大解决,靠系统调优。

蓝心小V两天拿下两个榜单第一,却还有老用户吐槽

最后给几类人几个直接的建议:

已经在用 vivo/iQOO 的:不用因为榜单自豪,也不用因为吐槽焦虑。把小V当工具用就行——快捷支付、圈搜、填表这类高频短链路场景值得多用;跨好几个APP的长链路任务,暂时留个人盯着。OriginOS 7 的 Beta 版已经开始推送,前面说的那些体验毛病会不会修,是接下来最值得盯的事。微博

正准备换机、把"AI强不强"当筛选条件的:别把榜单第一当成购机的决定性理由。92.11和91.29的差距,落到日常感知里几乎为零;系统干不干净、智能体实际开放了多少权限,才是真正影响你每天体感的东西。

纯围观的技术党:接下来几个月的 SuperCLUE 月榜值得追。看点不是谁登顶,而是首尾那60多分的差距会不会收窄——收窄得越快,说明这个品类成熟得越快。

你的手机里,小V真的帮你干成过什么事?或者它最让你抓狂的一次是什么?评论区聊聊,我看看是不是同一个问题。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章