两天时间,vivo蓝心把两个榜单都拿了。
8月21日,SuperCLUE最新手机AI智能体测评出炉,蓝心小V第一次参赛,直接以92.11分拿下手机GUI智能体总榜第一。微博8月22日,SuperCLUE放出OnDevice手机端侧大模型最新测评榜单,蓝心BlueLM-3.5-Nano-3B拿下端侧模型综合排名第一,分数已经很接近不少主流云端大模型。微博
消息看着提气,但新闻底下有条vivo用户的评论很有代表性:三个维度全部第一啊,平时小V我用的比较少,以后我多用用体验体验。微博榜是真实考了第一,但普通用户更关心的是另一件事:我手机上的小V,怎么跟榜单上那个不太像?我把两个榜单对了10多个信源,结论先放这儿:榜是真的,含金量不低,但榜单和你的日常体验之间,还隔着几道坎。
第一个榜:「小V替你点屏幕」,被卷到了新高度
先说清楚GUI智能体是什么:它不是陪你聊天的问答框,而是能看懂屏幕、替你点屏幕的AI。你说一句「帮我搜部电影存起来」,它自己打开App、自己搜、自己跨软件执行。这次蓝心小V的92.11分,是复杂指令理解、识别屏幕界面、跨软件连续执行任务三项全部榜首拿到的。微博

这个榜值得按时间线看。AgentCLUE-Mobile首期是去年10月出的,当时前三名是智谱GLM-4.5v、小米MiMo-VL-7B-RL、字节Doubao-Seed,vivo没参加。微博今年6月,中兴以91.29分登顶,官方通稿里用的是「全方位断层第一」。微博不到两个月,蓝心小V首次参赛就把天花板改写成92.11。这条曲线的意义是:手机智能体在可测量意义上确实在快速进步,不是大家轮流坐庄。
但第一名的分数,也要配合同一条新闻的后半段看:GUI智能体遇到弹窗、界面改版依旧会翻车,同榜各家模型能力差距巨大,首尾分差超过60分。微博也就是说,榜单上的第一,目前是「考场里的第一」。
第二个榜:手机里跑的3B小模型,分数追到云端旁边
第二个榜测的是另一件事:不靠云端、直接在手机上跑的大模型,能有多聪明。这次的结果是蓝心BlueLM-3.5-Nano-3B以89.86分拿下端侧模型综合第一。知乎这不是撞大运,是vivo铺了一年的线。去年9月,蓝心端侧大模型就已经在SuperCLUE手机端侧榜单拿过TOP1,3B模型在10B参数量级以内处于领先。微博这次算是卫冕。
真正值得注意的是它旁边的参照组:谷歌Gemini 3.6 Flash拿到93.64分,豆包Doubao Seed 2.1 pro拿到92.99分,千问Qwen3.8 Max拿到92.25分。知乎算一下就是:一个跑在手机本地的3B小模型,和第一梯队云端模型的差距只有2.4到3.8分。有媒体用「分差只有3.78分」来概括,其实那是和最高分Gemini的差距,对千问的分差已经不到2.4分——差距比很多标题给人的印象更小。
3B为什么能打?公开解读的思路不是堆参数,而是压榨硬件:钻进芯片的NPU指令集,把模型一层层塞进缓存和算力单元,靠结构精炼、算子压缩、硬件协同喂出能力。这个3B端侧模型,已经跑在X300 Ultra这类今年的旗舰设备上。知乎

但先别把榜单当体验:中间隔着三道坎
有意思的是,榜单刷屏的这几天,社区里用户对蓝心小V的真实反馈是另一个画风。8月21日,也就是GUI榜单公布当天,有人在小红书发帖说,自己经常是把指令说完了,小V连话都没识别上。小红书8月14日,还有人吐槽小V提醒出错害自己睡过头,直接问「这蓝心小V是人工智障吗」。小红书同一时间,B站上也能搜到「蓝心小V发疯实录」这样的合集。哔哩哔哩
翻车之外还有「换新机蓝心小V失忆名场面」的尴尬。哔哩哔哩老机型用户的情况更直接:有iQOO Z6用户发现,新版本蓝心小V在应用商店里提示「该应用已下架」。哔哩哔哩新AI体验,从来不是全系机型平等的。
这不是说榜单是假的。榜单和日常之间,至少隔着三道坎。第一,评测任务是固定的,生活不是:长尾App、版本更新、弹窗、方言,任何一个都能让标准答案翻车。第二,模型听懂了,不代表系统调得动;系统调得动,不代表App愿意开放。第三,能力有机型分层,端侧3B需要足够的NPU算力,老机型软件再优化也补不齐。SuperCLUE自己也提醒:单次测评只代表基准测试表现,日常使用还要看厂商的系统调优,别把榜单当购买指南。知乎
App端也不是没有松动。6月起,微信与华为、荣耀、小米、OPPO、vivo等手机厂商合作推出A2A智能助手协作。微博腾讯客服随后官宣,确认微信已携手这些主流厂商落地A2A协作能力。微博
荣耀YOYO成为首个与微信达成A2A合作的智能助手。微博小米超级小爱也已正式接入,用户可通过语音指令直接完成微信消息发送与语音视频通话。微博等头部App真正开放,GUI智能体「考场会做、日常翻车」的状况会明显缓解,这个信号比榜单本身更值得盯。
那普通用户现在该怎么办?
如果你是已经在用vivo/iQOO的用户:别急着追新概念,先把成熟功能用明白。小V圈搜、小V修图、食物热量查询这些功能已经迭代了好几轮,稳定性比智能体功能好得多;跨应用自动执行只建议用在查信息、整理内容这类低风险场景,涉及支付、删除的操作,最后一定自己看一眼。榜单第一,不等于可以放心闭眼托管。
如果你的手机是老机型:先查一下系统版本和蓝心小V能不能更新。不少新AI功能绑定在OriginOS 6及以上,部分机型的功能还在灰度推送;更新不上先别急着骂榜单,依赖硬件算力的那部分,软件确实补不回来。
如果你在观望下一台手机:接下来两个节点值得记一下。一个是OriginOS 7,内测已经开始推送,这两个榜单本质上是在给新系统的AI能力打前站。另一个是X500系列,vivo X500已经三证齐全,预计9月中上旬发布。微博它的入网信息页里,蓝心大模型的备案编号已经在列,新机大概率会完整带上这一代蓝心能力。

最后,三个值得继续盯的信号:OriginOS 7的正式推送时间和更新机型名单;微信A2A在vivo上的落地进度;下一期SuperCLUE手机智能体榜单——92.11分会不会被超过、「弹窗翻车」会不会改善,这两个问题比这次夺冠本身更有看头。
榜单像高考成绩,能说明底子,不能说明工作表现。蓝心这次高考成绩确实好,至于工作表现如何,你的手和评论区,才是真正的评测场。