这两天千问的圈子挺热闹。8月18日千问办公刚把上下文基础设施开源。36氪8月20日晚上,官方又正式发布并开源了 Qwen-UI-Agent。知乎媒体标题起得相当猛——“移动端基准超越GPT-5.6与Claude Opus 4.8”。集微网
先把结论放前面:这组成绩来自官方技术报告,其中含金量最高的一个基准还是千问自建的,第三方复现暂时没有。所以可以关注,不必上头。但这次发布本身确实值得聊,因为它不再是聊天跑分,而是真刀真枪地在教AI替你点手机屏幕。
这是个什么东西:会"用屏幕"的AI
Qwen-UI-Agent 不是聊天模型,而是一个 GUI 智能体基座模型。说白了:它能看懂屏幕、理解界面,然后像人一样模拟手指操作,去用那些没有接口的App。覆盖四个环境:手机、电脑、网页,还有深度搜索(DeepSearch)。微博
官方给的演示例子相当生活化:你说"我今天约了朋友去天目里喝咖啡",它自己打开高德查地址,去大众点评找1公里内人气最高的咖啡馆,记下店名,再跑去小红书总结前五条笔记,看大家推荐这家的哪款咖啡。知乎还有一个演示:在12306查北京到杭州最早的高铁几点到,算好地铁通勤时间,然后在钉钉里自动建好会议,连提前5分钟提醒都设上。
发现了吗?这就是手机厂商们喊了好几年的"AI按键"的完全体。区别在于,厂商助手大多出不了自家系统,而这个想跨App、甚至跨设备干活。

成绩很猛,但请记住出处
媒体转得最多的是这组数字,出处都是官方介绍。集微网
移动端 MobileWorld 基准:82.1%,领先 GPT-5.6 Sol 12.0 个百分点、Claude Opus 4.8 14.6 个百分点
真机基准 MobileWorld-Real:92.2%,超过 Gemini 3.1 Pro、Claude Opus 4.8、GPT-5.6 Sol
AndroidDaily:97.5%,接近满分
电脑端 OSWorld-Verified:79.5%;网页端 WebArena 在所有对比模型里拿第一
要记住的是:整套分数都是官方技术报告的自报成绩。其中 MobileWorld-Real 这个基准是千问自建的。知乎在自己主场跟自己比,赢是应该的。12个百分点的领先发生在 MobileWorld 这个公开基准上,这个有点分量,但在第三方团队复现之前,所有"超越XXX"前面都该自动加一行小字:官方口径。
比分数更值钱的,是把训练搬进100台真手机
我觉得比分数更值得看的,是它对"模拟器差距"的处理。
GUI 智能体有个老毛病:在模拟环境里刷分挺好看,一上真机就拉胯。加载慢一点、弹个窗、换个键盘布局、App悄悄更新一版,都可能让智能体当场卡死。千问这次的做法比较硬:直接搭了一个覆盖100多台真实手机、150多款应用的真机环境,任务构建、轨迹采集、训练、评测全在真机上做,顺手还把包含400多个任务的 MobileWorld-Real 基准放了出来。IT之家
小红书上有科技博主总结得挺到位:模拟测试时代结束了。小红书行业跟不跟还得再看,但至少"真机成功率"这把尺子被递出来了。以后看各家 GUI 智能体,别只盯着模拟分数问一句:真机上跑的?
几个和"敢不敢用"有关的细节
官方发布里有几个点,是普通用户真正该关心的:
第一,安全边界。违法和高风险请求,它直接拒绝、不碰界面;支付、删除数据、隐私授权这三类敏感场景,它会在关键步骤主动停手,等你确认了才继续。知乎让AI操作手机,最怕的就是它替你把"确认支付"点了,这个设计至少方向是对的。
第二,不是只会点点点。它还能执行命令行,单次决策可以批量输出多个动作,执行轨迹明显变短。小红书官方说电脑任务里CLI动作占比接近一半,约40%的动作是一次批量输出的。翻译一下:它做调研、比价这种活时,不会机械地点一百下,而是"打开网页看看"和"跑个脚本算算"混着来。官方演示里有个170步的数据调研任务,最后交付了Excel、PPT和Word。知乎


第三,主动服务。演示里有个场景:检测到你的航班被取消,它不等你开口,先去找替代航班和高铁,摆出方案,你点头它才执行,还能从手机接力到电脑继续干。这就有点私人助理的样子了。
泼冷水时间:你现在还用不上
官方定位写得很清楚:"为终端与生态伙伴提供能力支持。"也就是说,它是给手机厂商、软件厂商和开发者用的,千问App里暂时没有这个功能按钮。
官微公告下面第一条评论就是"地址呢"——大家都想玩,但入口在哪没人知道。微博
开发者可以去官方 GitHub(Tongyi-MAI 组织)拿代码。但提醒一句:GUI Agent 跑起来要搭设备环境,你得有台手机或电脑给它操作,门槛比下载个聊天模型高一截。B站官方发布视频下面一万六千多播放、四百多个赞,热度是真的,但离"人人可用"还有距离。B站
值得盯的三个信号
我的建议是把这事放进观察清单,重点看三件事:
第三方复现。尤其是有没有人复现 MobileWorld-Real 的真机成绩。自建基准加官方自报,需要客场验证;
落地路径。会不会进手机厂商的助手?国行 Apple 智能已完成备案公示,千问官宣将作为 AI 能力深度集成国行全系列苹果设备。36氪千问App会不会上"帮我操作"这类功能,也值得等;
生态节奏。这个月千问已经开源了办公上下文基础设施,加上同一天发布的阿里财报:本季度阿里新划分的"AI云与计算服务"收入484.37亿元,同比增长45%,外部客户收入同样增长45%。AI云与计算服务经调整EBITA同比涨了133%。36氪不过36氪的说法是"云利润翻倍,千问亏损扩大"——云在赚钱,千问C端还在烧。烧钱换入口的阶段,恰恰是用户最该盯着看它往哪走的阶段。
一句话收尾:"超越GPT-5.6"的标题是官方口径,可以关注,不必上头;但把100台真手机搬进训练场、把真机尺子开源出来,这个方向值得认真对待。下次再看到手机助手吹自己多聪明,不妨先问一句:你的分数,是模拟器里跑的,还是真机上跑的?