华尔街实测8款AI Agent,千问办公赢了Claude和Codex?先看清这三个细节再激动

源自10位全网作者

07:56

千问办公拿了第一,这个结果,我想是出乎大多数人意料的。

8月18日晚间,华尔街投行杰富瑞(Jefferies)的分析师对八款中美主流AI Agent做了一场真实办公任务实测:Qwen Work、Claude Cowork、Codex、KimiWork、Doubao Work、MiniMax、WorkBuddy、Google Spark。加权得分,Qwen Work拿到95分,Claude Cowork 94分,Codex 92分,阿里千问办公综合得分排名第一,超过美国的Claude Cowork和Codex等Agent工具。财经网科技19日,这条消息被多家科技媒体跟进。

华尔街实测8款AI Agent,千问办公赢了Claude和Codex?先看清这三个细节再激动

先别急着兴奋,也别急着扣“营销”的帽子,建议先看看这个测试是怎么做的、测的是什么——里面的信息比名次本身更值钱。

测试怎么做的

杰富瑞分析师共设置了5项真实办公任务,覆盖读文件、查资料、浏览器操作、做图四类办公高频动作。网易智能

  • 基于多份文件完成一份年报摘要(素材是金蝶的年报);

  • 联网查找并比较几家科技大厂的经营数据;

  • 操作真实桌面浏览器完成信息检索和文档生成;

  • 根据数据制作英文PPT;

  • 基于参考图片生成营销海报。

测试结果:千问办公整体表现较为均衡,是唯一一个在所有测评维度中都拿到90分以上的Agent产品。知乎

华尔街实测8款AI Agent,千问办公赢了Claude和Codex?先看清这三个细节再激动

报告里真正的信息量:Harness

但这份报告最值钱的不是排名,而是一个词:Harness。

报告把Agent能力拆成两层:一层是模型,就是你熟悉的Qwen3.8-Max、GPT-5.6、Opus 5这些,负责“聪明”;另一层是Harness,指围绕模型运行的一整套工程机制——指令、上下文、工具调用、边界控制、反馈纠错和治理,负责“靠谱”。知乎

报告的观点很明确:头部模型之间的能力差距正在快速收窄、趋于同质化,真正能让Agent拉开差距、形成客户粘性的,是Harness。报告里有一组很直观的数据:同一个底座模型、只换Harness,得分差异巨大,Harness带来的得分方差是模型本身的7.8倍。这次实测里,千问办公的隐含Harness得分排在第一,高于Claude Cowork和Codex;腾讯的WorkBuddy虽然被视为中国最成功的智能体,其Harness得分却在中国同业中最低。知乎

华尔街实测8款AI Agent,千问办公赢了Claude和Codex?先看清这三个细节再激动

这不是华尔街自己造的概念。DeepSeek开源的DeepSeek Harness正在狂涨星:上线半小时破1万星,约42小时破10万星,目前超过15万星。知乎知乎上“Harness Engineering的本质是什么”这类讨论,阅读量已经超过70万。模型分数趋同、工程决定胜负,这个判断正在被资本和开发者两端同时接受。

还有一组数据值得留意:报告提到,Qwen3.8-Max的API价格比GPT5.6 Sol和Opus 5低70%以上,还提出了“每任务成本”(Cost per Task)的衡量视角——办公Agent的竞争,已经卷到按交付结果算钱的阶段了。知乎

信之前,先看清三个细节

当然,这个“华尔街第一”也不用全信。三个细节:

第一,测试任务偏中文办公场景。年报摘要用的是金蝶的年报,经营数据比的也是国内科技大厂,这套设置天然对国产Agent友好,换成纯英文办公环境,结果未必一样。

第二,杰富瑞是投行,不是第三方评测机构。这次是分析师研究,原始报告并未公开,目前流传的细节基本来自媒体转述。报告里还有这样的表述:2026年1月以来,中国模型的平均价格已经翻倍,但是仍然具有更优的性价比。知乎这是客观描述还是叙事框架,大家可以自己判断。

第三,千问办公自己还在快速迭代中。就在两天前(8月17日),千问办公此前上线的智谱GLM-5.3和DeepSeek V4 Pro两款外部模型已经从产品端消失,可选档位重新变为Qwen3.8-Max加高级/基础/经济三档。华尔街见闻这距离两款外部模型上线,仅过去三天。

月初也有用户反馈高峰期响应变慢、任务排队,产品稳定性还需要时间验证。不过生态铺开的速度很快:8月18日,千问办公正式接入企业微信,此前已接入钉钉和飞书,国内三大协同办公平台齐了。ITBEAR

华尔街实测8款AI Agent,千问办公赢了Claude和Codex?先看清这三个细节再激动

商业化也在推进:千问App端开始试水付费,办公助理专业会员分高级、精英、旗舰三档,高级档连续包月19元、连续包年200元。智东西

这个排名,到底对谁有参考意义

那么这次排名到底对谁有用?我的判断:

如果你的工作以中文办公为主——写报告、做年报摘要、出PPT、做海报——而且在钉钉、飞书或企业微信的生态里,千问办公现在值得试一下。公测期有免费额度:新用户注册可获得2000积分,有效期90天。知乎有用户实测,完成一份12页财报PPT生成任务大约消耗1000积分,轻度使用基本不用花钱。拿报告里那5个任务自己跑一遍,比看任何评测都直观。

如果你主要处理英文工作,或者已经在深度使用Claude、Codex,不必因为这次排名迁移——Claude Cowork只比千问办公低1分,两者差距远小于排名给人的印象,而且测试场景并不覆盖你的主战场。

如果你是开发者,比排名更值得盯的是Harness这个方向的开放程度:千问办公开源了MyContext,上线一周GitHub就破了千星。知乎DeepSeek Harness也是全量开源。Agent工程正在以前所未有的速度被开源化。

后续有几个信号可以继续观察:千问办公会不会重新开放第三方模型接入、这份评测会不会放出八款Agent的完整明细,以及开源Harness产品的迭代速度。

模型决定一个Agent能有多聪明,Harness决定这份聪明能不能靠谱地交付。这次聚光灯打在了后者身上——对真正要干活的打工人来说,这是件好事。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章