流量第一、考分垫底:第一个替你干活的AI办公Agent,该按任务选而不是按名气选

源自223位全网作者

04:51

先给这篇文章对个号:你平时已经会用豆包、千问这些聊天AI写文案、查资料,最近刷到一堆「AI替我干活」的Agent教程,想把一小时会议录音、一整年销售表格直接丢给AI,但对着一排名字(WorkBuddy、千问办公、豆包工作、百度搭子、金山灵犀、TRAE Work)和68、78的月费在犹豫。这篇文章就替你把这个决定做完——不替你选,但把三张不同立场的「考卷」摆在一起,给你一张能直接用的分工表。如果你是程序员在挑AI编程工具,这篇不覆盖,那是另一个话题。

一、流量榜第一,考分榜垫底:九月最魔幻的一张对照表

8月19日,美国投行杰富瑞(Jefferies)给8款主流办公Agent出了一张卷子:五道真实办公题——多文件年报摘要、联网比对经营数据、操作真实浏览器查资料、按数据做英文PPT、照参考图做营销海报。不是跑分,是分析师把任务一道道真跑了一遍。结果:千问办公95分全场第一,也是唯一五科全部90+的;Claude Cowork 94、Codex 92、Kimi Work 86、豆包工作77、MiniMax Code 71;流量最大的WorkBuddy只拿了66分,和Gemini Spark并列垫底。人人都是产品经理

流量第一、考分垫底:第一个替你干活的AI办公Agent,该按任务选而不是按名气选

再看另一张榜。易观2026年二季度数据:6月国内桌面端办公Agent访问量,WorkBuddy一家2097万次,超过第二名和第三名之和,全平台月活2000万;腾讯系以53.8%占了半壁江山,字节系23.8%、阿里系15.2%排二三,百度全月只有72万,排在第十二。今日头条

流量第一的,考试垫底;考试第一的,背后阿里系流量只排第三。同一个市场两张榜,说明一件事:分发能力和干活能力是两回事,而且后者跟名气不挂钩。顺带说,这个对不上还有更狠的注脚——过去十年飞书、钉钉用「协同功能多不多」定义了办公软件的好坏,而这次考分第一的千问办公和流量第一的WorkBuddy,都是从别的土壤里长出来的:前者8月才把阿里内部三款功能雷同的产品(QoderWork、悟空、MuleRun)合并出来,后者底子是腾讯云代码助手团队的产品。

杰富瑞还把差距拆开了一层,这层对普通人选型特别有用:分数不只看模型智商,更看模型外面那套叫Harness的工程机制——指令怎么下、上下文怎么组织、工具怎么调用、错了怎么纠正。千问办公的底座模型Qwen 3.8 Max智商分只有56、排第四,加上Harness总分直接冲到95;同一个模型只换一套Harness,实测能差18个百分点。人人都是产品经理所以「模型都一样强、看名字选就行」是八月以来最大的误区:差距真的存在,但藏在品牌名底下,不在品牌名上。

二、三张考卷、三个第一名——吵架的地方才是真话

比杰富瑞更贴近国内用户的是8月底9月初的两轮本土实测:雷科技拿5款产品跑了6类任务,默认模式、同一素材,每个任务只给一次执行机会。雷科技 极果拿WorkBuddy、TRAE Work、千问办公跑完六轮真实办公任务、全程无广,人人都是产品经理社区则给了一套选型框架。极果网把三份东西叠在一起看,结论非常有意思:三张卷子选出了不同的第一名,而它们互相打脸的地方,恰好就是你该留心的地方。
流量第一、考分垫底:第一个替你干活的AI办公Agent,该按任务选而不是按名气选

任务类型

实测细节

谁相对靠谱

文件批量整理、重命名

极果轮:千问2分钟完成,WorkBuddy要17分钟;微博有用户实测「抠图改图不行,但改命名、后缀名真方便」

各家都能交差,这是AI最「真香」的区间

会议纪要/录音转写

豆包7分45秒最快但把WAIC听成WIC、日期写错;金山灵犀8分55秒、13积分,五份里最省心但也有音译错;千问跑了73分钟、201积分

金山灵犀、豆包,但专有名词和日期必须人工核对

表格清洗

关键分水岭:雷科技的表要求删重复,WorkBuddy和百度搭子交回来1353行「一条没少」,等于没清洗;灵犀压到正确的1323行、只花14积分

灵犀、豆包、千问交付真结果;验货方法就一招——看重复行还在不在

联网调研做PPT

三家全翻车:千问编出一个不存在的国标号GB 34914-2026、说三家产品同一天发布;WorkBuddy把友商价格写错;内容层面PPT一律要人工审。唯一做了统一模板产品贴图的是豆包

没有放心选项;贴图找豆包,文字数据自己核

定时任务/日报

五家都能待机唤醒电脑,豆包工作额外能拉云电脑、本地机关着也照跑

千问排版观感最好,豆包机制最灵活

手机远控电脑

豆包语音2分44秒最快但文件回传手机还没打通;WorkBuddy通道最全(自家App、微信小程序、飞书钉钉企微机器人);百度把「横评」听成「横屏」

WorkBuddy、豆包,临时救场够用

复杂打包活(新品发布全套物料)

豆包16分钟交齐但耳机图三视图乱长还带水印;灵犀20分钟交11项、接近正式媒体资料包水平;百度搭子意外挽回颜面

要接近能用的成品:灵犀、豆包

三份实测交叉出一个反常识的判断:目前不存在「全能第一名」,但存在「任务第一名」。杰富瑞那张卷子偏重「数据+文档+浏览器操作」的标准化科目,所以千问办公吃香;雷科技和极果的题更杂(图、视频、多端),于是金山灵犀和豆包被看见了。看评测不用站队,看的是同一个产品在两份卷子里是否都及格——都及格的,才是你闭眼丢活的对象。
流量第一、考分垫底:第一个替你干活的AI办公Agent,该按任务选而不是按名气选

三、别按「谁强」选,按你的入口生态选

把三家的差异翻译成一句话:产品形态已经卷得越来越像(连三栏布局、专家/技能这些概念都互相抄),真正抄不走的是各家屁股底下的生态。选型先问三件事(这套框架是社区实测派总结的,很实在):

  1. 你每天打开的第一个工作入口是什么。公司在钉钉上,千问办公就能直接读你的审批流、知识库;团队在飞书,豆包工作碰得到你的文档和会议纪要;平时用腾讯文档、企微沟通,WorkBuddy的连接器最全(微信、小程序、企微、QQ、飞书、钉钉全接)。今日头条极果网你不在那个生态里,它的看家本领对你就是零。金山灵犀是另一个物种:它不做入口,做编辑器里的原生办公,交付的Word/PPT/Excel可编辑度最贴近传统习惯,适合「活最后都要落成Office文件」的人。雷科技

  2. 你想让AI帮到哪一步。只是写写总结、查个资料,各家免费版都够,别为用不到的Agent能力掏钱。要它真动手——批量处理文件、操作浏览器、跑定时任务——才进入桌面Agent的付费区间。

  3. 你的数据能不能上云。金融、政务、涉密是硬线:WorkBuddy支持私有化,千问办公旗舰版有专属网络方案,豆包工作企业版有内网选项。但记住一句实话:产品「支持私有化」不等于你们安全部门会点头,先过合规再谈选型。
    流量第一、考分垫底:第一个替你干活的AI办公Agent,该按任务选而不是按名气选

四、成本账:同干一份纪要,积分差了18倍

价格带先摆平:金山灵犀48元/月(给5000积分)、百度搭子59元/月、豆包工作68元/月(新用户登录送会员)、WorkBuddy 70元/月、千问办公78元/月。雷科技差价一杯咖啡,但真正的成本在积分消耗里

雷科技同一份53分钟会议录音:灵犀花13积分、千问201积分、WorkBuddy 235.99积分——同一件事,烧掉的钱差接近18倍。雷科技极果那边的观察是千问默认模型六项任务合计才花129积分、反而最省——各家积分汇率互不相同,跨品牌比价格没意义,同一家比「你最常丢的那类任务」才有意义。

免费额度够不够试错?基本够:WorkBuddy每日领100积分+每月500;TRAE Work每日签到200;千问免费版每天100;豆包新用户直接送会员。极果网这也是我建议的打开方式——先用免费额度跑两周你真实的活儿,再决定给谁交68元。
流量第一、考分垫底:第一个替你干活的AI办公Agent,该按任务选而不是按名气选
广告里的演示永远比你的工作流好看,只有你自己的活儿最诚实。另外两笔远期账值得留意:底座模型的API成本差正在拉开(Qwen 3.8 Max标价只有GPT-5.6 Sol的四分之一),Agent干长活烧的是轮次,订阅价后面大概率还有变数。人人都是产品经理

各家企业版计费也都没收口:海外Anthropic的企业版20美元一个席位的月费只买平台和管理、所有用量按API价格另算,微软则按Credits计费明码标价。今日头条 个人用户更没必要在没跑顺的时候买年约。爱折腾模型的,目前只有WorkBuddy和金山灵犀支持外接API。雷科技

五、四个坑,都是这一个月里被反复踩的

  • 把「教程刷屏」当「用户口碑」。WorkBuddy的保姆教程、15个练手项目、十个必装skills在小红书B站连轴刷屏(收藏从1100到3800不等)。小红书 但同时冒出的是「扣666进群领资料」式卖课矩阵、同文案双UP搬运,甚至「停止使用某模式」的避坑警告帖也能冲到近万播放。哔哩哔哩教程生态的繁荣度≠产品成熟度,判断真实口碑去翻素人晒单——微博上一条91赞的实录:用户把抖音链接丢给豆包工作台,让它提取视频文案、整理品牌和产品、再按二级标题自动排版进指定飞书文档,博主自己的结论是「反应挺快的,也没有出错」。微博

  • 把本月的榜单当永久结论。五款被测产品里三款(千问办公、灵犀、豆包工作)最近一两个月才拼成现在这样。雷科技原话:今天测出来谁好谁坏,过两个月还真不一定。雷科技月付,别年付;每月复核一次你的默认选择。

  • 提效反噬:省下的时间拿去「看AI干活」。知乎两个40万+阅读的问题(「为什么AI提效,我感觉更累了」「为什么用AI写代码之后人反而越来越累」)给的答案高度一致:把AI塞进旧工作流,验算和返工会吃掉所有省下的时间。知乎知乎具体做法是:丢任务前先定验收标准(行数列数、专有名词、数据出处),交付后只核这三样,不逐字陪跑;一件事重复出现三次,再考虑沉淀成流程——社区里那句「每次重来不是用AI工作,是用AI打零工」值得贴在显示器边上。知乎

  • 一步到位搭大工作流。知乎方法论区近一个月的共识恰好相反:选一项重复、结果可见的小任务先跑通,别一上来搭自动获客、年入百万那套。知乎卖课向的「自动化工作流」内容在知乎的数据普遍惨淡,社区已经不buy in了,你也不必替它们验证。

六、下一步

如果你只做一件事:这周挑一个你拖了最久、但规则清楚的小活(10个乱文件按内容归类、一份1小时录音转纪要、一张积了重复项的表),用任意一家的免费额度跑一遍,交付后只查三点——重复项删了没、专有名词和数据对不对、成品能不能直接编辑。三点都过,这个任务类型就从此是你的「外包区」;两点不过,它暂时归你,AI归「草稿区」。
流量第一、考分垫底:第一个替你干活的AI办公Agent,该按任务选而不是按名气选

值得继续盯的信号有三个:WorkBuddy和企业微信到底什么时候真正打通(腾讯手里12亿人关系链这张牌目前还没打出来)、豆包手机回传文件功能的迭代、以及杰富瑞们的下一张卷子——在这个迭代速度下,一份两个月前的评测和一张月活榜一样,都只能当参考。今日头条

你最近把什么活丢给了Agent,翻车程度如何?评论区报个任务和用时,给大家凑一张真实的「可外包清单」。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章