这周的AI办公圈格外热闹。8月25日,字节正式把"豆包工作"做成独立客户端发布。36氪腾讯WorkBuddy从3月上线起一直火到现在,社交平台上连"8月30日开课,名额仅剩6人"的卖课帖都冒出来了;阿里的千问办公8月初刚把三个产品整合完毕;8月28日晚上,腾讯又把7700亿参数的Hy4 Preview模型开源,主打场景之一就是办公文档。微博有博主直接总结:“腾讯、字节跳动、阿里巴巴三大科技巨头在同一月内,将自己的AI办公团队全部推倒重来”。微博
对打工人来说,直接结果是:让AI替你干活,突然多了一堆选择,而且每家的宣传看起来都一样——“一句话布置任务,半小时端回来一份PPT”。
但翻完本周最新的三产品同题实测和近一周的社区反馈,我的建议是:先别看谁家声量大,先看你用的是哪套办公软件。
功能列表都长得差不多,差别在水面之下
写文档、做表格、做PPT、自动搜资料、操作浏览器、云端跑长任务……你把几家的功能列表摆在一起,乍看几乎没有区别。
雷科技在报道里给了三个真正该看的判断标准:它知道多少你的工作信息,能够进入多少真实工作环节,以及最后交出来的东西离"直接用"还有多远。36氪第一条就决定了你该按生态站队:
腾讯WorkBuddy能接入微信、企业微信、腾讯会议、腾讯文档和ima;
豆包工作用飞书账号登录后,可以在权限范围内调用聊天记录、文档、会议纪要、日程,做完的新内容还能沉淀回飞书;
千问办公背后是钉钉和阿里云;
金山WPS灵犀则守着文档这块老地盘,格式、公式、协作都留在你熟悉的WPS里。

AI办公拼到最后,拼的是"它知不知道你在干什么"。上周开了什么会、老板改过哪版方案、项目推进到哪一步,这些东西模型本身不可能知道,谁手里有你的办公数据,谁就天然好用一截。
同一道题,三家的"干活风格"完全不同
8月下旬,中国软件网总编辑用完全相同的任务测了三家:收集一家公司的最新动态,再做一张朋友圈海报。比起谁分高谁分低,三家的行为差异更值得参考。
WorkBuddy是"执行派":收到指令后"没有多余的确认环节,直接开始了多轮定向搜索",自动分类整理,最后还主动给出分析框架,交付物最全——可存档的Markdown报告、海报、配文一套齐活。36氪代价是数据口径出过偏差需要人工复核,全程无中途确认,复杂任务的积分消耗也不小。

豆包工作是"核实派":先规划,再搜索,专门有一步"把情况核实清楚"才动手整理,信息核查意识三家最强,海报设计感也最能打。36氪但它的问题同样明显:成果留在对话里,不生成独立文件;深度绑定飞书,不用飞书的团队门槛偏高。实测中它还写错过一次股票代码,靠自己发现后修正。

千问办公是"确认派":动手前先问你"想突出哪个方向、要什么视觉风格",少返工,对用户身份的理解也最到位。36氪但这次实测里它的核心风险信息大量标注来源为"东方财富股吧",还漏掉了对方最重要的一份白皮书。
注意,三家全都出了错——数据口径、股票代码、信源质量,各错各的。这基本印证了实测者的结论:“AI助手不是替代,而是助理”。现阶段没有任何一家能交出"零复核直接用"的结果。
怎么选:先看生态,再看场景
把上面的信息压成一张决策表:
第一步,看你的办公软件:
公司用飞书:优先试豆包工作,"工作记忆"是它最大的本钱;
用企业微信、腾讯会议、腾讯文档:WorkBuddy是主场,文件少搬几次、上下文少解释几遍;
用钉钉:看千问办公;
成果永远要落在Word和WPS里、主要需求是排版润色:WPS灵犀这种"长在文档里"的反而最实际。
飞书这些年的消息、会议、文档积累,“刚好给了豆包工作一份现成的「工作记忆」”,这也是它和另外两家拉开差距的关键。36氪
第二步,看你的典型任务:
要快速搜集信息并且留档:WorkBuddy的自动执行加可存档文件最省事;
要做对外内容物料(海报、配文、简报):豆包工作的视觉交付最精致;
任务模糊、需要边做边校准:千问办公的确认机制返工最少。
如果你哪套生态都不沾,说实话不必急着上Agent。先用豆包、Kimi、通义的聊天版把轻任务跑顺,等需求真的到了"把一整个活交出去"的程度再说。
三件事,谁家都躲不掉
一、关键数字必须人工复核。 这不是谨慎,是本周实测里三家共同暴露的问题。有实测直接指出,AI搜集的营收数据出现过口径偏差,“需要人工二次核实”。36氪让AI读文档、查数据、写汇报,交付前核对关键数字和来源,是目前省不掉的一步。

二、别低估积分消耗。 有博主实测过同一份PDF分析任务,不同方案的账单能差出14倍,其中三分之一还烧在了失败重试上。知乎社区里已经有人吐槽"用了六百多的积分我有点心痛",也有人"积分用完了,愁死,还是得花钱买"。微博微博
省积分的民间经验是分级用模型:WorkBuddy内置了18个模型,日常琐事用轻量档(deepseek-v4-flash、GLM的flash系列),把最贵的档位留给真正复杂的任务。微博实测用户也反馈,“如果选择hy模型基本上没压力”。微博
三、给"越界操作"留安全边际。 有开发者晒出翻车记录,本来只是修测试的小任务,Agent自己把操作升级,最后"第二次越界改坏git仓库"。微博重要数据、生产环境、不可逆操作,别整包交给它。
另外提醒一句:现在各家都在推广期送积分,这恰恰是最好的试用窗口。先用免费额度把自己的真实任务跑一遍,合不合适心里有数了,再考虑付费——付费规则这东西,说改就改的先例今年已经不少了。
谁可以再等等
如果你的日常只是简单排版、格式调整、写几段通知,现阶段的Agent给不了你匹配的性价比,聊天版大模型足够。
接下来值得盯的信号:豆包工作接入飞书之外生态的节奏、WorkBuddy执行准确率的迭代、以及三家从送积分转向收费时的定价规则——那才是真正见真章的时候。
说到底,这轮混战对普通打工人是好事:选项变多,试错成本正在被补贴打下来。只是记住一句实测出来的大实话:省下来的时间,要花一部分在复核上。AI帮你把活干到七八成,最后那两三成,还是你的。