今天(8月25日),豆包工作正式发布,"办公Agent三巨头集齐"的消息应该已经刷过一轮了。发布会本身我不重复,更值得看的是另一件事:上线当天,知乎、小红书上的首日实测就堆了起来,而且结论出奇一致——能用,但都踩了同一类坑。
我把全网的实测翻了一遍,如果你打算领了30天免费权益去试试,建议先看完这篇再动手。
先花两分钟同步事实
豆包工作已经上线PC客户端,也可以在最新版豆包电脑版里直接使用,下载安装并登录就能免费领取30天订阅权益,具体权益范围以产品页面为准。知乎官方的定位是,不只「生成内容」,更帮助个人与企业「完成工作」——给出一个目标,它自己拆解任务、调用工具、持续推进。微博
它还能操作浏览器和电脑,用飞书账号登录后,可以在你既有权限范围内直接调用聊天记录、文档和会议纪要。知乎官网目前上架了超过200个技能和连接器,还自带定时任务。36氪

背景一句话:这是办公Agent赛道的第三个巨头玩家。腾讯WorkBuddy今年3月上线,据易观分析数据,6月单月访问量达2097万。知乎阿里把三条智能体产品线合并成千问办公,8月3日公测;百度则在8月14日把更名后的库库AI推成独立产品,官方称AI办公MAU超过2500万。36氪巨头打架,用户的好处是:眼下全是免费或低价的补贴期。
第一批用户,到底踩了什么坑
发布会是一回事,真上手是另一回事。我从首日实测里挑了几个最值得注意的细节:

一、周报任务:10条漏了2条。有知乎作者拿真实周报任务做了测试:给了10条任务项,豆包工作按时交付,但漏掉了2条。知乎按数量算完成度是80%,可问题从来不是"写得像不像",而是"有没有漏"——万一漏掉的那条恰好是关键事项,后面的人就会基于一份不完整的周报继续干活。
二、政策查询:你问的是你所在的城市,它给的是全国口径。有HR博主测了三个场景:薪酬对标,以前拼半天才能出一份参考报告,现在3分钟就有,但数据时效性标注不清晰,仍需人工二次核实;查社保基数、辞退补偿口径时,地方性细则容易给成国家通用口径,区域差异没有自动提示。小红书速度是真快,坑也是真的。
三、创意类任务:摔了会自己爬起来。另一位作者给豆包工作出了个难题——给一个3D网页游戏换主角。中间它连踩4个坑:人物不显示、纹理变黑、透明度不对,但亮点在于,它踩坑之后自己查、自己改、自己重跑,最后真的跑通了。知乎

四、也有好消息。普通任务的积分消耗不算快:跑一次"安装插件—查看电脑环境—分析—输出是否可用"这类高推理任务,大约消耗2.5积分,和WorkBuddy初期的消耗感受差不多。知乎上手成本也不高,还支持局部协作编辑——在文档或PPT里选中某一部分,让它只改这一处,不用推倒重来。
这些坑的共同点:AI干活,没人验收
把这些坑放在一起看,会发现一个很有意味的共同点:今天的Agent不是"不会干",而是干得留缺口,还不主动汇报缺口。周报漏掉的,恰恰是你以为它记住的那条;政策给出的是"全国口径",不是"你所在城市的口径";JD框架够用,缺的是你公司的味道。它默认的优化目标,是尽快给出一个看起来完整的答案,而不是"交付并负责"。

人类同事也会掉链子,区别在于:同事掉链子会被指出来,慢慢就知道你的标准;而Agent现在既不知道自己掉了链子,也不知道你的标准是什么。有实测作者总结得很准:输出看起来完整,不等于任务真的完成。知乎所以我的判断很直接:现阶段用Agent,拼的不是它会不会干,而是你会不会验收。验收,是提效链条上最后一环,也是最要紧的一环。
说"交给你了"之前,先学会验收三招
当然,验收也有技巧,从头到尾全查一遍等于自己重干。这三招亲测有效:
第一招,委托时把清单和"完成标准"一起交出去。别只说"帮我整理本周周报",要说"整理周报,本周任务共10项,逐项给出进度,最后告诉我哪些缺信息"。关键是最后半句——要求Agent在交付时自报"没做哪些"。实测已经证明,它不懂不会反问,而是理解个大概就直接开工,那只能由你把验收标准提前压进去。
第二招,重要任务盯中间产物。要拿去汇报、对外发布的任务,别等到交付才打开,大纲或初稿出来先问一次。方向错了,大纲阶段改一次是一分钟,成品阶段改一次是一小时。那个换游戏角色的任务踩了4个坑还能跑通,前提就是作者全程盯着、不断反馈,否则它可能停在"黑色矩形"那一步。
第三招,验收时问三句话。一问:"你没做哪几条?"二问:"哪些数据是你猜的,哪些有来源?"三问:数字、日期、人名、引文这四类,逐条对照原文核一遍。这四类是AI幻觉的重灾区,也是最容易一出错就要命的地方。
顺手给一份委托适配清单,来自首日实测的归纳:
适合先委托的:高频、机械、可核对——周报汇总、文件整理、跨平台信息收集、对比表初稿。就算掉链子,补救成本低。
暂时别整体委托的:财务数据、法律依据、对外发布文案、社保公积金这类地方政策口径。不是它做不了,而是错一次代价太高。测了三个场景的HR博主问得很扎心:如果你80%的时间在做信息整理,只有20%在做判断和关系,AI接走那80%之后,剩下20%撑得起一个HC吗?小红书用AI也是同一个道理:80%的信息整理交给它,20%的判断留给自己。
适合谁,这笔账怎么算
先说结论:公司用飞书的,豆包工作是目前最顺的入口,聊天记录、文档直接打通(权限范围内);钉钉用户优先看千问办公;企业微信生态对应WorkBuddy。你在哪个生态,比模型参数更重要,这一点社区已有共识,不展开。
免费这30天,建议盯两个指标,而不是"用了多少次":
返工率:交付后不用推翻重来的任务占几成。返工超过一半,说明这类任务还不适合整体委托,换个拆法,或者老实手动。
额度消耗速度:普通信息整理任务消耗不快,但多轮调用、多次出图的创意类任务,单次就能烧掉497个额度——接近赠送的每月2100额度的四分之一。知乎

打算长期用的,要提前估一下这个消耗速度是否撑得住预算。参考一下现在的价位:豆包订阅体系三档每月68到500元,WorkBuddy每月99到999元,千问办公个人版每月98到198元。36氪豆包工作免费期结束后怎么收费,目前还没有公布,这是打工人要留意的悬念。
再提醒一句:免费期不会一直这么大方。今年6月,OpenAI就把Codex免费额度从每周重置改成每月重置,实际可用量缩水了四分之三。36氪所以,真想测的任务趁早测,趁权益还大方,把数据拿在手里。
最后说一句
豆包工作和这波办公Agent,已经从"不会干"跨到了"会干但留缺口",值得试。它能走到哪一步,不取决于发布会上的PPT,而取决于你的验收动作到不到位,以及这30天里测出来的那个返工率。
你被Agent坑过,或者被它惊艳过,评论区聊聊——顺便对一下返工率。