最近Agent工作流编排这个圈子,出现了一场很明显的拉锯。
一边是演示视频越来越炸。B站上一条多Agent并行审代码的实测视频,几天跑出一万三千播放、六百多收藏。B站前Meta工程师"一天提40个PR、同时调度二三十个Agent"的分享也在到处转。B站另一边,你翻翻评论区和本周的复盘文,风向完全是反的:
“视频教程里能造火箭,实际使用自行车哪里都响”。B站
“烧不起token。最多开几个普通子代理用一用,复杂了就Handoff给下一个新对话了”。B站
“不好用 太浪費token 速度還慢”。B站
这不是个别人在泼冷水。我把知乎、B站、小红书这几天的讨论捞了一遍,发现大家吵到最后,都收敛到了同一个问题:这个任务,到底配不配上一个Agent?
今天不聊框架选型,也不聊工具教程,就把这周社区里反复出现的判断方法整理成一张清单。你手里如果有正想自动化的活儿,可以对着过一遍,能省不少token,也能省不少返工。
先看两个真实复盘:为什么"往右走"成了这周的主旋律
知乎上本周有好几篇方向一致的复盘。一篇复盘文章的标题说得直白:“从自主到确定”,企业Agent落地正在往右走。知乎也有人给了一个扎心的数字:一位作者调研127家企业后发现,76%的企业AI工作流项目无法从PoC进入生产环境。知乎这个数字来自单一作者的自述调研,别当权威统计看,但"Demo惊艳、落地没人用"这个现象,评论区里没人反驳。这些复盘指向的短板高度一致:Agent系统离生产差的不是模型,而是工程化的分层——业务入口、控制面、执行面、数据面、治理观测面,一层都不能糊弄。知乎

最有参考价值的是一组A/B对照实验:有位作者把写作任务拆成研究、整理素材、写大纲、安全检查四个阶段,分给4个Agent接力,和"一个Agent从头做到尾"对比。结果多Agent组总token多了51%,耗时多了65%,盲评还低了8分。知乎他把这笔账叫"交接税"——上下文每传递一次,下一个Agent就得重新读一遍、重新理解一遍,串行任务又没有任何并行收益。
B站那边也有个反方向但同结论的案例:一位HuggingFace工程师公开分享了自己自动化"引导研究者上传模型权重"这项重复工作的过程——他最后的方案不是自主Agent循环,而是GitHub Actions上的低成本夜间Cron定时任务。B站原因很朴素:这个流程的每一步都是确定的,用Agent只是给不确定性付钱。
当然也有Agent用得漂亮的:垂类Agent商业化落地,把原来人工几天的活儿压缩到两三个小时。B站并行调度做代码审计,一天几十个PR。但注意,这些案例有一个共同点——它们都不是从"我要搭个多Agent架构"出发的,而是先确认了任务本身的结构,再决定用什么。
四个问题,给任务定档
Anthropic在Building Effective Agents里给过一个被反复引用的区分:workflow是LLM和工具沿着预定义代码路径跑,agent是模型在运行时动态决定自己的过程和工具调用。知乎作者"蜗牛sir"这周在此基础上拆得更细:任务路径能被稳定写成规则时,优先固定工作流;只有某一步需要理解、分类或生成时,优先模型辅助工作流;只有下一步必须根据运行时的新观察变化,Agent才进入候选。知乎我把几篇高赞讨论综合一下,变成你可以直接用的四问:

第一问:路径能不能稳定写下来?
输入固定、步骤固定、分支能用规则表达的,直接用脚本、定时任务或者RPA。零token成本,可复现,出了问题一眼能定位。评论区有句话说得好:“给一个叫addtask的tool,然后主代理把tasklist建立好,剩下的交给for循环,skill上写着最后一步的验收标准就行”。B站很多看起来需要Agent的活儿,其实一个循环就够了。
第二问:到底哪一步需要"理解"?
如果整条流程里只有一个环节需要读文本、做分类、抽信息、生成内容,那就用固定工作流加一个模型节点:模型只负责那一步,前后仍然走确定路径。客服邮件分拣、发票信息抽取、评论初审,都属于这一档。这一档是n8n、Coze、Dify这类编排平台最划算的用法——模型被限制在一个节点里,其余部分走确定路径,账单可控,错误也好查。
第三问:下一步是否必须根据运行时才出现的新观察来决定?
只有任务需要"先查A,再根据A决定是查B、是问人、还是停下",Agent才真正进入候选。排障、开放式调研、多轮交互类任务属于这类。反过来说,如果你的流程图里每个箭头上写的是什么条件,你现在就能全部列出来——那它就不是Agent任务,别为它付运行时的钱。
第四问:三道门过得去吗?
就算前三问把任务送进了Agent档,还有三道门:结果能不能验证(有没有权威数据或人工复核,而不是"看起来合理");错误能不能控制(动作能否撤销、重试会不会重复执行、失败后能不能停在检查点转人工);成本能不能算清(token、延迟、重试、人工接管加起来,跟人工或固定流程的基线比,到底划不划算)。任何一道门过不去,就降档——降成"模型建议加人工确认",或者干脆退回固定工作流。其实,能证明"这个场景应该用固定工作流",本身就是有价值的结论。
三档落座,对号入座
把上面四问的结果落到操作上,大概是这么三档:
脚本档:输入输出全固定。cron定时任务、Python脚本、RPA,免费、稳、好查。批量处理文件、固定格式报表、定时抓数据,都该待在这一档。
模型辅助工作流档:主路径固定,个别节点需要理解。固定流程里嵌一个LLM节点,工具上n8n(适合自托管、爱折腾的)、Coze(上手快、生态现成)、Dify(知识库和私有化部署强)都覆盖。现在的可视化编排画布基本都长一个样:左边节点库、中间连线画布、右侧参数面板,模型节点只是流程里的一个环节。注意新版本的变化:n8n最近几个版本上了AI Assistant和能挂skill的Agent节点,平台本身在往"固定流程加局部自主"的方向走,跟这周的社区共识正好合拍。小红书
<#&!53#&!>
Agent档:路径必须运行时决定,且三道门全过。做好三件事再上:预算上接受"用延迟和成本换任务表现"这笔交易;工程上留好检查点和人工接管入口,让每个节点的运行结果和耗时都可追溯,账单和错误才有据可查;架构上别急着拆多Agent——先跑通单Agent基线,拆不拆拿数据说话。

接下来值得盯的三个信号
一是MCP协议7月底的无状态化改版,社区这周还在密集写学习笔记,它直接影响工具编排的扩展方式,做Agent接入的可以重点看。知乎二是各平台把Agent能力往固定工作流里"收编"的趋势(n8n的Agent节点、各家企业级Agent平台),"编排"和"自主"的边界还会继续移动;三是模型侧的价格变化——交接税贵不贵,很大程度取决于token单价,这个账要每季度重算一次。
最后说一句实在的:Agent不是越自主越值钱。你花的每一个token,都应该花在"人写不出规则的那一步"上。
你手里想自动化的任务,卡在第几问?评论区聊聊,我帮你一起定档。