这几天不管打开哪个平台,都绕不开"Agent":千问开放平台上线,十几个智能体住进了对话框;腾讯、字节、阿里把通用桌面智能体摆上了桌;汽车品牌也在给新车发布"座舱智能体"。2026年被行业叫做"AI Agent应用元年",常被拿来佐证的一个信号是,底层Token消耗正在指数级增长。小红书
但与此同时,知乎上这类提问一直在冒:一个叫"看了很多自称AI Agent的工具,但实际根本称不上Agent,如何避免被忽悠?"的问题,最近被反复顶上来。知乎两种声音都是真的:Agent确实在开始干活,"假Agent"也确实遍地都是。我综合了学术论文、跨平台用户实测、财报和汽车行业踩过的坑,把这件事一次说清:什么算真Agent,怎么识破假的,现在有什么能用,以及你最终在为谁买单。
划线这件事,学术界先干了
6月,MBZUAI基础模型研究所与卡内基梅隆大学计算机学院发布了一篇《Critique of Agent Model》,作者包括Eric Xing。知乎它划了一条相当锋利的线:现在大多数被称为"Agent"的系统,其实是论文说的agentic——能力由外部workflow和harness安排,模型只是按预定脚本一步步执行;只有能在内部持续维护长期目标、修订自我模型、安排学习日程的系统,才配叫agentive。
翻译成大白话:很多"Agent"本质是"聊天机器人+脚本",每一步都等人推;真家伙得有点"自驱"成分。论文还给出五道结构测试:长期目标是否跨过单次交互存在?自我模型是否被自身结果更新?规划是否基于对环境后果的模拟?谁来决定直接干还是多想一会儿?部署后是否安排自己的学习?
先说明:这是架构判断,不是产品排行榜,这套词也没成为行业统一标准,别当圣旨。但它给了一个很有用的底线——看Agent别问"能不能干活",要问"是谁在推谁"。社区里那句"为什么感觉现在AI Agent都是雷声大雨点小"的疑问,问的正是这件事。知乎很多人用AI还停在"问问题"阶段:写文案、总结文章、改代码,ChatGPT、豆包、Kimi这类全能助手完全够用,它们有用,但不是Agent,差距就在"是谁在推谁"。

翻译成下载前、付费前能用的三个问题
论文的五个问题太学术,结合这周各处吐槽和实测,我把它翻译成对任何"Agent"产品都能用的三个问题。
第一问:你交出去的是"一件事",还是"一个问题"。 交出去一个目标,由它自己拆解、规划、推进,才算Agent的活;你问一句它答一句、等你下一条指令的,还是聊天机器人逻辑。
第二问:过程可不可见、能不能踩刹车。 真Agent会把步骤拆解、工具调用摆给你看,关键节点停下来跟你确认。这不光是体验问题,是安全问题——汽车行业有个词叫"意图级联漂移":你只想预约保养,Agent自主延伸推送保险比价、洗车服务。语音助手是"你下达动作,车辆执行动作",Agent是"你给出目标,车辆完成整套方案",两者不该被混为一谈。知乎越"自主",越要能随时叫停。
第三问:能不能交出可验收的结果。 不是"看起来很努力",而是拿出明确交付物:文件、表格、代码、方案,并且你能逐项检查。有知乎用户在横评文章下的建议很实在:用同一个真实任务测多个工具,记录规划准确度、失败识别和总成本,比看功能清单靠谱。知乎
看到三个红旗,直接绕道:
只有演示视频,不让你用自己的真实任务试——汽车行业已经踩过:发布会演示"一句话搞定一整套行程",量产版大多还在初级试用阶段;不少老车型OTA推送的"AI智能体升级",只是在原有语音系统外层套一层大模型API。知乎
只讲效果不讲成本——Agent跑复杂任务极烧token,产品说不清额度和计费规则的,留心账单。
把简单概念包上黑话——"搭载大模型"不等于Agent,"工作流"也不等于Agent。
现在想试,有什么能用
综合这周的跨平台横评和真实用户反馈,非程序员能碰到的大致分三档。

通用桌面办公档:腾讯WorkBuddy、字节豆包桌面版、阿里QoderWork都算这类,接写文档、做表格、查资料、处理本地文件。豆包门槛最低,还能共享屏幕问问题;WorkBuddy和QoderWork更偏向"把整个办公任务接过去"。口碑两极:有人吐槽"吸金一流,弃用",也有人觉得做方案加处理Excel真香。知乎
编程Agent档:Claude Code、Codex、Cursor,以及国产的Kimi Code、Zcode等。这档真强但门槛高,不是普通人的主战场,只留三个真实信号:Claude Code体感最好但容易封号;Kimi Code前段时间因为过于火爆暂停了个人用户订阅;没有"最强",只有"什么活配什么Agent"。知乎

开源DIY档:OpenCode这类不绑模型,自己接DeepSeek,成本可控,但要自己配环境,适合爱折腾的人。
再提醒一句收割盘:小红书上有帖子喊"5个Agent帮我打工,我躺赚百万(亲测有效)“。小红书谁要是向你兜售"自动赚钱的Agent”,先拿上面三个问题过一遍。
今天的新闻,验证了成本真相:没有免费的Agent午餐
今天两条财报新闻值得细看。Canva向投资者预警,年度营收增速将放缓至20%,原因居然是"AI功能太受欢迎"——公司主动叫停了原定推动付费订阅增长的AI功能铺开计划,COO的原话是,引入AI后"单位经济模型发生了根本性变化"。36氪
Figma更直接:第三季度营收增速指引从48%下调到36%,业绩指引发布后,股价单日下跌约15%。36氪

Figma的CFO在电话会上说得很直白:还在测试阶段的产品不收客户一分钱,“推理成本由我们自行承担,没有任何消费收入来抵消”。36氪这话对普通人的意思是:你用的每个"免费AI功能"都有真实推理成本,只是现在有人替你付;补贴撑不住的那天,结局要么是限制,要么是收费。所以两条建议:用免费版测试完全够,但别把核心工作流建在"永久免费"上;真要付费,看三样——额度透不透明、数据能不能导出、能不能交出可验收的结果,缺一样就先缓缓。
想动手,就照这个来
这周我看到最靠谱的入门建议是:挑一件低风险、高重复、可验收的事——整理一批文件、研究几个网页、做一份竞品对比表,把每周都会做的一套操作录成可复用的技能。先跑通一次,再固化流程;发现问题,再修改标准。别一上来就交出去重要任务。
值得继续盯的信号有两个:一是Canva、Figma这种"成本体检"会不会扩散到更多AI工具,以及它们把成本转成收费的形式;二是国产Agent产品在"元年"叙事之后,会不会跟进额度透明和结果验收这两项硬指标。这两点,决定了今天这批"免费自助餐"里有多少能保住。
Agent元年是真的,假Agent也是真的。与其急着上车,不如先用三个问题筛一遍——省下的钱,可能正好是一个"元年税"。