上周小红书有个帖子,戳中了每一个正在准备 Agent 开发面试的人。
一位面试官说,他一上午面了 6 个 Agent 应用开发,简历几乎是一个模子刻出来的:LangGraph、CrewAI、MCP、RAG、记忆系统,样样齐全。结果一追问落地细节,挨个露馅。小红书这条帖子拿到 200 多赞、260 多收藏——收藏比点赞还多,说明大家都在偷偷存下来对照自己。
我把这条帖子,和最近另外两条热帖放在一起看了看:一条是字节 Agent 开发上岸者的复盘,189 赞、319 收藏;另一条是另一位面试官的记录——他面了 6 个 Agent 开发,只对第 4 位候选人说了"通过"。三条帖子,三个立场,指向的却是同一件事:
Agent 开发的面试,考的早不是"你会用哪些框架",而是"面对大模型的不确定性,你能不能工程化地交出确定结果"。小红书
面试官真正问的,翻来覆去就四类
那条爆火帖子里的提问,其实非常有套路。我把四类问题和它们真正想考的东西整理出来:
第一类,工具调用稳定性。"模型调工具时报错、参数不合规、服务超时,代码怎么兜底?"只会调通正常路径的人,这题一定含糊。真正被业务坑过的人会说:指数退避重试、结果校验、实在不行降级转人工。追问还有:模型是直接调 API 还是先查记忆?工具返回做没做校验?——考的是你有没有被真实业务坑过。小红书
第二类,记忆与上下文。"用户聊到第 20 轮,Agent 把最早的关键信息忘了,你第一步查什么?“答不出记忆分层、上下文压缩、关键信息优先召回,基本就暴露了。简历写"精通记忆系统”,一问上下文管理马上现原形,是最常见的翻车现场。
第三类,跑偏、死循环与成本。模型反复调工具出不来结果,是干烧 Token 还是设最大步数强退?违规回复有没有审核校验?多轮对话 Token 飞涨,做没做缓存和上下文裁剪?稳妥答案是有固定形状的:日志重放、关键节点断言、Bad Case 闭环复盘。小红书

第四类,编排设计。简历写"工作流编排",面试官会问:为什么用状态机不是线性 Chain?分支失败怎么回滚?上线过的人会聊节点可重试设计、分支判定逻辑、防止单点拖垮整条链路。
在这四类之上,还有一道更高层的题。另一位面试官出的实战题是"让你开发一套电商客服 Agent,你会怎么做"。他最终通过的那位候选人,第一句话是"我不会先写代码,先判断这个场景值不值得用 Agent 做"。小红书查订单、退款这种高频、规则固定的场景,Agent 替代人工 ROI 高;情绪安抚、复杂纠纷这种灰度场景,强行上 Agent 只会翻车;没有结构化知识库和反馈迭代机制,坚决不上。还有一个新手容易忽略的点:大厂不看对话准确率,看"任务终结率"——每一步意图识别、工具调用、流程推进的流失在哪,转人工时能不能带着上下文走。
这些坑,已经被新一代框架做成了标准件
值得注意的是,上面这些让候选人翻车的问题,并不是只能在生产环境里靠血泪换来。新一代开源 Agent 框架已经开始把这类工程考量直接做进框架层。以 DeepSeek 刚开源的 Harness 为例,它的插件体系把工具执行拆成了 emit、parallel、serial、bail、waterfall 五种事件分派模式——失败走哪条路、要不要短路、能不能回卷,在框架层就有标准答案,而不是每个开发者自己现场发明一套。知乎

这也印证了那位字节上岸者说的大实话:Agent 本质上还是一个复杂的后端系统,只不过把数据库换成了向量库,把业务接口换成了大模型。日常讨论最多的不是调 Prompt,而是模型超时怎么办、Tool 调用失败怎么办、Memory 越来越长怎么办、Token 成本怎么控。所以后端工程能力,反而是转行者最大的优势。小红书
另一面:市场没有课程账号说的那么热
如果上面是"面试怎么考你",还有一组信号值得校准预期。
最近知乎、小红书上流传着不少培训机构味很浓的数字:大模型人才缺口 400 万、2026 年相关岗位招聘量同比增长 57%、一线城市 1-3 年经验的应用开发月薪 18K-35K。知乎但对照一位 985 硕士的秋招日记,画面完全不同:他投了拼多多提前批、百度、华为、快手,发现百度今年后端开发岗有 130 多个,大模型研发只有 30 多个——岗位本身就少,对项目经历和背景的要求自然更高。小红书他还发现,同一个"AI 应用研发"的岗位名,不同团队的理解天差地别:有的面试还是问 Java、数据库、Redis,有的才深聊模型、RAG、Prompt。另一个细节是,AI Infra 岗位比纯 Agent 应用开发岗更多,而且算法背景的同学也在投这类岗位,竞争一点不小。
更要留意的是内容本身的水分。那条 189 赞的"字节上岸"帖,评论区几乎清一色"已guan"——用谐音规避平台审核的"已关注"。楼主自己在评论区留言:已经学完转行上岸、现在大厂年薪 40 万左右,“如果有人须要的话我發你哈”。小红书这不代表正文经验是假的,但这个内容池里,真实复盘和卖课引流混在一起的浓度很高。"400 万人才缺口"这种数字,先看清是谁说的、说给谁听,再决定信不信。
那到底该做什么
三条帖子给出的路线,其实出奇地一致。
第一,给简历做减法。别再堆框架名词,把一个项目拆成四条链讲透:知识库怎么清洗切分、工具失败怎么重试、多轮上下文怎么管、Token 成本怎么降。能把这四问答清楚,已经跑赢大多数候选人。
第二,先手写一个最小的 Agent 循环,再回头看 LangChain 是怎么封装的。照教程跑通 Demo 很容易,一出问题不知道错在哪,就是因为没自己从零走过一圈。小红书
第三,新框架值得玩,不值得焦虑。DeepSeek 在 8 月 13 日深夜开源了 Harness,一个"一切皆插件"的 Agent 运行时,三天时间 GitHub star 数就冲过 12 万,B 站、知乎的教程和拆解已经刷屏。知乎

它火的原因,恰恰和这场面试讨论是一件事:竞争正在从"谁的模型聪明"转向"谁把模型周围的工程做得扎实"。Harness 的核心设计就是分层组合——dsh-base、dsh-web-app、dsh-headless 一层层叠插件包,每一层都能覆盖上一层的结果,模型适配器、工具注册表、沙箱审批全都是可插拔的。知乎想理解"Agent 的工程化到底在化什么",把它当一个活教材拆一遍,比多背两个框架名词有用。

还有一个数据值得记一下:有调研报告指出,头部编程 Agent 之间能力只差 1 分、成本却能差 32 倍;2026 年已有 35% 的企业在生产环境部署 AI Agent,而 2024 年这个数字不到 5%。知乎行业正从"能搭 Demo"走向"稳定、便宜地用",再叠加 DeepSeek 最近预告 API 涨价。哔哩哔哩成本与工程类问题在面试里只会越问越细。
最后放一份自检清单。如果你在准备 Agent 开发面试,先回答这五个问题:
你的项目里最惨的一个 Bad Case 是什么?怎么发现的,怎么修的?
工具调用失败时,你的兜底链路具体长什么样?
你的 Token 成本上限在哪,做过什么优化?
这个场景为什么必须用 Agent,规则引擎差在哪?
线上出过什么事故,你是怎么定位的?
有一问答不上来,投简历之前,先把一个项目重新做透——这恰恰是面试官、上岸者、还有那 6 个"半吊子"候选人,共同验证过的那件事。