这周做 Agent 的人,大概率都在纠结。
一边是好消息连环炸:Kimi K3 开源了 2.8 万亿参数的权重,号称"全球首个开放 3T 级模型";Qwen3.8-Max 9 月 2 日更新 0902 版本,当天就把 CodeArena 前端编程榜的第一抢了过来;GLM-5.3-Flash 更是直接喊出对标 Claude 四十分之一的价格。知乎微博
另一边,信息有点复杂:刚发布的 Claude Fable 5.1,官方口径是输入输出单价不变、缓存命中价格砍掉 75%,智能体类任务总成本最多能降 45%;但有开发者实测,max 推理模式的单任务成本比上一代贵了 20%,总成本最多能贵出 56%——账算出来是涨是跌,取决于你跑哪一档;还有更肉疼的——有开发者高强度用 Kimi K3 写代码,一天就烧掉了一周的 coding plan 额度。36氪微博
换强的,额度爆炸;换便宜的,关键任务掉链子。这周 Agent 开发者的问题根本不是"换哪家",而是"谁当大脑,谁当手"。
先看这周发生了什么
把时间线捋一遍:
8 月底之前,DeepSeek 宣布涨价,国家超算互联网跟着大幅涨价,逼着一批"便宜档"用户开始找下家;
8 月底,Kimi K3 开源,总参数 2.8T、激活 104B,原生多模态 Agentic 架构,权重直接挂上 HuggingFace;
9 月 1 日,Anthropic 发布 Fable 5.1(公开版)和 Mythos 5.1(可信访问版),同一个模型、两档安全护栏;
9 月 2 日,阿里更新 Qwen3.8-Max-0902,在 CodeArena 的 WebDev 专项榜上以 1691 分登顶。
再看一组在开发者群里被反复转发的真实价格对照:
模型 | 参考价 |
|---|---|
Claude Opus 5(Max) | 约 $20 / 百万 tokens |
Kimi K3(Max) | 约 $12 / 百万 tokens |
Qwen3.8-Max | 约 $5 / 百万 tokens |
GLM-5.3-Flash | 约为 Claude 对标价的 1/40 |
Kimi API 国内公开价 | 输入 ¥20 / 输出 ¥100 / 缓存命中 ¥2(每百万 tokens) |

光看单价,很容易得出"换最便宜的"这个结论。但社区里有两个真实案例,恰好把这个结论按在地上摩擦。
两个案例,一个矛盾
有开发者做了一个复杂的网络连接故障排查:DeepSeek V4 Flash 和 GLM-5.3-Flash 跑了很多轮猜想验证,都没找到真正原因,最后换成"贵"的 Kimi K3,花 3 块钱把问题定位了。他总结得很直白:“低端任务看不出区别,关键任务显差异”。微博
另一头,开发者"骞先生"因为 K3 实在好用——性能和 Claude Fable 5、GPT-5.6 SOL 同一档——放开手脚全天高强度用,结果一天烧掉 7 天的额度,"做二休五"等着周限额重置。知乎
两个案例放一起,真正的问题浮出水面:Agent 场景的成本结构,和聊天完全不同。聊天是一问一答,一次消耗一次的钱;跑 Agent 是"工具调用次数 × 循环轮数 × 每轮上下文"的乘法。如果让旗舰模型包办每一次 grep 检索、每一次读文件,那最贵的 token 其实都花在了没技术含量的"体力活"上。

社区的降本实践,指向同一件事:分工
骞先生后来的优化值得拆开看——同一份套餐,从"做二休五"变成能撑一整周的开发量。知乎核心不是换便宜模型,而是给 Agent 工作流里不同的岗位配不同的模型:
大脑用旗舰:负责架构规划的 Plan 智能体用 K3,思考强度开到 max;
眼睛用便宜档:代码扫描、资料检索这类活,丢给独立的 Explore 子智能体,接便宜且上下文长的 flash 档模型;
手用中档:照规划写代码的 executor 智能体,不做决策只管执行,不需要最贵的脑子。
这个分工像带团队:不用人人都是顶级工程师,但架构师必须够强。文章里还有几个可以直接抄的工程细节:K3 的 256K 上下文版本(k3-256k)额度消耗只有 1M 版的一半;reasoning_effort 从 max 降到 high 能省一大截——注意切换思考强度会让上下文缓存失效,官方建议切换前先新开会话。知乎固定不变的系统提示词放在消息最前面,缓存命中后读取价大约只有输入价的 1/10。知乎

分工之外还有两个红利:Claude 系的 Batch API 打五折,日志分析、数据清洗这种"能等"的离线任务走批处理等于白捡;Fable 5.1 发布后缓存命中价降到 $0.25/百万 tokens,约等于输入价的 1/40,重缓存的 Agent 场景红利更大。36氪另外有模型通道从业者估算,把路由规则配好、让绝大多数简单请求下沉到便宜档,总成本还能再降 40%–60%。知乎
分人群算账
轻度用户:别急着充订阅。 最优解是"便宜档打底 + 关键节点临时调旗舰":日常用 Qwen3.8-Max($5/MToken 档)或 GLM 的 Flash 档,遇到疑难调试现场买少量 K3 或 Opus 的 API,一次关键节点几块钱。前面那个 3 块钱破案的故事,就是模板。
Coding 订阅用户:以 Kimi 199 元档(Allegretto)为例。 有人拿实测数据算过账:按最保守口径,199 元每月至少对应 ¥814 的 API 等价用量,4.1 倍回本打底,实际只会更高。知乎但注意两个坑:月限额名义是 25 个"满额 5 小时块",因为周限额按滚动 7 天计算,稳态上限其实约 21.5 块,月底别冲太猛,否则续费后头几天会被限速;另外 Kimi Work 和 Kimi Code 额度互不影响,但 Work 侧消耗是 5 倍,建议控制在总用量 15% 以内。
API 走量用户:先别换模型,先做"路由 + 缓存 + 批处理"三件套。 这波新品不会自动帮你省账单,只是把单价天花板降了,结构才决定你实际付多少。
盯着 K3 开源权重的企业用户:别急着喊"开源=免费"。 K3 的 License 有条边界:达到一定收入规模的 MaaS 服务商,商用前要和月之暗面单独签协议。知乎另外 2.8T 权重的自部署门槛,和个人开发者没什么关系——开源对你最大的意义,是给 API 定价施加压力,而不是买台服务器自己跑。
三个值得继续盯的信号
第一,Kimi 一边推进 IPO,一边和微软、亚马逊、谷歌谈托管分成协议(最高要 30%)。微博商业化节奏在动,K3 系列的定价策略可能跟着变,这周算的账别当长期合同。
第二,谷歌 Gemini 3.8 Flash(代号 Skimaki)据说最快本周上线,主打编程能力升级。知乎编程模型的价格战可能还要再打一轮,骨干模型"换血"会变成常态。与其每次追新,不如先把"模型可插拔"的分工结构搭好。
第三,单周榜单别当信仰。K3 登顶的热度还没过,同一天就被 Qwen3.8-Max-0902 反超。有人统计 8 月大模型日均发布 1.1 个。微博榜单只是暂时的快照,"便宜档打底 + 旗舰攻坚"的结构,才是能穿越模型轮换的东西。

一句话总结:这波骨干模型换血值得关注,但不值得 all in 换血。钱花在"大脑"上,"手"永远有更划算的选择。