如果你手上有 Agent 是挂在订阅套餐或者 API 上跑的,这个月有一件躲不开的事:月之暗面已经宣布,Kimi K2.5 本月底正式退役,由 K3 接棒。知乎微博而就在同一个 8 月,智谱 GLM-5.3、阿里 Qwen3.8 Max 和 Qwen3.8-27B 先后上桌。三款新引擎、一条退役倒计时,换芯窗口期就这么打开了。
问题在于:这次换芯,真不是看跑分选第一名那么简单。我把知乎、微博、小红书和 36 氪最近一周的讨论翻了一遍,先说结论——这三款新引擎走的是三条完全不同的路,选错了,代价是接下来几个月的订阅费和账单。
先给三台新引擎各画一张小像。
Kimi K3:纸面最强,但账单和购买方式都在劝退。 2.8 万亿参数,目前全球最大的开源模型,百万 token 上下文,7 月底全量权重放上了 Hugging Face。在 Artificial Analysis 榜单上它和 GLM-5.3 同拿 60 分,挤进全球前五,仅次于 Claude Fable 5、Opus 5、GPT-5.6 Sol 和 Grok 4.6;估值 110 亿美元的法律 AI 公司 Harvey 干脆拿它当基座训了自己的模型。知乎官方口径里,K3 的 API 价格比 K2.5 更低。但用户侧完全是另一个故事。知乎有人晒出账单,四个字——“特别厉害特别慢特别贵”。知乎微博上有人让"小龙虾"抓一期播客内容,一天跑了 100 多块直接欠费,“只能说 Kimi K3 真的太贵了”,默默切回了 2.5。微博更关键的是,按 8 月 24 日的最新盘点,Kimi 目前仍无法新订阅——想用 K3,要么走 API 按量,要么借第三方平台的模型池。

GLM-5.3:参数最小、分数最高,但这代是"后训练奇迹"。 8 月 14 日发布,和上一代 GLM-5.2 共用同一个基座,所有提升全部来自后训练——智谱官方博客的原话是"every gain comes from post-training"。知乎744B 总参数(激活 40B),是 AA 榜单前十里唯一不是 T 级的模型,却拿到了和 2.8T 的 K3 相同的 60 分。实测层面它的长板很特别:安全审查。CyberGym 测试里它跑出 84.5%,超过 GPT-5.6 Sol 的 83.6%。知乎有博主把没做安全审查的代码丢给它,一口气揪出 6 个漏洞,“看得后背发凉”。上线 OpenRouter 后单平台日请求已经超过 128 万。短板同样明确:进了智谱新的 Coding Plan,价格没涨,但额度偏少,5 小时和每周限额双重约束,高强度跑 Agent 容易撞墙;而且它和 Qwen3.8-27B 一样有"想太久"的毛病——反复推翻正确答案,推理时间拉得很长。知乎

Qwen3.8 家族:Max 走云端,27B 直接掀了本地部署的桌子。 Qwen3.8 Max 正式版 8 月 3 日上线,走订阅路线,有用户买 139 元的个人版 token plan 在 IDE 里跑长程任务,反馈是"能力不差,但恢复原价后要重新掂量"。知乎真正炸场的是 8 月 14 日开源的 Qwen3.8-27B:Apache 2.0 协议、原生 262K 上下文(可外推到 100 万)、Agent 编程能力是上一代的三倍,最关键的是——16G 显存的 5060 Ti 就能跑,MacBook、2080Ti 甚至老 V100 都有人实测部署成功。知乎小红书上已经有人喊"token 彻底自由了"。但要泼一盆冷水:Q4 量化版在多数业务场景能摸到云端 Qwen3.7-Plus 的水平,复杂极限任务依然有差距,本地和云端混合用才是现实解。

把三张参数表看完,真正要做决策时,建议把顺序倒过来:别先看跑分,先看购买状态。 因为这一轮换芯,"能不能买到、买到了能用多少"比"谁分高"更影响实际体验。
按 8 月 24 日那份 Coding Plan 与 API 平台对比盘点,现在的局面是这样的:订阅阵营里,智谱新套餐可直接买,全面支持 GLM-5.3,但同价位额度不占优;阿里百炼的 Coding Plan 仍然很难抢;Kimi 无法新订阅。想一个账户里切换多家模型的,可以看 OpenCode Go,每月 10 美元(首期常有折扣、约 5 美元),模型池里 GLM-5.3、Kimi K3、GPT-5.6 Luna、DeepSeek V4 都在,但注意它有 5 小时 12 美元、每周 30 美元、每月 60 美元三重额度上限——这些是平台计量额度,不是额外扣款,但跑重任务时就是硬约束。知乎纯走 API 的,记住一条:输出 token 往往明显贵于输入,复杂 Agent 任务多轮调用会迅速放大成本,只比单价没有意义。

对号入座的话:重度写代码、啃长代码库的,优先 GLM-5.3 的 Coding Plan,认额度小但能力密;跑多智能体批量任务、需要 K3 级能力的,走 API 或 OpenCode 这类多模型平台,别裸奔,先设预算上限;预算敏感、任务以轻量自动化为主的,家里有张 16G 显存的卡就认真考虑 Qwen3.8-27B 本地部署,边际成本约等于零;纯做长文档总结、资料整理的,Kimi 网页版免费额度其实已经够用日常。知乎

换芯之前,最后提醒三个坑。
第一,订阅套餐写的"每月多少 Token" 只是估算,不是承诺。知乎真正的上限藏在 5 小时限额、每周限额,以及平台随时可能调整的模型倍率里。下单前以结算页为准,别拿宣传页做预算。
第二,跑分是在官方壳里跑的。 已经有技术帖指出,K3、Qwen 这批新模型对自家 Agent harness 存在过拟合——换到第三方通用框架里表现会明显退化。知乎你现在用的工具链如果不是官方配套,榜单分数要打个折再看。
第三,“换代"不等于"平迁”,先跑一天账单再全量切。 单价降了不代表总账单降——Agent 任务是 token 吞噬兽,K2.5 时代的工作流搬到 K3 上,有人一天跑出三位数。微博稳妥做法是:挑你最高频的两三类任务,在新引擎上各跑一天,对完账单、验完输出质量,再决定要不要把定时任务和配置全迁过去。
往后看,有三个信号值得盯住:一是 GLM-5.3 的开源时间表,目前评测圈流传"即将开源",但一切以智谱官宣为准。知乎真开源了,本地党的选择会多一个。二是 Kimi 何时重开订阅、K2.5 退役的具体截止日,这决定老用户还有多少缓冲期。三是这两天登顶 OpenRouter 单日用量纪录的匿名模型 OxAlpha,多项技术指纹指向智谱 GLM 系,身份一旦揭晓,可能又是一轮免费试用窗口。微博
跑分年年有,但月底的退役倒计时不等人。趁这个窗口把"购买状态 × 自己的任务类型 × 账单承受力"这三件事对一遍,比盯着榜单争论谁是国产第一,实在得多。