当前位置:
AIGC文章详情

Kimi K2.5月底退役,GLM-5.3与Qwen3.8同月接棒:你的Agent换引擎,先看能不能买到再看跑分

源自286位全网作者

15:54

如果你手上有 Agent 是挂在订阅套餐或者 API 上跑的,这个月有一件躲不开的事:月之暗面已经宣布,Kimi K2.5 本月底正式退役,由 K3 接棒。知乎微博而就在同一个 8 月,智谱 GLM-5.3、阿里 Qwen3.8 Max 和 Qwen3.8-27B 先后上桌。三款新引擎、一条退役倒计时,换芯窗口期就这么打开了

问题在于:这次换芯,真不是看跑分选第一名那么简单。我把知乎、微博、小红书和 36 氪最近一周的讨论翻了一遍,先说结论——这三款新引擎走的是三条完全不同的路,选错了,代价是接下来几个月的订阅费和账单。

先给三台新引擎各画一张小像。

Kimi K3:纸面最强,但账单和购买方式都在劝退。 2.8 万亿参数,目前全球最大的开源模型,百万 token 上下文,7 月底全量权重放上了 Hugging Face。在 Artificial Analysis 榜单上它和 GLM-5.3 同拿 60 分,挤进全球前五,仅次于 Claude Fable 5、Opus 5、GPT-5.6 Sol 和 Grok 4.6;估值 110 亿美元的法律 AI 公司 Harvey 干脆拿它当基座训了自己的模型。知乎官方口径里,K3 的 API 价格比 K2.5 更低。但用户侧完全是另一个故事。知乎有人晒出账单,四个字——“特别厉害特别慢特别贵”。知乎微博上有人让"小龙虾"抓一期播客内容,一天跑了 100 多块直接欠费,“只能说 Kimi K3 真的太贵了”,默默切回了 2.5。微博更关键的是,按 8 月 24 日的最新盘点,Kimi 目前仍无法新订阅——想用 K3,要么走 API 按量,要么借第三方平台的模型池。

Kimi K2.5月底退役,GLM-5.3与Qwen3.8同月接棒:你的Agent换引擎,先看能不能买到再看跑分

GLM-5.3:参数最小、分数最高,但这代是"后训练奇迹"。 8 月 14 日发布,和上一代 GLM-5.2 共用同一个基座,所有提升全部来自后训练——智谱官方博客的原话是"every gain comes from post-training"。知乎744B 总参数(激活 40B),是 AA 榜单前十里唯一不是 T 级的模型,却拿到了和 2.8T 的 K3 相同的 60 分。实测层面它的长板很特别:安全审查。CyberGym 测试里它跑出 84.5%,超过 GPT-5.6 Sol 的 83.6%。知乎有博主把没做安全审查的代码丢给它,一口气揪出 6 个漏洞,“看得后背发凉”。上线 OpenRouter 后单平台日请求已经超过 128 万。短板同样明确:进了智谱新的 Coding Plan,价格没涨,但额度偏少,5 小时和每周限额双重约束,高强度跑 Agent 容易撞墙;而且它和 Qwen3.8-27B 一样有"想太久"的毛病——反复推翻正确答案,推理时间拉得很长。知乎

Kimi K2.5月底退役,GLM-5.3与Qwen3.8同月接棒:你的Agent换引擎,先看能不能买到再看跑分

Qwen3.8 家族:Max 走云端,27B 直接掀了本地部署的桌子。 Qwen3.8 Max 正式版 8 月 3 日上线,走订阅路线,有用户买 139 元的个人版 token plan 在 IDE 里跑长程任务,反馈是"能力不差,但恢复原价后要重新掂量"。知乎真正炸场的是 8 月 14 日开源的 Qwen3.8-27B:Apache 2.0 协议、原生 262K 上下文(可外推到 100 万)、Agent 编程能力是上一代的三倍,最关键的是——16G 显存的 5060 Ti 就能跑,MacBook、2080Ti 甚至老 V100 都有人实测部署成功。知乎小红书上已经有人喊"token 彻底自由了"。但要泼一盆冷水:Q4 量化版在多数业务场景能摸到云端 Qwen3.7-Plus 的水平,复杂极限任务依然有差距,本地和云端混合用才是现实解。

Kimi K2.5月底退役,GLM-5.3与Qwen3.8同月接棒:你的Agent换引擎,先看能不能买到再看跑分

把三张参数表看完,真正要做决策时,建议把顺序倒过来:别先看跑分,先看购买状态。 因为这一轮换芯,"能不能买到、买到了能用多少"比"谁分高"更影响实际体验。

按 8 月 24 日那份 Coding Plan 与 API 平台对比盘点,现在的局面是这样的:订阅阵营里,智谱新套餐可直接买,全面支持 GLM-5.3,但同价位额度不占优;阿里百炼的 Coding Plan 仍然很难抢;Kimi 无法新订阅。想一个账户里切换多家模型的,可以看 OpenCode Go,每月 10 美元(首期常有折扣、约 5 美元),模型池里 GLM-5.3、Kimi K3、GPT-5.6 Luna、DeepSeek V4 都在,但注意它有 5 小时 12 美元、每周 30 美元、每月 60 美元三重额度上限——这些是平台计量额度,不是额外扣款,但跑重任务时就是硬约束。知乎纯走 API 的,记住一条:输出 token 往往明显贵于输入,复杂 Agent 任务多轮调用会迅速放大成本,只比单价没有意义。

Kimi K2.5月底退役,GLM-5.3与Qwen3.8同月接棒:你的Agent换引擎,先看能不能买到再看跑分

对号入座的话:重度写代码、啃长代码库的,优先 GLM-5.3 的 Coding Plan,认额度小但能力密;跑多智能体批量任务、需要 K3 级能力的,走 API 或 OpenCode 这类多模型平台,别裸奔,先设预算上限;预算敏感、任务以轻量自动化为主的,家里有张 16G 显存的卡就认真考虑 Qwen3.8-27B 本地部署,边际成本约等于零;纯做长文档总结、资料整理的,Kimi 网页版免费额度其实已经够用日常。知乎

Kimi K2.5月底退役,GLM-5.3与Qwen3.8同月接棒:你的Agent换引擎,先看能不能买到再看跑分

换芯之前,最后提醒三个坑。

第一,订阅套餐写的"每月多少 Token" 只是估算,不是承诺。知乎真正的上限藏在 5 小时限额、每周限额,以及平台随时可能调整的模型倍率里。下单前以结算页为准,别拿宣传页做预算。

第二,跑分是在官方壳里跑的。 已经有技术帖指出,K3、Qwen 这批新模型对自家 Agent harness 存在过拟合——换到第三方通用框架里表现会明显退化。知乎你现在用的工具链如果不是官方配套,榜单分数要打个折再看。

第三,“换代"不等于"平迁”,先跑一天账单再全量切。 单价降了不代表总账单降——Agent 任务是 token 吞噬兽,K2.5 时代的工作流搬到 K3 上,有人一天跑出三位数。微博稳妥做法是:挑你最高频的两三类任务,在新引擎上各跑一天,对完账单、验完输出质量,再决定要不要把定时任务和配置全迁过去。

往后看,有三个信号值得盯住:一是 GLM-5.3 的开源时间表,目前评测圈流传"即将开源",但一切以智谱官宣为准。知乎真开源了,本地党的选择会多一个。二是 Kimi 何时重开订阅、K2.5 退役的具体截止日,这决定老用户还有多少缓冲期。三是这两天登顶 OpenRouter 单日用量纪录的匿名模型 OxAlpha,多项技术指纹指向智谱 GLM 系,身份一旦揭晓,可能又是一轮免费试用窗口。微博

跑分年年有,但月底的退役倒计时不等人。趁这个窗口把"购买状态 × 自己的任务类型 × 账单承受力"这三件事对一遍,比盯着榜单争论谁是国产第一,实在得多。

内容由AI生成

精选参考来源

1. Kimi K2.5月底退役,K3接班!5个实操案例看完直接用

2. 8月24日科技圈发生了什么?🔥小米18Fold预约开启,玄戒O3跑分522万,9月上市📱vivoX500系列官宣9月发,全球首发蔡司超动态主摄🤖KimiK2.5月底退役,2.8万亿参数K3开源接棒⚡神秘大模型OxAlpha登顶OpenRouter单日用量纪录🎬阿里Wan3.0上线,支持doc/xls/ppt直接生成30秒视频📉...全文

3. 用了一周后,来深入聊聊GLM-5.3

4. Kimi K3 的实际表现真有被吹捧的那么强吗?

5. GLM-5.3深度评测:不换基座涨50%,智谱这步棋到底值不值?

6. 为什么Qwen3.8-27B和GLM-5.3都要想那么久?

7. 16G显存跑出旗舰级:把Qwen3.8-27B搬回家,5060Ti本地部署实战

8. 如何评价8月3日上线的阿里Qwen3.8Max正式版?相比其他模型表现如何?

9. 2026年8月24日 AI Coding Plan 与 API 平台对比:智谱 GLM-5.3、MiniMax、DeepSeek 视觉版和 OpenCode 调整后怎么选

10. 因为让它去抓SamAltman的播客访谈内容,今天小龙虾一天跑了100多块,直接欠费关心了一下账单,发现使用量稍微大一点就是100块起步,还是在非heavyuser很多复杂任务没走小龙虾的前提下…只能说KimiK3真的太贵了。。默默切换回2.5了…论好用程度还是要属ChatGpt!Harness做的好,生图写代码抓...全文

11. 聊聊模型过拟合自家Agent-harness:KimiK3、Qwen、快手、以及DeepSeek的报告的问题及解法

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章