这周 AI 圈发生的事,对用了一个月 K3 的 Kimi 用户来说,可能有点坐不住。
一周之内,三个开源旗舰扎堆上线,全都喊"最强开源":DeepSeek V4-Pro 正式版、GLM-5.3 开放 API,还有 DeepSeek V4 的多模态。哔哩哔哩而 7 月中旬发布后一直风头无两的 Kimi K3,突然被三面围堵:
知乎博主"硅基碎念"整理的 Artificial Analysis 评测数据显示,GLM-5.3 的智能指数拿到 60 分,直接追平 Kimi K3,两家并列开源权重模型第一,距离 GPT-5.6 Sol 只差 1 分。知乎
社区最认的编程榜单 Code Arena 上,K3 从 7 月中旬官宣的第一,掉到了目前的第 2。小红书小红书
更有意思的是,Code Arena 上冒出一个匿名新模型 korrine。K3 发布前曾用匿名代号 kivine 测试,所以社区普遍猜测 korrine 就是下一代 Kimi(甚至被直接叫成 K3.1)——但官方什么都没确认。

"要不要换"这两天在 Kimi 用户圈里吵得热闹。先别急着下结论,我把全网翻了一遍,给你三条社区实测信息,你自己掂量。
一、分数追平,不等于你该换:跑分和真实体验的差距比想象大
B 站 UP 主"费曼学AI"做了个实验:同一平台、4 轮 40 多道客观题、累计 100 多次真实 API 调用,第一轮测出来"三家全不及格",复盘才发现是 max_tokens 给不够、题面有歧义,冤枉了模型。哔哩哔哩这提醒我们:单轮跑分,真不能太当真。

看真实项目更有参考价值。一位开发者拿一个 6 文件、约 2800 行的 Node.js 老项目重构任务,把 kimi-k3、gpt-5.6-luna、claude-sonnet-5 各跑了 10 轮:
tool_use 调用成功率:K3 拿到 9/10,和 Claude 打平。知乎
多文件重构一次性通过率:K3 是 6/10,Claude 是 8/10,差距明显;
跨文件上下文保持:K3 有 8/10;
按一天 20 次同类任务估算月成本:K3 约 385 元,Claude 约 770 元。
他最后的用法很有代表性:日常以 K3 为主,遇到复杂重构再切 Claude。知乎
二、K3 现在的真实位置:攻坚武器,不是日用口粮
知乎另一位用户干脆搭了套"多模型套利工作流":GLM-5.3 吃闲时折扣,DeepSeek 吃 0.3 元/M 的缓存价,K3 只在两个模型都搞不定时出场熔断攻坚——他的原话是,“目前买不到套餐,充值了一点api价格,但是真贵呀,舍不得用”。知乎微博上也有用户用了几天 K3 后转投 DeepSeek V4 Flash,理由就一个字:便宜。微博

但反过来,K3 强势的场景门槛还在。前端编程、终端开发、智能体搜索、超长任务这几个高频场景,是社区讨论里 K3 被夸得最多的地方。微博法律文书、论文写作、长文分析上,小红书那篇"K3 法律应用能力几乎断层领先"的帖子拿到了近 3000 赞、200 多条评论。小红书对这部分用户来说,这周的分数变化基本不影响使用。
三、传闻中的 K3.1:不值得押注,但值得盯
korrine 没有任何官方确认,没有发布日期,连"9 月发布"都没有官方依据,目前只能说"K3.1 是社区最热的猜测"。小红书但从 4 月 K2.6 在 Artificial Analysis 排第五,到 7 月 K3 冲上 Code Arena 第一,月之暗面的迭代速度是实打实的。小红书如果你是那种"想等下一代再充值"的人,这次等等并不丢人。

结论:三类人,三种动作
已经在用 K3 API 或 KimiCode 写代码的:不用慌着换。日常高频小任务可以分流给更便宜的模型(这已经是社区公开操作),多文件攻坚和长上下文任务留给 K3——这是目前被验证过性价比最高的用法。<#&!53#&!>知乎
观望要不要给 Kimi 付费的:这周先别急。三个信号值得盯:① korrine 在 Code Arena 的实际排名走势,如果真是 K3.1,它的分数会说明一切;② GLM-5.3 权重已官宣将按 MIT 许可开源,届时本地部署和衍生玩法会多一波;③ Kimi 官方会不会跟进套餐或调价——K3 发布后"API 贵"的抱怨一直没停,官方未必坐得住。知乎小红书
非编程用户(论文、法律、PPT、长文档):照常用。这轮被追平的主要是编程和智能体方向的分数,和你的场景关系不大。
最后说一句:这轮"开源三巨头"的混战才刚开始,一周内三家全发布、全喊最强,但社区实测已经说清楚了——没有一个模型能在所有场景通吃。与其押注一家,不如学学上面那位套利老哥:谁的场景强,就用谁。