当前位置:
AIGC文章详情

被追平、被反超、疑似下一代已在蹲点:K3 发布满月,Kimi 用户要不要换?

源自134位全网作者

12:23

这周 AI 圈发生的事,对用了一个月 K3 的 Kimi 用户来说,可能有点坐不住。

一周之内,三个开源旗舰扎堆上线,全都喊"最强开源":DeepSeek V4-Pro 正式版、GLM-5.3 开放 API,还有 DeepSeek V4 的多模态。哔哩哔哩而 7 月中旬发布后一直风头无两的 Kimi K3,突然被三面围堵:

  • 知乎博主"硅基碎念"整理的 Artificial Analysis 评测数据显示,GLM-5.3 的智能指数拿到 60 分,直接追平 Kimi K3,两家并列开源权重模型第一,距离 GPT-5.6 Sol 只差 1 分。知乎

  • 社区最认的编程榜单 Code Arena 上,K3 从 7 月中旬官宣的第一,掉到了目前的第 2。小红书小红书

  • 更有意思的是,Code Arena 上冒出一个匿名新模型 korrine。K3 发布前曾用匿名代号 kivine 测试,所以社区普遍猜测 korrine 就是下一代 Kimi(甚至被直接叫成 K3.1)——但官方什么都没确认。

被追平、被反超、疑似下一代已在蹲点:K3 发布满月,Kimi 用户要不要换?

"要不要换"这两天在 Kimi 用户圈里吵得热闹。先别急着下结论,我把全网翻了一遍,给你三条社区实测信息,你自己掂量。

一、分数追平,不等于你该换:跑分和真实体验的差距比想象大

B 站 UP 主"费曼学AI"做了个实验:同一平台、4 轮 40 多道客观题、累计 100 多次真实 API 调用,第一轮测出来"三家全不及格",复盘才发现是 max_tokens 给不够、题面有歧义,冤枉了模型。哔哩哔哩这提醒我们:单轮跑分,真不能太当真。

被追平、被反超、疑似下一代已在蹲点:K3 发布满月,Kimi 用户要不要换?

看真实项目更有参考价值。一位开发者拿一个 6 文件、约 2800 行的 Node.js 老项目重构任务,把 kimi-k3、gpt-5.6-luna、claude-sonnet-5 各跑了 10 轮:

  • tool_use 调用成功率:K3 拿到 9/10,和 Claude 打平。知乎

  • 多文件重构一次性通过率:K3 是 6/10,Claude 是 8/10,差距明显;

  • 跨文件上下文保持:K3 有 8/10;

  • 按一天 20 次同类任务估算月成本:K3 约 385 元,Claude 约 770 元。

他最后的用法很有代表性:日常以 K3 为主,遇到复杂重构再切 Claude。知乎

二、K3 现在的真实位置:攻坚武器,不是日用口粮

知乎另一位用户干脆搭了套"多模型套利工作流":GLM-5.3 吃闲时折扣,DeepSeek 吃 0.3 元/M 的缓存价,K3 只在两个模型都搞不定时出场熔断攻坚——他的原话是,“目前买不到套餐,充值了一点api价格,但是真贵呀,舍不得用”。知乎微博上也有用户用了几天 K3 后转投 DeepSeek V4 Flash,理由就一个字:便宜。微博

被追平、被反超、疑似下一代已在蹲点:K3 发布满月,Kimi 用户要不要换?

但反过来,K3 强势的场景门槛还在。前端编程、终端开发、智能体搜索、超长任务这几个高频场景,是社区讨论里 K3 被夸得最多的地方。微博法律文书、论文写作、长文分析上,小红书那篇"K3 法律应用能力几乎断层领先"的帖子拿到了近 3000 赞、200 多条评论。小红书对这部分用户来说,这周的分数变化基本不影响使用。

三、传闻中的 K3.1:不值得押注,但值得盯

korrine 没有任何官方确认,没有发布日期,连"9 月发布"都没有官方依据,目前只能说"K3.1 是社区最热的猜测"。小红书但从 4 月 K2.6 在 Artificial Analysis 排第五,到 7 月 K3 冲上 Code Arena 第一,月之暗面的迭代速度是实打实的。小红书如果你是那种"想等下一代再充值"的人,这次等等并不丢人。

被追平、被反超、疑似下一代已在蹲点:K3 发布满月,Kimi 用户要不要换?

结论:三类人,三种动作

  1. 已经在用 K3 API 或 KimiCode 写代码的:不用慌着换。日常高频小任务可以分流给更便宜的模型(这已经是社区公开操作),多文件攻坚和长上下文任务留给 K3——这是目前被验证过性价比最高的用法。<#&!53#&!>知乎

  2. 观望要不要给 Kimi 付费的:这周先别急。三个信号值得盯:① korrine 在 Code Arena 的实际排名走势,如果真是 K3.1,它的分数会说明一切;② GLM-5.3 权重已官宣将按 MIT 许可开源,届时本地部署和衍生玩法会多一波;③ Kimi 官方会不会跟进套餐或调价——K3 发布后"API 贵"的抱怨一直没停,官方未必坐得住。知乎小红书

  3. 非编程用户(论文、法律、PPT、长文档):照常用。这轮被追平的主要是编程和智能体方向的分数,和你的场景关系不大。

最后说一句:这轮"开源三巨头"的混战才刚开始,一周内三家全发布、全喊最强,但社区实测已经说清楚了——没有一个模型能在所有场景通吃。与其押注一家,不如学学上面那位套利老哥:谁的场景强,就用谁。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章