GLM-5.3追平Kimi K3:翻遍全网实测,我发现差距不在跑分

源自123位全网作者

12:42

国产AI这周过了个大年。

8月17日,DeepSeek V4 Pro与V4 Flash新版定价正式生效,核心规格涨幅远超市场预期。微博新价目表还玩起了"峰谷电价":空闲时段价格仅为高峰一半,缓存命中的输入价格涨幅高达1100%,峰时输出最高27元/百万token。微博而就在几天前,智谱发布的GLM-5.3在8月19日的Artificial Analysis竞技场开分:智能指数60分,与Kimi K3并列开源第一,API价格却一分没涨。微博

一时间"Kimi王座不保"的说法刷屏。Kimi K3七月爆火,一个月后真被追上了?该换吗?该续费吗?我翻遍微博、知乎、B站、小红书本周的讨论和实测,给你一个相对清楚的答案。

一、先搞清楚:"追平"追的是什么

这个60分来自Artificial Analysis(AA)智能指数。但榜单本身就充满争议:知乎高赞回答直接说AA"没有任何含金量"。知乎B站的测评视频分成两派:一边惊叹GLM-5.3的测试分数"是怎么翻6倍的",一边测完六项能力后坚持K3"目前仍旧未被超越"。微博B站

榜单的名次波动也很大。就在几天前K3还是57分,一半的价格追平第一梯队。小红书这次榜单更新后,因为Claude Opus 5和GPT-5.6的几个推理档位集中上榜,K3名次一度被挤到第7——分数没变,排位先变。所以看跑分,先看口径,再看名次。

GLM-5.3追平Kimi K3:翻遍全网实测,我发现差距不在跑分

再看规格:Kimi K3总参数2.8T,支持1M上下文。知乎GLM-5.3的基座并没有变,和GLM-5.2共用同一个底子,所有提升都来自后训练。微博火力集中在终端和CLI Agent场景:Terminal-Bench 3.0从4.6飙到28.3,DeepSWE v1.1从46.2涨到66.9。微博换句话说,GLM的"追平"是特定方向的追平——快、Agent,而不是全面替代。跑分追平,也不等于体验追平。

二、Kimi真正的领先在哪

①Repo级重活。DeepSWE上K3得67.5,仍然领先GLM-5.3的66.9;K3的前端编程在Arena盲测里拿第一(Elo 1679)。知乎

知乎的长文实测对比里,租户隔离这类横切需求K3改得更全,GLM大规模重构时反而容易"手痒",顺手扩大修改范围。知乎小红书上那篇《用 kimi K3 做个小产品,一周用户数破万》几千赞,作者用K3搓出的"云吸Y"小程序已经跑出了真实用户量。小红书

GLM-5.3追平Kimi K3:翻遍全网实测,我发现差距不在跑分

②长文与研究。1M上下文不是摆设,B站《用Kimi-k3从0到1完成一篇万字论文初稿(真实文献+真实数据)》这类教程最近扎堆。B站知乎高赞的评价很直白:对于专业知识、规范、文献,“kimi完全碾压其他”。知乎

③开源生态和编程订阅的性价比。K3全量权重已经开放,是当前最大的开源模型。微博编程订阅这边,Kimi for Coding入门档49元/月、主力档199元/月,GLM Coding对应档位是118元和538元——Kimi 199元档大约只是GLM Pro价格的37%。知乎

三、被追上的地方也是真的

①速度。有用户用真实客户业务实测Kimi K3的API:输出速度约29-37 t/s,首字2.6-3.9秒。小红书

GLM-5.3追平Kimi K3:翻遍全网实测,我发现差距不在跑分

而GLM-5.3延续了GLM-5.2的高吞吐底子(5.2实测超过110 tokens/s)。知乎知乎上不少人吐槽K3"思考半天,回答速度太慢",急性子体感会很明显。知乎

②单次成本。B站有UP主用WorkBuddy实测同一个问题:DeepSeek V4 Pro扣0.16积分(约0.3分钱),K3扣1.62积分(约2.8分钱),差10倍,最便宜和最贵的模型单次成本能差27倍。B站

③稳定性与额度。知乎已经出现"为什么感觉Kimi又有点要爆了(?"这样的提问。知乎B站有测评者称,Kimi的订阅近期似乎出现了缩减额度的现象。B站小红书也有用户专门发帖,吐槽最近用Kimi K3的体验。小红书官方未证实这些说法,建议先买一个月观察,别一次充一年。

DeepSeek V4 Pro值得单独说:编程测评给出的结论是"灰度战神终于落地,憾负Kimi K3",是API性价比黑马,但要注意峰谷定价,缓存命中的输入价格现在不便宜。B站

四、场景化结论,对号入座

GLM-5.3追平Kimi K3:翻遍全网实测,我发现差距不在跑分

  • 论文、文献、长文写作:选Kimi K3;

  • 大存量项目、Repo级修改、前端:选Kimi K3(199元档,可先开49元档试一周);

  • 终端、CLI Agent类任务:GLM-5.3现在更强;

  • 日常快问快答、小脚本:GLM-5.3或DeepSeek Flash,快且便宜;

  • 重度API编程、想省钱:DeepSeek V4 Pro,配合峰谷时段用。

组合原则一句话:重活给Kimi,轻活给别人。K3一次到位率高、返工少,算总账往往不亏。

五、两个值得盯的信号

一是下周五(8月28日),GLM-5.3按计划开放MIT许可权重,到时候开源生态的对比会更有看头。微博微博二是Kimi官方对额度与稳定性传闻的回应。

跑分能追平,场景不会说谎。这一轮的答案不是换或留,而是谁干什么活。

内容由AI生成

精选参考来源

1. 几个月前,大家还叫DeepSeek创始人梁文锋“梁圣”,后来变成“梁叔”,现在成了“梁子”…

2. 国产大模型"卷"出生态位:GLM-5.3 一分不涨上线、千问三线出击、DeepSeek 玩…

3. 智谱的GLM-5.3终于也在AA竞技场开分,暑期档的这一轮国产模型上新基本上算是告一段落了…

4. 怎么看GLM5.3ArtificialAnalysis追平KimiK3?

5. 不儿? GLM-5.3的测试分数是怎么翻6倍的?有一说一这个分数飞升有点猛了, 按我对 T…

6. Kimi K3:一个月过去,依旧国模内领先?AI 六项能力测试

7. AI榜单更新:Kimi K3掉到第7

8. GLM Coding(GLM 5.3)与 Kimi K3 的能力、价格与实战性价比全对比

9. 智谱 AI(Z.ai)今天发布了 GLM-5.3,和 GLM-5.2 共用同一个基座模型,…

10. 用 kimi K3 做个小产品,一周用户数破万🎉

11. 用Kimi-k3从0到1完成一篇万字论文初稿(真实文献+真实数据)

12. kimi算不算国内顶级的AI?

13. Kimi K3 API 客户真实调用实测

14. 豆包、deepseek、kimi、千问、元宝这些AI工具,你更喜欢哪一款?

15. 🔥【你的积分被谁吃了?WorkBuddy 11款模型锐评,差价27倍的真相来了】

16. 为什么感觉Kimi又有点要爆了(?

17. 吐槽一下最近用Kimi K3的体验

18. 灰度战神终于落地,憾负Kimi K3 | DeepSeek V4 Pro 0813 全面测…

19. GLM-5.3,前沿编程与安全能力涌现今天,我们发布 GLM-5.3。基座模型与 GLM-…

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章