当前位置:
AIGC文章详情

智谱GLM-5.3-max闯入全球榜前13,753B参数追平Kimi K3开源第一

源自342位全网作者

08-24 20:01

内容由AI生成

精选参考来源

1. DeepSeek V4 Pro暴涨近50分,我却更想押GLM-5.3

2. 这张图表来自国际AI评测机构 Artificial Analysis,展示的是其“AA智能指数”对全球主流大语言模型的综合能力排名。图中红框标注的两款模型——Kimi K3 (max) 与 GLM-5.3 (max),均获得60分,并列开源模型第一,同时跻身全球前沿模型能力区间,与Claude Fable 5、GPT-5.6 Sol等闭源旗舰模型处于同一水平。

3. 智谱的GLM-5.3终于也在AA竞技场开分,暑期档的这一轮国产模型上新基本上算是告一段落了,目前的成绩如下:Kimi K3和GLM-5.3并列60分,是中国唯二能过挤进T1阵营里的模型,咬住了GPT-5.6和Claude Opus 5,当然Kimi K3是已经发布超过1个月了,含金量更高。T2档位排下来依次是58分的Qwen3.8 Max、53分的DeepSeek-V4-Pro、52分的Qwen3.8 27B,也是兼顾性能与经济性的高竞争区间,凡尔登绞肉机的市场。T3则属于上桌吃饭的底线,有45分的MiniMax-M3、43分的小米MiMo-V2.5-Pro、42分的腾讯Hy3,主打一个量大管饱的供应,够用就行,要啥自行车呢。再往下数,T4就很深海了,蚂蚁Ling 3.0 Flash是38分,美团LongCat 2.0是34分,阶跃Step 3.7 Flash是31分,已经不太适用通用场景了,只能卖给垂直领域。什么,你问22分的百度文心模型是不是位于马里亚纳海沟?好吧,我稍微说句公道话,自从文心5.0拉了这坨大的之后,百度就没有再把新发布的文心5.1上传AA竞技场了,所以22分虽然不是百度的真实表现,但一个小版本的迭代估摸着也好不到哪里去。对了,字节也没有在AA竞技场上传Seed参展,就憋大的吧。

4. Arena(arena.ai)平台发布 2026 年第 33 周(8 月 10 日 ~8 月 16 日)AI 大模型盲测排名,本期最大看点是 Anthropic 多款 claude-opus-4 系列模型密集入榜并占据综合榜前五位,国产模型 kimi-k3-max 排名上升 2 位至综合榜第 12 位,在前端开发榜也保持第 2 位,qwen3.8-max 首次跻身智能体榜 Top 10。国产模型整体仍处于中上游位置,在前端开发等细分领域已经形成对头部海外模型的紧追态势。IT之家注:本榜单基于 Arena(arena.ai)平台匿名盲测投票,通过 ELO(智能体榜为百分比信号)计算排名,反映用户主观偏好而非绝对能力测试;不同分榜相互独立,不宜跨榜比较,分差在误差范围内均视为并列,新模型也需积累一定投票量后才会正式入榜。综合榜本期综合榜头部几乎被 Anthropic 新模型包揽,claude-fable-5 以 1506 分蝉联榜首,新入榜的 claude-opus-4-6-high 以 1505 分紧随其后位列第二,同样新入榜的 claude-opus-4-7-high 以 1502 分排名第三。前三名分数差距均在 5 分以内,属于误差范围内的并列。谷歌 gemini-3.7-flash-high 作为新模型首次入榜即拿到第 9 名,表现亮眼。国产模型方面,kimi-k3-max 上升 2 位至第 12 名,是排名最高的国产模型。国产模型整体处于榜单中上游,具体排名如下:月之暗面 kimi-k3-max 位列第 12 名,ELO 1489 分,较上周上升 2 位;阿里 qwen3.8-max 位列第 8 名,ELO 1491 分,较上周下降 2 位;阿里 qwen3.7-max-preview 位列第 26 名,ELO 1474 分,较上周下降 3 位。#桃黑黑回应控诉#

5. 彭博刚刚把美中人工智能差距做成了一张图表,嗯,是的,美国正在被碾压:> Kimi K3 接近 Fable 的水平> 每任务成本便宜约 70%> Anthropic 认为中国落后 6–12 个月> 中国现在拥有前沿实验室集群> GLM-5.3 甚至还没包括在内,这将有利于中国一方美国实验室仍然占据前沿位置,但中国正让它们无法收取前沿价格。

6. 牛来进军 AI 行业了。。。牛来 SOTA AI !!!Ox Alpha(OpenRouter 上的模型 ID 为 stealth/ox-alpha,也有 OpenCode 上的免费版)。上线时间:大约2026年8月20日深夜(北京时间21日凌晨)以“隐身模型”(stealth model)身份低调出现在 OpenRouter 等平台。主要规格:约100万 token 上下文窗口最大输出约13万 token支持文本 + 图片 + 视频多模态输入支持工具调用目前限时免费(约一周,到8月27日左右),调用额度很宽松(平台宣称日处理量可达100T token级别)性能表现(初步测试):Ox Alpha 通过率约 80%Claude Fable 5 Max 约 65%GPT-5.6 Sol Max 约 52%其他如 GLM-5.3、Grok 4.6 也在60%左右这让它在编程/Agent编码能力上引发大量关注,看起来逼近甚至局部超过当前头部模型。但注意:测试样本量较小(10道题左右),后续有人复测结果有波动。身份猜测:目前没有官方认领,完全匿名。社区通过“指纹分析”(比如视频token消耗模式、错误提示语言、审查口径等)做了大量对比:最主流猜测:智谱(Zhipu AI)尚未正式发布的 GLM-5.3 相关版本(可能是 Flash 版或带多模态的视觉版),证据匹配度较高。

7. Vercel它是一个类似于网站部署的公司,会给很多小型网站提供免费的部署方案。我也有好几个网站部署在上面,非常好用。他们其实也很多地用到大模型。根据他们最近披露的一个数据,其大模型的使用从以前闭源模型占主导,到现在开源模型占主导,这个改变的进程其实非常短。因为随着技术进步的速度放缓,闭源模型的最强者已经不再是遥遥领先,而只是在某些部分领先。比如说 Anthropic 的 Claude Fable 5 这个模型,在前三四个月可能还是断崖式领先;但最近一两个月中国模型相继发布,比如智谱的 GLM 5.3、Kimi K3 模型,以及 DeepSeek 的 V4 Pro 等,都会或多或少挑战到 Fable 的绝对领先地位。同时,开源模型最大的优势就是便宜,意味着只要有自己的设备,就可以自己去部署运行。这也是为什么 Hugging Face 提到,公司使用的开源模型比例已经从之前的 28.4% 涨到现在的 62%,而闭源模型则从之前的 76% 相当于减半到现在的 38%。我觉得这可以说是攻守之势异也。

8. GLM 5.3 位列全球AI大模型综合盲测榜单第12 第34周全球AI大模型综合盲测榜更新,Claude Fable 5稳居第一,Opus 4.6和4.7包揽二三。Muse Spark 1.2第四,Kimi K3第八,GLM 5.3第十二,千问3.8 Max第十四,4款中国模型进入前25。 Arena Text 榜单主要评估大模型在文本对话与文本生成任务中的综合能力,覆盖数学、代码、创意写作、指令遵循、多轮对话、开放问答等场景。它采用真实用户盲测投票机制,让用户在不知道模型身份的情况下比较回答质量。目前该榜单显示约 700多万票、近400多个模型,适合观察全球大模型综合能力、排名变化和头部格局演进。

9. 智谱GLM-5.3 API上线,定价与GLM-5.2保持一致

10. 智谱 GLM-5.3 发布,国产开源模型又进一步

11. GLM-5.3 来了,编程能力提升 50%,两周发现 2404 个漏洞。

12. 智谱GLM-5.3 API上线,模型权重8月25日开源

13. GLM-5.3正式发布,国产模型后训练之王出现

14. 智谱发布GLM-5.3,内部代码测试成绩提升50%

15. 刚刚更新!智谱GLM-5.3杀疯了,国产代码AI新霸主来了

16. 智谱 GLM-5.3 测评

17. GLM-5.3 跑分暴涨背后:后训练胜利还是蒸馏嫌疑

18. 国家队下场:超算互联网上线智谱 GLM-5.3——算力自主可控,全球 AI 竞争进入新阶段

19. 横评GLM-5.3、DeepSeek-v4-pro、K3,谁才是Coding新王? - 哔哩哔哩

20. 里昂:智谱GLM-5.3后训练能力显著提升,维持“跑赢大市”评级

21. 更强的GLM-5.3,为什么没有刷屏?

22. GLM 5.3 API 价格与接口详解:max 规格比默认档贵出 35 倍

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章