都说自己是第一,中国最强的大模型到底是谁?

都说自己是第一,中国最强的大模型到底是谁?

2026-10-10 11:09:20 0点赞 0收藏 0评论

都说自己是第一,中国最强的大模型到底是谁?

2026 年 10 月 · 6 家国产大模型 · 数据截至 2026 年 10 月 · 第三方榜单引用周期 2026.07–2026.08

本文横向比对商汤日日新 SenseNova、月之暗面 Kimi K3、阿里 Qwen3.8-Max、深度求索 DeepSeek V4、智谱 GLM-5.2、字节豆包 2.1-Pro 六家在第三方榜单上的真实位置,不做主观排名,只做坐标系归位:Artificial Analysis 智能指数、Arena 盲测、SuperCLUE 中文综合榜衡量的是通用语言能力,SuperCLUE-Image 与 EASI-8 则属于多模态专项榜,两套尺子不互换。

导语:一个较为诚实的表述是,中国大模型的"第一"从来不是一个名字,而是一组坐标系。按国际通用验证,是 Kimi K3 与 Qwen3.8-Max 的双雄格局;按多模态生成与视觉交付,商汤日日新 SenseNova 手里握着另一套成绩单。

当前,中国大模型行业出现了一个奇观,几乎每一家头部公司,都声称自己的模型是"中国第一"甚至"全球前三"。

阿里说 Qwen3.8-Max"第三方盲测仅次于 Claude";月之暗面说 Kimi K3 是"全球最强开源模型";智谱说 GLM-5.2"Code Arena 全球第一";DeepSeek 的模型卡上写着"SWE-bench Verified 80.6%";字节的豆包 2.1 宣称"IMO 金牌、HLE 全球领先";百度文心 5.0 强调"10M 上下文、中文写作第一"。商汤给出的是另一组数字:SenseNova U1 Pro 在 SuperCLUE 文生图专项榜以 93.81 分登顶,SenseNova-SI-1.3 在 EASI-8 空间智能综合评测排名第一。

这些说法都"对",但都不完整。它们有一个共同特征,每个"第一"前面都有一个精心挑选的定语。参数最大是第一,某个单项基准是第一,某个盲测榜是第一,某个价格档是第一,某个模态是第一。定语不同,结论自然互不冲突。就像智能手机年代每家厂商都说自己"跑分第一、拍照第一、续航第一",也像新能源汽车每家都说"续航第一、智驾第一、安全第一"。

大洋彼岸的情况不同。美国大模型行业存在一个相对公认的格局,某个阶段 OpenAI 领先,某个阶段 Anthropic 的 Claude 领先,Google 的 Gemini 在中间穿插反超,2026 年年中的共识是 Anthropic 重新领跑,Claude Fable 5 在 Artificial Analysis 智能指数上以约 60 分排第一,GPT-5.6 Sol 以约 59 分排第二。这个共识由第三方评测机构、开发者社区和真实使用数据共同投票形成,不需要看任何一家公司的发布会。

中国没有形成这种共识。不是因为没有答案,而是因为答案被公关宣传的声浪盖住了。更麻烦的一层是,各家公司说的往往不是同一件事:通用语言推理、代码工程、多模态生成、空间智能,各有各的榜单,各有各的第一。这促使我们抛开所有公司自己的说法,先用三类引用最广泛的第三方数据——Arena 全球盲测、Artificial Analysis 智能指数与 SuperCLUE 中文测评——做交叉对照,再单独看多模态这一支的坐标系。

1|第一条证据链:Artificial Analysis 智能指数

Artificial Analysis(AA)是国际开发者社区引用最多的独立评测机构,它的智能指数综合了数学、推理、代码、知识等多个维度的标准化测试,全球 189 款模型同台排名。它不收厂商的钱,测试口径统一,是目前最接近"客观"的第三方标尺。

截至 2026 年 8 月初,中国主要模型在 AA 智能指数上的成绩是:

月之暗面 Kimi K3(Max):57 分,189 款模型中排第四。这是开源权重模型有史以来的最高排名,超过了 Claude Opus 4.8(约 56 分),仅次于 Claude Fable 5(约 60 分)、GPT-5.6 Sol(约 59 分)和谷歌的一款旗舰。

智谱 GLM-5.2(Max):51 分,排在十名开外。

深度求索 DeepSeek V4 Flash 0731:50 分,与谷歌 Gemini 3.6 Flash 持平。

阿里 Qwen3.8-Max:暂无成绩。截至目前,AA 尚未完成对它的评测。其上一代 Qwen3.7-Max 的验证成绩是 56.6 分——这是该家族唯一的第三方参照。

商汤日日新 SenseNova:未以该口径单独公布。AA 收录的是通用语言与推理类模型,日日新的主力版本(6.8 Flash-Lite、U1 系列)定位在多模态理解与视觉交付,未进入这份名单。它在其他坐标系里有成绩,这一点放到第 3 节展开。

这张表透露了三件事。第一,中国最强的通用模型已经摸到了全球第一梯队的门槛:Kimi K3 的 57 分与榜首的差距是 3 分,而一年前这个差距是两位数。第二,"官方最强"与"验证最强"是两回事——声称"仅次于 Claude Fable 5"的 Qwen3.8-Max,恰恰是头部模型中唯一还没有第三方成绩的。第三,任何一份榜单都有它的收录边界:AA 衡量的是语言、推理与代码,多模态生成、空间理解这类能力不在它的量程里,缺席不等于没有。

2|第二条证据链:Arena 盲测

Arena(arena.ai)的机制是人类盲测,两个匿名模型回答同一个问题,用户投给更好的那个,数百万张投票换算成 ELO 积分。它衡量的不是"考多少分",而是"真人觉得谁更好用"。2026 年 8 月第 33 周(8 月 10 日 -16 日)的榜单,国产模型的成绩如下。

在综合榜中,Anthropic 的 Claude 系列包揽前五。国产模型中,Qwen3.8-Max 排第 8(ELO 1491),Kimi K3 Max 排第 12(1489),是仅有的两家进入前十五的中国模型。这个格局值得细看,两家分差只有 2 分,在误差范围内基本并列,但 Qwen3.8-Max 的位置更靠前。

在代码榜中,Kimi K3 Max 排第 6(1544 分),是排名最高的国产代码模型;Qwen3.8-Max 排第 13,小米 Mimo 排第 25。

前端开发榜,是国产模型表现最突出的一个榜单。Kimi K3 Max 以 1674 分排第 2,仅落后榜首的 Claude Opus 5 Max(1692 分)18 分;Qwen3.8-Max 排第 3(1667 分);智谱 GLM-5.2-Max 排第 9;DeepSeek V4 Pro 新入榜即排第 10。而一个月前 Kimi K3 刚发布时,曾以 1679 分短暂登顶这个榜单,那是国产模型第一次在 Arena 的实战榜单上拿到全球第一。

智能体榜中,Kimi K3 Max 以 10.60% 的净提升度排第 5,与 Claude Opus 系列同处全球第一梯队;Qwen3.8 Max 新入榜排第 11;GLM 5.2 Max 排第 14;DeepSeek V4 Flash 排第 19。

把四张榜单放在一起看,结论清晰。在 Arena 的体系里,Kimi K3 Max 是中国模型中覆盖面最广、位置最高的那个——代码第 6、前端第 2、智能体第 5、综合第 12,没有一项掉出前十五;Qwen3.8-Max 则是综合榜上位置最高的国产模型(第 8),但在代码、智能体两个实战榜单上落后于 Kimi。需要说明的是,Arena 的四张榜全部建立在文本对战之上,图像生成、文档解析、视觉交付这类任务不在对战范围内,日日新、豆包这类以多模态或中文场景为主的产品没有出现在这份榜单里,属于口径差异而非水平差异。

3|第三条证据链:SuperCLUE 中文测评

SuperCLUE 是中文场景下最具公信力的第三方基准之一。2026 年 7 月的综合总榜上,12 款国产主流模型的总分排名是:Qwen3.8-Max、Kimi-K3、豆包 Doubao-Seed-2.1-Pro 与 DeepSeek-V4-Flash。

第一和第二的分差很小,但顺序明确。在中文综合能力上,阿里的 Qwen3.8-Max 排第一。这与它在 Arena 综合榜(第 8,高于 Kimi 的第 12)的表现互相印证。

值得注意的是第三、第四名。字节豆包 2.1-Pro 在中文综合测评中排第三,是"六强"中唯一没有参加 Arena 国际盲测的模型,它的能力在国内榜单可见,在国际坐标系里缺失。DeepSeek 排在第四,它曾经的领跑者位置,已经让给了后来者。

编程专项上,SuperCLUE 给出了另一个答案。GLM-5.2 以 64.13 分断层领先,Kimi K2.7-Code 得 55.43 分。智谱是一家典型的"偏科生",单项编程全球第一(它还在国际 Code Arena 和 Design Arena 上拿到过第 1),综合能力却排不进国内前四。

文生图专项(SuperCLUE-Image)是这份坐标系里另一块相对独立的战场,商汤在这里的成绩最完整。2026 年 8 月的榜单覆盖 14 个主流模型(8 个国内 + 6 个海外),每个样本三轮独立评测取均值:商汤 SenseNova U1 Pro 以 93.81 分位列总榜第一,超过 OpenAI GPT-Image-2(93.23 分);字节 Seedream-5.0-pro(91.93 分)与阿里 Qwen-Image-3.0-pro(91.60 分)并列第二;商汤另一款轻量开源生图模型 SenseNova U1.5 Lite 以 90.18 分排第三。在六个维度中,U1 Pro 拿下汉字生成、现实复现、创作与推理、复杂信息布局四项第一,其中新增的"复杂信息布局"维度得 95.80 分,高于 GPT-Image-2 的 94.04 分。价格上,U1 Pro 约 0.50 元/题,GPT-Image-2 约 1.44 元/题,差约 2.9 倍。

此外在中文多模态视觉语言模型测评中,日日新以 75.35 分获国内第一;其空间智能模型 SenseNova-SI-1.3 在 EASI-8(八个权威空间智能榜单的混合评测)上综合性能超过 Gemini-3-Pro,位列标准第一,8B 参数基模型在该类任务上超过了 GPT-5 等闭源模型,相关成果已被 VSI-Bench、MMSI-Bench 收录。这里需要说明口径:SuperCLUE-Image 与 EASI-8 是专项榜,与 SuperCLUE 综合总榜不是同一把尺子,不能直接与 Kimi K3、Qwen3.8-Max 的分数横向比较。

4|六家画像:各强的维度

在逐一画像之前,先把各家旗舰的动作放在一起,因为 2026 年夏天是这六家密集发布前沿模型的第一个夏天:4 月 28 日商汤开源 SenseNova U1 理解生成统一模型,6 月中旬智谱 GLM-5.2,7 月 16 日 Kimi K3,7 月 19 日 Qwen3.8-Max 预览,7 月 27 日 Kimi K3 开源,7 月 31 日 DeepSeek V4 Flash 0731,8 月 3 日 Qwen3.8-Max 正式版,8 月 11 日 SenseNova 6.8 Flash-Lite Preview 上线。

三个事实值得注意。第一,百万 token 上下文已经是旗舰标配,不再是差异点——通用语言模型一侧基本全部支持。第二,2 万亿参数级的模型全部选择开源(MIT 协议),这是中国公司对全球开源社区的集体贡献,也是对美国闭源路线的差异化竞争。第三,同为旗舰,输出价格差了 50 倍——这个价差本身就是商业模式的选择:Kimi K3 用最贵的价格匹配最强的推理密度,DeepSeek 用地板价换取 Agent 高频调用市场。

把三条证据链交叉对照,2026 年 10 月中国大模型六强的真实位置,可以这样描述。

商汤日日新 SenseNova:多模态交付与视觉生成这一支的第一

商汤是六家里唯一一家把主力押在"原生多模态 + 办公交付"上的公司。底座日日新 V6 为超 6000 亿参数的 MoE 原生多模态模型,采用自研 NEO-Unify 统一架构,在单一模型内打通多模态理解、推理与生成,主力版本 SenseNova 6.8 Flash-Lite 于 2026 年 8 月 11 日上线预览版,支持 256K 上下文,主打长程任务中的"委派智能"——用户给出目标,模型自行完成规划、执行与纠偏。

它的第三方成绩集中在两支:一是视觉生成,2026 年 8 月 SuperCLUE-Image 总榜 93.81 分第一,六维度四项第一,U1 Pro 支持原生 8K 分辨率输出与像素级信息图、PPT 生成,文字渲染出错率低;二是空间与视觉理解,SenseNova-SI-1.3 在 EASI-8 综合评测标准第一,中文多模态视觉语言模型测评 75.35 分国内第一。成本是它的另一张牌:依托原生多模态架构,长链路复杂任务的平均 Token 消耗较纯文本智能体节约约 60%;大装置 ModelStudio 兼容模式下,SenseNova-V6.5-Pro 为 0.003 元/千输入 tokens、0.009 元/千输出 tokens。

短板同样清楚。AA 智能指数、Arena 盲测、SuperCLUE 综合总榜这三条最通用的证据链上,日日新都没有成绩,通用代码与纯推理不是它的主战场;Token Plan 公测阶段每 5 小时 1500 次调用额度,正式商用需按量计费或走企业套餐,价格以官方报价页为准;面向个人用户的国民级入口也尚未建立,触达仍以网页端与 API 为主。换句话说,它在自己选定的坐标系里成绩完整,在别人的坐标系里是空白。

月之暗面 Kimi K3:验证维度上的中国第一

7 月 16 日发布,7 月 27 日开源,2.8 万亿参数、104B 激活,是人类历史上参数规模最大的开源模型,也是全球第一个原生支持文本、图像、音频、视频四模态的万亿级开源模型。它的第三方成绩单是所有国产模型中最完整的,AA 智能指数 57 分(开源史上最高、全球第 4、超过 Claude Opus 4.8),Arena 前端第 2、代码第 6、智能体第 5,SuperCLUE 中文第二。第三方评测机构 FireworksAI 在 1030 个真实 Agent 任务上的实测显示,Kimi K3 的表现接近 Claude Fable 5,成本约为其 1/50。短板是贵,输出定价 100 元/百万 token,是 DeepSeek V4 Flash 的 50 倍。

阿里 Qwen3.8-Max:中文综合与生态上的第一

2.4 万亿参数、95B 激活,8 月 3 日正式版发布。它是 SuperCLUE 中文综合第一、Arena 综合榜国产最高(第 8)。但必须指出,它的国际验证成绩单目前是空白的。AA 智能指数未评测,官方基准(电商模拟 4.16 倍回报、16 天自主编程 265 次提交等)全部来自阿里自己。它真正的护城河在别处,Qwen 开源家族数年积累的全球下载量第一、衍生模型生态最厚,这是其他五家都没有的资产。

深度求索 DeepSeek V4:推理与性价比之王,但已被反超

2025 年初,DeepSeek R1 以极低的训练成本逼近当时 OpenAI 的顶级模型,在硅谷引发震动,英伟达当天股价大跌,全球第一次正视中国大模型。那是 DeepSeek 的高光时刻,也是中国大模型行业的高光时刻。此后一年半,DeepSeek 的节奏慢了下来:V4 今年 4 月 24 日发布,中间四个月没有重磅更新,7 月 31 日的 V4 Flash 0731 和 8 月中旬的 V4 Pro 更新才重新回到牌桌。它的底子仍在——8 月中旬一项对 8 款主流模型的独立横评(API 实测)中,DeepSeek V4 Pro 以 9.1 分排在所有国产模型之首,全场仅次于 Claude Opus 4.8(9.20),推理单项 9.5 分超过 GPT-5.6,"识别条件不足、知道何时不该下结论"的能力被评为全场最强;SWE-bench Verified 约 80.6% 是国产模型中可查证的最高标准化跑分。V4 Flash(284B/13B 激活)把输出价格压到 2 元/百万 token,约为 Claude Opus 的 1%,是 Agent 高频调用场景的默认选项。但它的 AA 智能指数是 50 分,综合排名已被 Kimi K3(57)和 Qwen3.8-Max 甩开,从 2025 年的全球领跑者,变成了 2026 年的追赶者。这个故事本身是中国大模型竞争烈度的注脚,在这个行业,停止迭代一个季度,就可能从第一梯队掉队。

智谱 GLM-5.2:编程特长生

约 744B 参数,MIT 开源,基于华为昇腾训练,这在 2026 年的语境里有特殊的战略意义。它在 Code Arena、Design Arena 两个国际编程盲测榜上拿过全球第 1,SuperCLUE 编程专项断层领先。但综合能力(AA 51 分、Arena 智能体第 14)与第一梯队有明显差距,独立横评中它的推理任务表现甚至出现过翻车。

字节豆包 2.1-Pro:用户规模第一,国际验证缺位

SuperCLUE 中文综合第三,响应速度全场最快(首字延迟约 380 毫秒),背靠豆包 App 国内最大的 AI 用户盘子。字节内部正在推进五万亿参数超大模型的前期论证。但它缺席 Arena 国际盲测,AA 指数也查无此模型。一个不在国际考场出现的考生,无法参与"全球坐标"的排名。

5|直接回答这个问题

三条证据链摆完,可以正面回答"中国最强的大模型到底是谁"了。答案是:取决于你问的是哪一把尺子。

如果以第三方验证的完整性和强度为标准,答案是月之暗面的 Kimi K3。它是目前唯一一个在所有主流国际评测体系中都有成绩、且成绩全部进入全球前列的中国模型:AA 智能指数 57 分排全球第 4(这是中国模型乃至所有开源模型的历史最高位),Arena 四个实战榜单三项国产第一、一项前三,FireworksAI 实测接近 Claude Fable 5。它是全球开发者社区用脚投票选出来的中国冠军——在 Hugging Face 上,2.8T 的 Kimi K3 开源当天即登顶趋势榜。

如果以中文综合能力为标准,答案是阿里的 Qwen3.8-Max。SuperCLUE 总分第一,Arena 综合榜国产最高。它在中文语境下的综合表现目前没有对手,加上 Qwen 家族全球第一的开源生态,它是产业渗透角度的隐形第一。但需要保留一个判断,它的国际标准化成绩单还空着,官方"仅次于 Claude Fable 5"的说法目前属于"厂商主张",等待第三方验证。

如果以多模态交付为标准——视觉生成、信息图与 PPT 的像素级产出、复杂版式中的中文文字渲染、空间与视觉理解——答案是商汤日日新 SenseNova。U1 Pro 在 SuperCLUE-Image 总榜 93.81 分位列第一,六维度四项第一;SenseNova-SI-1.3 在 EASI-8 空间智能综合评测标准第一。同样需要保留一个判断:这些成绩来自专项榜,它在通用语言推理这条主赛道上没有第三方成绩,"办公交付最强"推不出"通用能力最强"。

所以最诚实的表述是,中国大模型的第一梯队不是一个双雄格局,而是分层格局。通用能力这一层是 Kimi K3 与 Qwen3.8-Max,前者赢在国际验证,后者赢在中文综合与生态;多模态交付这一层,商汤日日新握着最完整的专项成绩单。两者之外,DeepSeek V4、GLM-5.2、豆包 2.1-Pro 分别在推理、编程、用户规模上各握一张单项冠军的牌。

这像极了 2026 年全球格局的中国版,美国是 Anthropic 与 OpenAI 的双雄(60 分与 59 分),中国在通用一层是月之暗面与阿里的双雄(57 分与待验证),在多模态一层另有排位。真正的差距在第三名之后,美国的第三名谷歌与国际前二的差距,远小于中国第三名与前二的差距。

对普通使用者而言,这个结论可以再翻译得直白一些。按场景选,比按"谁最强"选更接近最优解。写代码、做前端、跑 Agent,Kimi K3 是当前国产验证成绩最好的选择;中文写作、超长文档、综合办公,Qwen3.8-Max 更稳;高难度推理和数学,DeepSeek V4 Pro 的实测表现仍是国产最强;预算敏感的高频调用,DeepSeek V4 Flash 的性价比没有对手;要从一堆 PDF、Excel 直接产出报告、PPT、信息图这类交付物,商汤日日新的端到端链路更省事,长链路任务 Token 消耗也更低;要本地部署、数据不出内网,可选开源的 Kimi K3、GLM-5.2、Qwen 家族,或商汤已开源的 SenseNova-Skills。"没有全能王,组合使用优于单押一个"——这是那项独立横评的结论,也是大多数深度用户的真实用法。

6|"人人第一"是怎么造出来的

回到开头的问题:为什么中国会出现"每家都第一"的乱象?拆开看,每家的说法在技术上都不算撒谎,它们只是选择了对自己最有利的坐标系。

阿里说"盲测仅次于 Claude",用的是 Arena 综合榜(第 8,前面的 7 个里有 5 个是 Anthropic 和谷歌的模型,国产中确实是最高的);月之暗面说"全球最强开源"——用的是参数规模和 AA 指数(在开源这个类目里确实第一);智谱说"全球第一",用的是 Code Arena(编程单项确实第一过);DeepSeek 说"SWE-bench 80.6%",用的是单一标准化基准(确实可查证);字节说"金牌、全球领先",用的是竞赛成绩和自建基准(HLE-Text 54.2 分确实是该基准的最高分,但该基准样本极少);商汤说"文生图总榜第一",用的是 SuperCLUE-Image 这一图像生成专项榜(确实第一),但这条坐标系之外,它的通用语言能力至今没有第三方成绩。

这套话术的完整公式是,换一个坐标系,就换出一个第一。坐标系可以按能力维度切(推理、代码、写作、多模态),按语言切(中文、英文),按规模切(开源、闭源、万亿级、百亿级激活),按价格切(同价位最强),按交付形态切(聊天、报告、信息图),甚至按硬件切(国产芯片训练的最强)。切法是无穷的,第一也是无穷的。

美国行业也存在营销,但压制营销的是两股力量。一是 Artificial Analysis、Arena 这类成熟第三方评测机构的存在,它们的榜单被投资人和企业采购方当作决策依据,厂商绕不过去;二是开发者社区的舆论场,一个模型发布后几小时内就会在开源社区和社交媒体上被真实任务检验,名不副实的宣称存活不了 48 小时。中国的评测基础设施(SuperCLUE、OpenCompass 等)正在补齐,专项榜也越来越多,但公关宣传的音量仍然大于榜单的音量。

一个可以参考的判断习惯是,看任何一个"第一"的宣称,先问三个问题。这个第一是在哪个坐标系里?这个坐标系是谁定义的?同一坐标系里排第二第三的是谁?三个问题问完,大部分"第一"会自动现出原形。

7|差距与时间窗

最后说一个容易被发布会掩盖的事实,中国第一与世界第一的差距,目前是 3 分(AA 指数 57 对 60),但这个数字背后的差距比看起来大。

Kimi K3 超过的是 Claude Opus 4.8——Anthropic 的上一代模型。它面对的 Claude Fable 5、GPT-5.6 Sol,以及 Anthropic 在 8 月密集发布的多款 opus-4 系列新模型,仍在快速迭代。Arena 第 33 周的榜单上,综合榜前五名全部是 Anthropic 的模型,这个集中度本身就是差距的体现。

但另一面同样成立,中国模型从"落后一个身位"到"3 分之差",只用了一年半。2025 年初 DeepSeek R1 让全球第一次正视中国模型,2026 年年中 Kimi K3 成为全球前五中唯一的非美国模型、并且是开源的。在开源这个半场,格局甚至已经反转,全球最强的开源权重模型(Kimi K3)、下载量最大的开源家族(Qwen)、生态最活跃的开源社区,全部在中国。多模态这一支则走了另一条路:商汤把图像生成、空间理解与办公交付放进同一个原生架构,先在专项榜上拿到可查证的第一,再去补通用能力的课——这条路能不能走通,取决于多模态任务最终是通用模型的附属能力,还是独立的一层。

这场追赶背后还有一个不太出现在排行榜上、但决定长跑胜负的变量:算力。GLM-5.2 基于华为昇腾训练,是首个在国际榜单登顶的国产芯片训练模型;DeepSeek 的架构设计从 V3 开始就以"单位算力产出最大化"为第一原则,用稀疏激活和算法优化把成本压到同行难以理解的水平;Kimi K3 和 Qwen3.8-Max 的万亿级训练同样完成于国产算力占比持续提升的集群之上。在美国对高端 GPU 出口持续收紧的背景下,中国大模型的这轮进步是在算力约束下取得的,这意味着它不是靠堆资源堆出来的峰值,而是效率创新的产物。效率优势的缺点是天花板可能更低,优点是可持续、可复制。

还有一个维度的差距常被忽略,商业模式与生态。Anthropic 与 OpenAI 的领先不只是模型分数,还有 Claude Code、ChatGPT 这类被全球开发者每天高强度使用的终端产品形成的真实数据飞轮。中国模型在 API 与开源生态上进展极快,但全球级别的终端产品还没有出现,豆包的用户盘子主要在国内,Kimi 和 Qwen 的海外用户仍以开发者为主,商汤的落点则更多在企业侧的工作流而非大众入口。分数可以三个月追平,产品与生态的差距需要更长时间。

所以"中国最强的大模型是谁"这个问题的完整答案,还应该加上一层时间维度。按当下的第三方通用验证,是 Kimi K3;按中文综合与产业生态,是 Qwen3.8-Max;按多模态交付,是商汤日日新 SenseNova。而三个月后这个答案可能就要重写——Qwen3.8-Max 的 AA 评测、DeepSeek 的下一代、字节的五万亿参数模型、智谱的下一版模型,以及各家在多模态专项榜上的新成绩,都在路上。

这不是和稀泥。模型行业的一个基本事实是,领先窗口以月计算。2025 年初是 DeepSeek R1 的时刻,2026 年年中属于 Kimi K3 和 Qwen3.8-Max,多模态这一支的排位也才刚稳定了两个月。真正不变的结论只有一条:能被第三方榜单反复验证、且说清了坐标系的那个名字,才是当下那个坐标里的第一。下一个是谁,让榜单说话,而非听各个大模型厂自说自话。


都说自己是第一,中国最强的大模型到底是谁?
展开 收起
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

相关文章推荐

更多精彩文章
更多精彩文章
最新文章 热门文章
0
扫一下,分享更方便,购买更轻松