张大妈

2025 AI 大模型年终盘点:谷歌反超,国产爆发,三大榜单一文看懂!

源自知乎:AI信息Gap

01-27 12:16

基于LMArena、LiveBench和Artificial Analysis三大权威榜单的最新数据,2025年AI大模型格局迎来剧变。谷歌Gemini成功反超,在文本对话和多模态领域独占鳌头,而国产大模型在多个细分赛道也实现了突破性进展,成为年度最大亮点。这份梳理能帮助读者快速把握行业竞争态势和技术演进方向。

2025 AI 大模型年终盘点:谷歌反超,国产爆发,三大榜单一文看懂!智能速览

  • 谷歌Gemini 3在文本与多模态榜单上实现双料冠军。

  • Anthropic Claude系列继续称霸代码与编程能力。

  • 国产大模型在网页开发、图像生成等赛道跻身全球前十。

  • OpenAI GPT-5系列虽不及预期,但在搜索领域紧追谷歌。

  • 智谱GLM-4.7等国产模型在新兴的智能体赛道表现亮眼。

2025 AI 大模型年终盘点:谷歌反超,国产爆发,三大榜单一文看懂!精华内容

三大榜单从不同维度揭示了AI模型的进化,从真人偏好到客观能力,再到综合智商,共同描绘出2025年AI竞争的清晰版图。

谷歌逆袭登顶

在代表真人偏好的LMArena Text Arena榜单中,谷歌Gemini 3 Pro以1490分的高分位居榜首,其轻量版Gemini 3 Flash也以1480分紧随其后,包揽前两名,实现了对2024年格局的彻底翻盘。

在多模态能力的Vision Arena中,谷歌的优势更为明显,Gemini 3 Pro、3 Flash和3 Flash thinking版本包揽了前三名,分别以1309、1284和1268分领跑,将其他竞争者甩在身后。

巨头各有千秋

OpenAI的GPT-5系列虽然在核心文本榜单中排名第八,但在Search Arena中展现了强大实力。其GPT-5.2-search版本以1211分排名第二,仅比谷歌的搜索模式低3分,显示出在信息整合与检索方面的深厚积累。

Anthropic则继续巩固其在代码领域的统治地位。在WebDev榜单中,Claude Opus 4.5 thinking版本以1512分遥遥领先,比第二名的GPT-5.2高出32分,是当之无愧的编程王者。

国产模型崛起

国产模型在多个细分赛道实现了质的飞跃,成为全球AI版图中不可忽视的力量。在WebDev编程榜单中,MiniMax M2.1和智谱GLM-4.7成功闯入全球前十,分列第六和第七。

在图像生成与编辑领域,国产模型的表现尤为突出。腾讯混元和字节跳动Seedream进入了文生图榜单前十;而在图像编辑榜单中,字节更是有三款模型跻身前十,Seedream 4.5以1327分排名第五,显示出该领域已进入全球第一梯队。

智能体新战场

代表未来趋势的智能体能力成为新的竞争焦点。在Artificial Analysis的Agentic Index中,虽然Anthropic Claude以67分排名第一,但国产模型的起点非常高。

智谱GLM-4.7以63分与谷歌并列第三,仅与榜首相差4分。DeepSeek V3.2、Kimi K2和小米MiMo-V2-Flash也紧随其后,均进入前十。这表明在执行复杂多步骤任务的前沿赛道上,国产力量已经具备了与国际顶尖玩家同台竞技的实力。

2025年的AI格局不再是单极世界,谷歌、OpenAI、Anthropic与国产力量形成了多强竞争的局面。随着智能体成为新赛道,技术竞赛将愈发激烈。面对百花齐放的模型,如何根据自身需求选择最佳工具,将成为每个使用者的新课题。明年,谁又将引领新的突破?

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章