基于LMArena、LiveBench和Artificial Analysis三大权威榜单的最新数据,2025年AI大模型格局迎来剧变。谷歌Gemini成功反超,在文本对话和多模态领域独占鳌头,而国产大模型在多个细分赛道也实现了突破性进展,成为年度最大亮点。这份梳理能帮助读者快速把握行业竞争态势和技术演进方向。
智能速览
谷歌Gemini 3在文本与多模态榜单上实现双料冠军。
Anthropic Claude系列继续称霸代码与编程能力。
国产大模型在网页开发、图像生成等赛道跻身全球前十。
OpenAI GPT-5系列虽不及预期,但在搜索领域紧追谷歌。
智谱GLM-4.7等国产模型在新兴的智能体赛道表现亮眼。
精华内容
三大榜单从不同维度揭示了AI模型的进化,从真人偏好到客观能力,再到综合智商,共同描绘出2025年AI竞争的清晰版图。
谷歌逆袭登顶
在代表真人偏好的LMArena Text Arena榜单中,谷歌Gemini 3 Pro以1490分的高分位居榜首,其轻量版Gemini 3 Flash也以1480分紧随其后,包揽前两名,实现了对2024年格局的彻底翻盘。
在多模态能力的Vision Arena中,谷歌的优势更为明显,Gemini 3 Pro、3 Flash和3 Flash thinking版本包揽了前三名,分别以1309、1284和1268分领跑,将其他竞争者甩在身后。
巨头各有千秋
OpenAI的GPT-5系列虽然在核心文本榜单中排名第八,但在Search Arena中展现了强大实力。其GPT-5.2-search版本以1211分排名第二,仅比谷歌的搜索模式低3分,显示出在信息整合与检索方面的深厚积累。
Anthropic则继续巩固其在代码领域的统治地位。在WebDev榜单中,Claude Opus 4.5 thinking版本以1512分遥遥领先,比第二名的GPT-5.2高出32分,是当之无愧的编程王者。
国产模型崛起
国产模型在多个细分赛道实现了质的飞跃,成为全球AI版图中不可忽视的力量。在WebDev编程榜单中,MiniMax M2.1和智谱GLM-4.7成功闯入全球前十,分列第六和第七。
在图像生成与编辑领域,国产模型的表现尤为突出。腾讯混元和字节跳动Seedream进入了文生图榜单前十;而在图像编辑榜单中,字节更是有三款模型跻身前十,Seedream 4.5以1327分排名第五,显示出该领域已进入全球第一梯队。
智能体新战场
代表未来趋势的智能体能力成为新的竞争焦点。在Artificial Analysis的Agentic Index中,虽然Anthropic Claude以67分排名第一,但国产模型的起点非常高。
智谱GLM-4.7以63分与谷歌并列第三,仅与榜首相差4分。DeepSeek V3.2、Kimi K2和小米MiMo-V2-Flash也紧随其后,均进入前十。这表明在执行复杂多步骤任务的前沿赛道上,国产力量已经具备了与国际顶尖玩家同台竞技的实力。
2025年的AI格局不再是单极世界,谷歌、OpenAI、Anthropic与国产力量形成了多强竞争的局面。随着智能体成为新赛道,技术竞赛将愈发激烈。面对百花齐放的模型,如何根据自身需求选择最佳工具,将成为每个使用者的新课题。明年,谁又将引领新的突破?