最新大语言模型综合排行榜揭晓,整合了人类偏好、知识推理、数学能力等六大维度的评测结果。榜单不仅呈现了当前AI领域的最新竞争格局,还首次引入终端命令行任务评测,为模型评估提供新视角。
智能速览
Gemini 3 Pro位居综合实力榜首
GPT-5.2和Claude Opus 4.5分列二三位
榜单新增Terminal Bench hard评测维度
双周更新制确保排行榜时效性
精华内容
大模型竞争日趋激烈,本期排行榜呈现出新格局:Gemini 3 Pro凭借全方位表现登顶,国产模型也在多个维度崭露头角。
综合排名分析
本期前十名模型依次为:Gemini 3 Pro、GPT-5.2、Gemini 3 Flash、Claude Opus 4.5、GPT-5.1、GPT-5、DeepSeek v3.2、GLM-4.7、GPT-5.1 Mini、Kimi-K2。
Gemini 3 Pro在综合评测中表现最为突出,成为本期最大亮点。GPT-5.2紧随其后,显示出OpenAI仍在保持技术领先优势。值得注意的是,Gemini 3 Flash作为轻量级模型也能跻身前三,体现了Google在模型优化方面的进步。
国产模型表现
国产模型在本期榜单中表现亮眼,DeepSeek v3.2、GLM-4.7和Kimi-K2同时跻身国内最强模型和最强开源模型行列。
这三款模型的崛起标志着中国在AI领域的技术实力正在快速提升。特别是在开源生态方面,国产模型已经具备与国际巨头竞争的实力,为AI技术的普及和应用提供了更多选择。
专项能力冠军
在细分能力方面,不同模型各有所长。代码能力最强的三款模型分别是Gemini 3 Pro、GPT-5.2和Claude Opus 4.5。
这种差异化表现说明,用户在选择模型时应当根据具体需求来决定。如果需要编程辅助,可以优先考虑这三款模型;如果关注综合性能,则Gemini 3 Pro是更好的选择。
评测体系升级
本期榜单新增了Terminal Bench hard评测维度,专门用于评估模型在终端命令行环境下的任务执行能力。
这一新增评测填补了模型实用性评估的空白,让排行榜更加全面。同时,榜单更新频率改为双周更,确保用户能够及时获取最新的模型表现信息。