Google 打破常规发布了 Gemini 3.1 Pro,这款模型在多项主流基准测试中取得了商用模型最高分,展现出强大的综合能力。然而,它并非全面领先,在某些复杂任务中仍有短板。其真正的竞争力在于,性能大幅升级的同时,价格却维持不变,为用户提供了极高的性价比。
智能速览
Gemini 3.1 Pro 在 GPQA、LiveCodeBench 等多项基准测试中表现领先。
支持百万 token 上下文,并能生成动画 SVG 文件。
在需要工具协作的复杂任务上,表现略逊于 Claude 和 GPT 的旗舰模型。
幻觉率显著降低至 30%,但验证信息仍不可少。
定价与上代持平,性价比优势明显。
已集成到 Google 全家桶及 GitHub Copilot 中。
精华内容
Gemini 3.1 Pro 的发布,不仅是数字上的超越,更引发了关于AI模型竞争格局的深层思考。它究竟强在何处,又在哪些方面有所保留?
基准领先
Gemini 3.1 Pro 在多项关键基准测试中取得了商用模型的最高分,体现了其强大的综合能力。
在科学知识方面,GPQA Diamond 测试得分高达 94.3%。在编码能力上,LiveCodeBench Pro 获得了 Elo 2887 的评级。此外,在 Agent 编程和搜索任务中,Terminal-Bench 2.0 得分 68.5%,BrowseComp 得分 85.9%。在不借助工具的 Humanity’s Last Exam 中,它也以 44.4% 的成绩位居所有商用模型之首。
新能与规格
技术规格上,Gemini 3.1 Pro 支持最高 100 万 token 的输入上下文,输出上限为 6.4 万 token,足以处理长篇文档或整个代码仓库。
作为原生多模态模型,它能理解文本、图片、音频和视频。一个有趣的新增功能是支持通过文本提示直接生成动画 SVG 文件。实测显示,只需提示“画一只骑自行车的鹈鹕”,模型就能生成细节到位的动画,连翅膀飞羽都带有注释,展现了其精细的生成能力。
并非无懈可击
尽管在许多基准上领先,Gemini 3.1 Pro 并非全面碾压对手。在需要借助外部工具的复杂场景下,其优势有所减弱。
例如,在 Humanity’s Last Exam 的“带工具”版本中,它的得分是 51.4%,略低于 Claude Opus 4.6 的 53.1%。在衡量模型综合能力的 GDPval-AA 排名中,它的 Elo 分数为 1317,落后于 Claude Sonnet 4.6 的 1633。编码领域同样如此,在 SWE-Bench Pro 上,它以 54.2% 的得分惜败于 GPT-5.3-Codex 的 56.8%。
性价比为王
Gemini 3.1 Pro 最具竞争力的地方在于其定价。官方公布的输入价格为每百万 token 2 美元,输出价格为 12 美元,这与上一代 Gemini 3 Pro 完全相同。
这意味着用户可以用不到 Claude Opus 4.6 一半的价格,获得在多项评测中分数更高的模型。这种性能提升但价格不变的做法,构成了其性价比的绝对优势。目前,该模型已全面上线,从 Gemini App 到开发者工具如 Google AI Studio、Vertex AI,甚至微软的 GitHub Copilot 也同步提供了支持。
Gemini 3.1 Pro 的出现,标志着大模型竞争进入白热化阶段。性能的飞跃与成本的稳定,让开发者受益匪浅。面对各家厂商的快速迭代,未来的AI世界将充满无限可能,下一个破局者会是谁?