这是一次AI产品化路径的清晰示范——将实验室中84.6% ARC-AGI得分的DeepThink能力,以77.1%性能、93%成本降幅、幻觉率腰斩的方式下放至通用模型。它不只是一次升级,而是推理能力从科研标杆转向生产力工具的关键转折。
智能速览
ARC-AGI抽象推理得分从31.1%跃升至77.1%,提升148%,逼近DeepThink的84.6%
单次任务成本降至0.96美元,较DeepThink初期77美元下降93%,实现推理普惠
幻觉率由81%降至50%,回答可靠性进入实用区间
智能体能力在APEX-Agents等测试中提升45%-82%,支持主动规划旅行、分析财报、搭建网站
编码能力在LiveCodeBench-Pro达Elo 2887,SWE-Bench与Opus 4.6持平,SWE-Bench-Pro略逊于GPT-5.3-Codex
四个Demo展现‘代码创作’能力:SVG矢量动画生成、ISS实时遥测仪表盘、交互式3D鸟群模拟、《呼啸山庄》情感驱动网页构建
精华内容
当顶级AI不再困于实验室榜单,而能以不到1美元的成本完成一次高阶推理任务,它就真正开始重塑工作流。Gemini 3.1 Pro的价值,正在于把‘能做到’变成‘用得起’‘靠得住’‘干得巧’。
推理跃迁
在ARC-AGI-2这一衡量抽象推理“智商”的权威测试中,上一代Gemini 3 Pro得分为31.1%,而3.1 Pro飙升至77.1%,提升幅度达148%。该成绩已非常接近DeepThink创下的84.6% SOTA纪录。值得注意的是,这并非简单堆算力——从科研模型到通用模型,性能仅轻微下降7.5个百分点,却实现了从不计成本到大规模商用的根本转变,验证了工程优化对推理能力无损产品化的可行性。
成本革命
DeepThink早期单次ARC-AGI任务成本为77美元,经初步优化降至13美元;而3.1 Pro进一步压降至0.96美元,不足1美元。性能仅比DeepThink低约9%,成本却暴跌93%。这意味着高阶推理首次具备日常调用的经济性——开发者可将其嵌入高频交互场景,企业能规模化部署复杂决策链路,技术普惠由此落地。
可靠进化
幻觉率从上一代的81%显著降低至50%,意味着模型“胡说八道”的概率减少近一半。在需要事实准确性的场景如财报分析、政策解读或医疗信息摘要中,这一改善直接决定可用性边界。50%的幻觉率虽未达完全可信,但已跨入基础可靠区间,为智能体执行连贯多步任务提供了前提保障。
智能体升维
在APEX-Agents、BrowseComp、MCPAtlas及Terminal-Bench等智能体专项评测中,3.1 Pro取得45%–82%不等的提升。实测显示,它可自主完成机票酒店联订、基于公开财报生成市场分析简报、甚至作为初级程序员搭建并维护响应式网站。这些能力标志着AI正从被动应答者,转向具备目标拆解、工具调用与过程纠偏能力的主动行动者。
编码破界
在纯算法竞赛LiveCodeBench-Pro中,3.1 Pro以Elo 2887大幅领先竞品(Opus 4.6为2500);在贴近真实工程的SWE-Bench上与Opus 4.6打平,同处第一梯队;但在更严苛的SWE-Bench-Pro(含超大型代码库理解)中,仍以微弱差距落后于GPT-5.3-Codex。这表明其强项在于逻辑推演与算法实现,而软件工程级的上下文管理与架构感知仍是特化模型的护城河。
创作范式
四个Demo突破传统代码生成范畴:一是仅凭文本提示生成可无限缩放的SVG矢量动画;二是解析NASA公开API,自主编写Three.js代码构建ISS实时遥测仪表盘,精准渲染地球昼夜与轨道位置;三是生成带手部追踪交互与运动同步音效的3D鸟群模拟;四是将《呼啸山庄》的压抑孤寂氛围转化为完整网页设计语言——包括配色系统、字体节奏、动效逻辑与内容结构。这已不是‘写代码’,而是‘用代码表达情感’。
Gemini 3.1 Pro的价值不在单项登顶,而在系统性弥合前沿研究与日常应用之间的鸿沟。它用数据证明:顶尖能力可以低成本、高可靠、强行动地进入普通开发者的工具箱。当推理成为基础设施,智能体成为默认配置,代码生成升维为数字创作,AI竞争的焦点正从‘谁能跑得更快’转向‘谁能让更多人用得更远’。下一个问题或许是:当门槛消失,创造力的分水岭又在哪里?