谷歌发布Gemini 3.1 Pro核心模型,在被誉为最难的AI推理测试ARC-AGI-2中取得77.1%得分,推理性能较前代翻倍。16项基准测试中12项登顶,标志着谷歌在核心推理能力上实现跨越式突破,现已全面开放使用。
智能速览
Gemini 3.1 Pro在ARC-AGI-2测试得分77.1%,比前代31.1%翻倍
16项基准测试中12项排名第一,展现全面领先性能
科学知识测试GPQA Diamond得分94.3%,代码能力SWE-Bench达80.6%
支持100万token上下文窗口,多模态输入处理能力强大
定价与前代保持一致,已向开发者和企业全面开放
"深度思考"模式得分84.6%,但仅限订阅用户使用
精华内容
Gemini 3.1 Pro的发布标志着AI推理能力的重大突破,让我们深入解析其性能表现和技术细节。
推理能力突破
在ARC-AGI-2基准测试中,Gemini 3.1 Pro取得了77.1%的得分,这一成绩相比前代Gemini 3 Pro的31.1%提升超过一倍。ARC-AGI-2是评估模型解决从未见过的逻辑模式能力的权威测试,人类平均正确率约为60%。
值得注意的是,基于此核心模型推出的"深度思考"模式得分更高,达84.6%,但该功能仅限于Google AI Ultra订阅用户使用,且有每日使用次数限制。
多维度领先
在官方公布的16项主要基准测试中,Gemini 3.1 Pro在12项测试中位列第一,展现出全面的性能优势。
具体来看,在科学知识测试GPQA Diamond中获得94.3%的高分,在代码能力测试SWE-Bench Verified中达到80.6%,在长周期智能体任务APEX-Agents中获得33.5%的成绩,均处于行业领先水平。
技术规格
Gemini 3.1 Pro支持100万token的输入上下文窗口,能够处理大量信息,同时支持多模态输入,包括文本、图像、音频和视频。
输出限制为64,000 token,能够满足大多数长文本生成需求。该模型是Gemini系列首次使用".1"版本号,谷歌表示这种快速迭代旨在将前沿研究成果更快转化为稳定的基础能力。
开放使用
Gemini 3.1 Pro现已全面开放,开发者可通过Google AI Studio和Gemini API访问,企业用户可通过Vertex AI平台使用,普通消费者则可通过Gemini应用和NotebookLM体验。
定价方面与Gemini 3 Pro保持一致,采用了相同的计费策略,为用户提供了性能升级的同时没有增加使用成本。
Gemini 3.1 Pro的发布不仅是性能的升级,更是AI推理能力的一次重要跃升。从科学知识到编程能力,从多模态处理到长文本理解,这款模型展现出全方位的技术突破。随着模型的全面开放,开发者将能探索出怎样的创新应用?