谷歌深夜发布Gemini 3.1 Pro,凭借在逻辑推理、代码能力和性价比上的全面飞跃,超越了包括Claude Opus在内的现有顶尖模型。这次升级不仅大幅降低了AI幻觉,还打通了与NotebookLM的生态联动,为AI应用带来了新的可能性。
智能速览
逻辑推理能力实现翻倍,ARC-AGI-2测试得分远超竞品
代码能力提升约15%,可胜任复杂的城市规划任务
AI幻觉现象骤降38%,回答严谨性显著增强
性能全面领先,但API调用价格仅为同类旗舰的一半
实现与NotebookLM底层互通,盘活个人知识库
集成音乐生成功能,支持文字、图片直接生成歌曲
精华内容
Gemini 3.1 Pro的发布并非简单的迭代,而是一次多维度的质变,其核心优势体现在具体的性能数据和全新功能上。
推理能力飞跃
在衡量AI解决未知问题能力的ARC-AGI-2评测中,Gemini 3.1 Pro取得了77.1%的准确率,是其前代3.0 Pro的两倍,并远超Claude Opus 4.6。该成绩甚至超过了人类约60%的平均水平,标志着其在迈向通用人工智能(AGI)方向上的重大进展。模型已能基于《呼啸山庄》这类文学作品,不仅进行总结,还能推理氛围、设计UI并生成代码,甚至能独立构建一个实时航空航天数据仪表盘。
代码与规划进化
新模型的编程水准跃升约15%,稳居全球第一梯队。在测试中,使用相同Prompt生成动画小程序,Gemini 3.1 Pro在画面精细度和设计美感上均优于前代。更令人瞩目的是,它能处理城市规划这类极为复杂的任务:仅凭一张河流地貌图,就能自主分析资源、规划交通路网,并进行区域职能划分,逻辑自洽地推演出一套完整的城建方案,展现了强大的宏观规划能力。
幻觉大幅消减
根据严苛的AA-Omniscience幻觉测试,Gemini 3.1 Pro的幻觉比例相较前代缩减了38%。该测试对“胡说八道”行为进行重罚,鼓励模型坦诚回答“不知道”。在此机制下,Gemini 3.1 Pro获得了全场最高的“全知指数”,比Claude Opus 4.6高出19分。这一进步意味着模型告别了过往为讨好用户而强行编答案的模式,可用性和严谨度得到质的提升。
极致性价比
Gemini 3.1 Pro在实现性能大幅跃升的同时,维持了与上一代完全一致的定价。根据权威分析机构数据,其综合智能分析得分领先Claude Opus 4.6整整4分。然而,在同等智力水平下,其API调用成本却仅为Claude Opus 4.6和GPT-5.2这类旗舰模型的一半,真正做到了“加量不加价”,为开发者和用户提供了极高的性价比。
生态与多模态
本次更新的一个“王炸”功能是Gemini与NotebookLM的底层互通。用户现在可以直接在Gemini中调取存储在NotebookLM的私人知识库进行深度交互,这极大地盘活了个人资料,为自媒体从业者等专业人士提供了无缝的工作流。同时,模型集成了新一代音乐大模型Lyria3,支持“文字生音乐”和“图/视频生音乐”,用户可通过简单的描述或上传素材,生成高质量、情感贴合的专属BGM。