年末AI大戏上演,OpenAI发布的GPT-5.2本应是年度王牌,但上线后却遭遇全网差评。多项第三方基准测试和用户实测显示,其综合表现未能超越谷歌的Gemini 3 Pro,甚至在部分项目中落后。这场对决不仅揭示了当前AI模型的竞争格局,也引发了业界对OpenAI技术领先地位的重新审视。

智能速览
GPT-5.2发布后用户吐槽其体验倒退,语气冰冷,可信度下降。
第三方评测机构数据显示,Gemini 3 Pro在多项核心能力上力压GPT-5.2。
在视觉推理、代码生成等实测场景中,GPT-5.2表现均不及Gemini 3。
OpenAI内部拉响警报,暂停AGI和Sora项目,全力优化ChatGPT。
谷歌创始人承认曾因过于保守错失先机,如今凭借Gemini重回巅峰。
精华内容
这场年末AI王座的争夺战,最终以OpenAI的意外失利告终。GPT-5.2的“翻车”不仅体现在冰冷的数据上,更来自开发者与用户们的切身体会。
基准测试失分
权威机构Epoch AI的报告指出,GPT-5.2的能力指数(ECI)得分为152,排名低于Gemini 3 Pro。在CAIS发布的AI仪表盘中,Gemini 3 Pro在文本和视觉能力指数上全面胜出,平均得分比GPT-5.2高出4.5分。虽然GPT-5.2在风险指数上领先,但在SWE-Bench、Live-Bench等多项关键基准测试中,其排名甚至落后于Claude Opus 4.5,未能实现全线霸榜。
用户实测翻车
开发者与重度用户的反馈更为直观。许多用户抱怨GPT-5.2的语气冰冷,语言表达变得“离谱”,交互体验不及前代。在具体任务上,Gemini 3 Pro的优势更为明显:视觉推理测试中,Gemini几乎碾压GPT-5.2;前端代码生成对比中,使用相同提示词设计健身仪表盘,GPT-5.2多次垫底;在3D模型生成和创意写作任务中,其速度、成本和质量也均不敌对手。
内部战略调整
面对GPT-5.2的失利和谷歌的强大压力,OpenAI内部已拉响“红色警报”。据透露,公司已将改进ChatGPT列为最高优先级,甚至暂停了AGI(通用人工智能)和视频生成模型Sora的研发,摆出破釜沉舟的姿态。外界猜测,OpenAI在预训练环节遭遇了Scaling Law的瓶颈,GPT-5.2的性能提升主要依赖后训练优化,而非底层技术的突破性进展。
谷歌的反击
与OpenAI的被动局面形成鲜明对比的是谷歌的强势回归。谷歌创始人谢尔盖·布林公开承认,公司曾因过度担心AI说错话而错失先机。如今,凭借在预训练上的深厚积累,谷歌打造出了拥有“更深入智能”的Gemini 3 Pro。业界分析认为,谷歌的预训练模型能力更强,而OpenAI的优势则在于“专用智能”的后训练优化,这解释了为何Gemini在综合能力上能够实现反超。