OpenAI首席执行官Sam Altman公开承认新版ChatGPT(GPT-5.2)在某些方面不如前代,验证了用户吐槽。这揭示了AI模型发展中的权衡困境:专注编程能力导致写作等通用功能退化。事件背后,是OpenAI与Anthropic的竞争加剧,以及训练方法差异对模型性能的影响,为理解AI进化提供新视角。
智能速览
Sam Altman承认GPT-5.2写作性能不如前代
OpenAI专注编程能力牺牲了其他功能优化
Anthropic的Claude模型在编程领域领先明显
RLHF与宪法AI训练方法差异影响模型表现
用户反馈显示模型出现语气平淡和幻觉问题
民意调查显示用户正转向Gemini
精华内容
Altman的坦白不仅是一次失误承认,更折射出AI模型开发中的深层挑战。当研发资源倾斜时,通用性如何维持?这场性能倒退风波,揭示了技术竞争的残酷现实。
性能倒退承认
在OpenAI市政厅会议上,Sam Altman直言GPT-5.2在写作能力上出现退步,呼应了社交媒体上用户的广泛批评。实际测试中,模型表现出语气平淡、翻译质量下降及严重幻觉问题。数据科学家Mehul Gupta的评测指出,该模型在即时回答模式上倒退明显,日常使用中不如基准测试理想,导致用户信任度下滑。
原因分析
Altman解释称,OpenAI将研发重心转向逻辑推理、编程和工程设计,导致带宽受限而忽略写作优化。这一决策旨在追赶Anthropic的编程优势,但牺牲了通用性。GPT-5.2在编程测试中表现较弱,SWE-bench标准显示其排名低于Claude 4.5 Opus,后者以74.40%的解决率领先。OpenAI承诺在GPT-5.X版本中修复写作问题,强调未来目标是打造全能模型。
竞争对比
Anthropic的Claude模型凭借宪法AI训练方法在编程和诚实性上表现更佳。该方法让模型自我对齐,减少人工干预,增强了逻辑性能。相比之下,OpenAI的RLHF依赖人类反馈,可能导致模型偏科。Claude不仅在编程社区口碑领先,在写作和创意任务上也优于GPT-5.2,测试显示其生成内容更流畅连贯。
用户影响
性能倒退引发用户流失,调查显示约50%用户转向Gemini。实际案例中,用户处理邮件时遭遇幻觉问题,导致工作失误。Gemini凭借多模态和低价策略(如学生免费一年)吸引用户,而OpenAI仍处亏损状态。长期来看,通用模型的平衡能力将成为关键,若OpenAI无法快速优化,市场份额恐被进一步侵蚀。
这场风波暴露了AI模型的脆弱性:追求单点突破可能侵蚀核心价值。OpenAI的反思为行业敲响警钟,未来能否在编程与通用性间找到平衡?用户的选择将决定竞争格局,而技术创新需兼顾实际体验。AI进化之路,是继续偏科还是回归全能?
关键评论
基本是谷歌的天下了,有完整体系硬件、软件、模型、数据
coding重度用户回答: 中度复杂以上场景ChatGPT吊打Claude和Gemini
通用型就是各方面都得强,毕竟是基座模型
深度思考被换成发散性思考后就转Gemini了,处理代码要么Gemini要么Claude
能力是可以慢慢提升的,但路线走错了就很难回头了