GPT-5发布陷"柱状图乌龙"争议,实测能力与商业化策略再掀AI行业波澜
一场充满争议的发布会在社交媒体掀起浪潮。OpenAI发布GPT-5后数小时,直播中使用的一张基准测试对比图成了众矢之的。图片中代表GPT-5的灰色柱形条,在坐标轴未按比例缩放的情况下被缩短至52.8长度,而同场竞赛的早期模型o3对应的柱子却高达69.1。这种“视觉魔术”让灰色柱子通过压缩尺寸营造出微弱优势假象,有网友甚至调出原始数据自制成标准对比图,显示两项指标实际差值仅不足4分。
这场技术乌龙迅速点燃网络舆论。现场截图的坐标错乱感令网友直呼“犯罪级失误”,不少人联想到商业公司惯用的美化数据手法,质疑OpenAI刻意误导公众。处于舆论中心的阿尔特曼紧急澄清“技术博客里的图表是正确的”,却以调侃语气补上“或许需要GPT-6才能解决”的尴尬发言,导致负面声量进一步发酵。
抛开争议图表,GPT-5在实际指标中仍显露出部分突破。在SWE编程基准测试中,该模型以74.9%的准确率超过Claude Opus,编程过程中展现出理解复杂代码库并定位隐藏错误的能力。现场演示环节,工程师仅用六分钟便构建出可互动3D城堡场景,模型还能根据实时反馈调整应用布局。医疗领域测试显示,与患者沟通准确率较前代提升90%,文本幻觉率在深度思考模式下压降至1%以下。

商业化策略被视作本次发布亮点。免费用户开放基础版GPT-5,Plus用户可使用含推理功能的中级版本,而专业版定价较竞品Claude降低至其1/15。三档定价搭配灵活API接口的策略,显示出OpenAI向下覆盖普通用户、向上锁定企业客户的野心。
用户实测反馈呈现两极分化。程序员群体普遍认可代码生成行数扩展至595行的突破,但有创作者诟病故事生成过于保守:“角色失去鲜活个性,仿佛审核员附体。”多模态能力虽强化了语音自然度,却被用户批评“冰冷得像客服机器人”。更令高阶用户困扰的是,旧提示词体系需全面调整才能适配新模型,部分指令遵循失灵现象频现。
这场发布会折射出AI行业的复杂现状。当技术突破难以再现早期跨越式增长,厂商不得不在商业落地与公众期待间寻找平衡,而每一个细小的失误都可能被置于放大镜下审视。GPT-5引发的争议,本质上是对AI发展节奏的集体焦虑——人们既渴望革命性创新,又对无法预见的风险充满警惕。

飞的牛牛
校验提示文案
Sveny
校验提示文案
值友2482496858
校验提示文案
值友1437922960
校验提示文案
值友1437922960
校验提示文案
值友2482496858
校验提示文案
Sveny
校验提示文案
飞的牛牛
校验提示文案