OpenAI 推出的 GPT-5.3-Codex 不仅是其编程能力的又一次迭代,更在真实世界计算机操作任务上实现了质的飞跃。新模型通过显著的基准测试提升和更快的运行速度,旨在降低应用开发门槛,成为开发者更得力的通用协作者。
智能速览
新模型在SWE-bench Pro测试中得分56.8%,小幅超越前代。
Terminal-Bench 2.0得分从64.0%大幅跃升至77.3%。
OSWorld-Verified基准测试得分从38.2%飙升至64.7%。
运行速度比前代GPT-5.2-Codex提升了25%。
支持任务执行过程中的“引导与交互”,不会丢失上下文。
已向ChatGPT付费用户全面开放,近期将上线API版本。
精华内容
GPT-5.3-Codex 的发布标志着 AI 编程智能体正从代码生成工具向更通用的计算机协作者演进,其核心进步体现在对复杂环境的理解与操作能力上。
性能基准飞跃
GPT-5.3-Codex 在多项编程基准测试中刷新了记录。在衡量软件工程能力的 SWE-bench Pro 测试中,其得分达到 56.8%,略高于前代的 56.4%。而更显著的提升体现在模拟真实环境的测试中:Terminal-Bench 2.0 得分从 64.0% 大幅提升至 77.3%。
最引人注目的是在 OSWorld-Verified 智能体计算机操作基准测试中的表现,其得分由 38.2% 飙升至 64.7%,几乎翻倍。这一数据直接表明,新模型在复杂、多步骤的计算机操作任务中,能力实现了质的飞跃。
速度提升25%
除了智能水平的提升,GPT-5.3-Codex 的运行效率也得到显著优化。官方数据显示,与前代 GPT-5.2-Codex 相比,新模型的运行速度提升了 25%。这意味着开发者在使用 Codex 应用、命令行工具或 IDE 插件时,将获得更快的响应和更短的等待时间。
对于需要频繁迭代和调试的开发流程而言,速度的提升直接转化为生产力的增益,让 AI 协作的体验更加流畅自然。
交互式协作体验
新模型的核心改进之一是强化了人机协作的交互性。GPT-5.3-Codex 支持用户在任务执行过程中随时进行“引导与交互”,而不会打断流程或导致上下文信息的丢失。
在实际操作中,模型会高频更新工作进度,让开发者可以实时提问、讨论实现方案并修正执行方向。这种设计使得 AI 不再是一个单向的指令执行者,而更像一个可以随时沟通、共同解决问题的伙伴。
全面开放与愿景
GPT-5.3-Codex 已向所有 ChatGPT 付费用户开放,包括 Plus、Team 和 Enterprise 订阅计划。用户可以通过 Codex 应用、命令行工具(CLI)、IDE 扩展插件及网页端等多种方式立即体验,API 版本也将在近期上线。
OpenAI 的愿景是推动 Codex 从单一的编程智能体,演变为一个更通用的计算机协作者,通过降低构建应用的门槛,赋能更多非专业开发者,让创造变得更简单。
GPT-5.3-Codex 的更新,不仅是性能的堆砌,更是 AI 角色的深化。它正尝试成为开发者在数字世界中真正的延伸。当 AI 能更自如地操作计算机时,未来的软件开发将迎来怎样的变革?