OpenAI近日正式发布了其最新的编程模型GPT-5.3-Codex。此次发布紧随竞争对手Anthropic推出新模型之后,被广泛视为AI领域,尤其是AI编程赛道竞争加剧的标志。与以往版本相比,GPT-5.3-Codex并非一次常规的性能迭代,而是在多个维度实现了显著改进,其目标是超越单纯的编程工具,成为更全能的数字工作协作者。
新模型在运行效率上取得了重大突破。根据官方信息,GPT-5.3-Codex在完成相同任务时,其消耗的令牌(Token)数量不到前代模型GPT-5.2-Codex的一半,同时处理速度提升了超过25%。这意味着用户可以更快速、更经济地完成工作,这对于需要处理长程、复杂任务的开发者和企业而言,是直接的体验提升和成本优化。

在核心的编程与软件工程能力上,GPT-5.3-Codex在多个行业基准测试中创造了新纪录。例如,在评估真实世界软件工程能力的SWE-Bench Pro评测和衡量编程智能体终端操作技能的Terminal-Bench 2.0中,其表现均超越了此前的最高水平。除了亮眼的测试分数,新模型在实际应用中也展现了更强的能力。它能更好地理解用户的模糊或简单指令,从而生成功能更丰富、设计更合理的网站或应用。官方示例显示,它甚至可以在几天内从零开始构建出包含多张地图和道具系统的赛车游戏,展现了其在复杂项目构建上的潜力。

此次升级最核心的变化之一,是GPT-5.3-Codex定位的扩展。它不再仅仅是一个编写和审查代码的AI,而是进化为一个几乎能完成专业人士在计算机上进行的任何工作的通用智能体。其能力覆盖了软件开发的整个生命周期,包括调试、部署、监控、撰写产品需求文档、用户研究等。此外,它还能胜任编程之外的知识型工作,如制作精美的幻灯片、在电子表格中进行复杂的数据分析等。在衡量计算机操作能力的OSWorld基准测试中,GPT-5.3-Codex也表现出远超以往模型的水平,证明了其作为“计算机操作者”的潜力。
用户与模型的交互方式也发生了根本性改变。GPT-5.3-Codex支持在任务执行过程中进行实时引导和互动。用户不必等待最终结果,而可以在模型工作时随时提问、讨论方法或调整方向,模型会频繁更新其进展和决策,并对反馈做出响应,整个过程如同与一位人类同事并肩协作,且不会丢失上下文信息。
一个尤为引人注目的亮点是,GPT-5.3-Codex是OpenAI首个在自身创造过程中发挥了关键作用的模型。据透露,OpenAI的团队使用了该模型的早期版本来调试训练过程、管理部署和分析测试结果,从而显著加快了最终版本的发布速度。这种“自我加速”的迭代方式,预示着未来AI技术发展可能会进入一个新的阶段。
在安全性方面,GPT-5.3-Codex是OpenAI首个在其安全框架下,网络安全能力被评为“高等级”的模型,并经过专门训练以识别软件漏洞。OpenAI表示,尽管如此,公司仍采取了审慎的部署策略和全面的安全防护措施。
目前,GPT-5.3-Codex已面向ChatGPT付费用户在其系列应用中开放,其API接口预计将在未来推出。GPT-5.3-Codex的发布不仅带来了编程能力的跃升,更重要的是展现了AI从专用工具向通用协作者演进的清晰路径。