OpenAI发布的GPT-5.2-Codex模型与Agent Skills功能,为开发者带来了新的可能性。通过三大编程任务的深度实测,并与主流工具对比,这篇内容旨在揭示其真实性能,帮助开发者判断它究竟是提升效率的生产力工具,还是一个华而不实的选择。
智能速览
Agent Skills功能允许将专业知识打包,让AI按规范执行任务。
GPT-5.2-Codex在SWE-Bench Pro基准测试中取得56.4%的成绩。
实测UI复刻任务耗时近20分钟,效果尚可但速度慢。
iOS应用开发耗时33分钟完成,功能齐全但代码结构混乱。
Agent Skills的加入,让AI的输出质量和流程可控性得到提升。
精华内容
理论参数和基准分数固然重要,但真实世界的开发场景才是检验模型能力的唯一标准。通过一系列精心设计的编程任务,可以更直观地评估GPT-5.2-Codex的实战水平与Agent Skills的实用价值。
Agent Skills功能解析
Agent Skills的核心思想是将个人或团队的专业知识、工作流程和规范打包成一个“技能包”,供AI随时调用。这相当于为AI配备了一本随时可查的“工作手册”,避免每次任务都需要重复交代背景和要求。
该方案相比之前的MCP,最大的优势在于节省Token。它采用“渐进式披露”机制,只在需要时才加载完整内容,防止上下文窗口溢出。OpenAI的实现基本沿用了Anthropic的规范,将SKILL.md文件置于特定目录下,保证了跨平台的兼容性。
三大编程任务实测
实测环节设计了三个不同难度的任务,以全面检验模型能力。
首先是UI复刻,根据一张复杂后台界面截图生成代码。模型耗时19分45秒完成,效果在布局和样式上还原度较高,但速度远低于竞品。
其次是智能体框架转换,将一段AutoGen代码改写为ADK框架并增加UI。10分钟后任务完成,基本功能可用,但遗漏了关键的“语言专家”模块。
最后是挑战最大的iOS原生应用开发,要求实现包含多个功能页面的背单词App。经过33分钟的漫长等待,产出一个功能基本完整的应用,但近2000行代码全部堆在一个文件中,完全未遵循MVVM架构规范。
能力与短板的权衡
实测结果显示,GPT-5.2-Codex在处理复杂、长周期的编程任务上确实有所进步,视觉理解和代码生成的完成度都比前代更高。Agent Skills的加入也显著提升了输出的可控性和专业性。
然而,其最大的短板是响应速度过慢。一个简单的UI任务需要近20分钟,复杂项目更是动辄半小时以上。这种速度在实际快速迭代的开发中难以接受。此外,产出质量并未因慢而得到保证,代码结构混乱等问题说明其自动化编程仍需人工严格把关。
技能通用化的未来
OpenAI这次直接采用Anthropic提出的Skills规范,一个重要信号是这套“工作手册”方案正成为行业的事实标准。对开发者而言,这意味着可以一次编写,在多个主流AI编程工具间通用,降低了适配成本。
Agent Skills所体现的“固化最佳实践”思路,有效解决了AI输出不稳定、风格不统一的痛点。这套方法论的价值,可能比模型本身的能力提升更具长远意义,值得所有开发者深入研究和应用。
GPT-5.2-Codex是一次进步与短板并存的更新,它在复杂任务处理上展现了潜力,但速度瓶颈限制了其普适性。Agent Skills无疑是本次更新的亮点,它为提升AI产出的质量和一致性提供了有效路径。对于不介意异步处理的开发者来说,它值得尝试;但对追求效率的场景,竞品依然是更优解。