近期,OpenAI正式发布了其最新一代旗舰模型GPT-5.4,并同步推出了面向高复杂度任务的GPT-5.4 Pro版本。此次更新被定位为专业工作场景的重大升级,其核心亮点在于一系列使AI从辅助工具向量自主“数字员工”转变的关键能力。
本次发布最引人注目的突破是,GPT-5.4成为了OpenAI首个原生支持“电脑操控”(Computer Use)的通用模型。这意味着它不再仅仅是生成文本或代码,而是能够像人类用户一样,通过理解屏幕截图、模拟鼠标点击和键盘输入来直接操作电脑上的应用程序和网页。在权威的OSWorld-Verified桌面操控能力测试中,GPT-5.4的成功率达到了75%,甚至超过了人类72.4%的平均水平,相较于前代GPT-5.2的47.3%有了质的飞跃。这项能力标志着AI正从“被动回应”向“主动执行”迈出关键一步。

在专业知识工作领域,GPT-5.4也展现出强大的实力。根据覆盖44种职业的GDPval基准测试,GPT-5.4在与行业专业人士的比较中,有83%的任务表现持平或更优。具体到办公场景,其在内部投行建模任务中的评测得分从68.4%跃升至87.3%,生成的演示文稿在视觉效果和内容组织上也有显著提升,获得了评审人员的更高偏好。

对于开发者和技术人员而言,新模型同样带来了多项重要改进。GPT-5.4整合了此前专为编程设计的GPT-5.3-Codex的能力,实现了“大一统”。在保持SWE-Bench Pro编程测试得分(57.7%)与专用模型相当的同时,还降低了延迟,用户无需在不同模型间切换即可获得顶级的编程与通用能力。
API支持高达100万token的超长上下文窗口,这让模型能够一次性处理和理解海量信息,例如通读整部长篇小说或分析复杂的代码库,为处理长文档和执行长链条任务提供了坚实基础。
为了提升效率和降低成本,GPT-5.4引入了“工具搜索”(Tool Search)功能。以往在为模型配备大量外部工具时,需要将所有工具定义都放入提示词,造成巨大的token消耗。现在,模型可以按需查找并加载工具定义,测试表明该功能可在保持准确率的同时,将token消耗减少47%。

在用户交互体验上,ChatGPT中的GPT-5.4 Thinking模式也进行了优化。模型在开始执行复杂任务前,会先展示其“思考计划”,用户可以中途介入、调整方向,而不必等待任务完成后再返工重来,使人机协作变得更加高效透明。

随着新模型的推出,OpenAI也调整了其产品线和定价。GPT-5.4已陆续向ChatGPT Plus、Team和Pro用户开放,并取代GPT-5.2 Thinking成为默认模型,后者将于2026年6月5日正式退役。在API定价方面,GPT-5.4的输入价格从每百万token 1.75美元上调至2.50美元,输出价格则从14美元上调至15美元。