OpenAI发布的最新旗舰大模型GPT-6 Astra,标志着人工智能从单纯的“问答对话”向独立“执行任务”发生了根本性转变。该模型在处理复杂工作流、计算机自动化控制、科学推理以及网络安全等方面均展现出显著的技术提升,被视为大模型迈向具备端到端落地能力的数字员工时代的重要节点。
GPT-6 Astra最受关注的核心突破在于其“计算机使用”(Computer Use)能力。以往让AI操作软件通常依赖于专用接口,而Astra能够直接通过屏幕界面进行视觉识别与可视化操作,像人类一样使用键盘和鼠标接管常用软件。无论是网页浏览、表单填写、更新CRM记录,还是操作KiCad进行电路板布线、在Blender与Unreal Engine 5中完成3D建模与场景漫游,该模型都能直接在真实软件环境中运行。测试数据显示,在桌面任务测试OSWorld 2.0中,其任务完成率达到72.6%,单任务耗时相比前代模型缩短了近半;而在专业软件界面元素定位测试ScreenSpot-Pro中,其准确率达到了92.7%。
在抽象推理与科学研究领域,Astra也展现出了极高的智力水平。在针对全新抽象逻辑推理的测试ARC-AGI-3中,Astra取得了99.9%的成绩,表明其摆脱了单纯依靠训练数据记忆的模式,具备了在陌生环境中自主摸索规律与迁移应用的能力。在科研级数学测试FrontierMath Tier 4中,模型拿到了97.6%的分数,并开始辅助推导关于素数间距的开放性数学问题。同时,它还能结合计算机操作直接使用专业科研软件,完成细胞追踪、遗传变异可视化等复杂数据探索任务。
在软件工程与编程协作方面,Astra进一步强化了命令行运维和代码重构能力。针对以往超长上下文在任务后半段易“失忆”的问题,Astra在Codex中引入了全新的长期上下文保存与检索机制。当105万token的上下文窗口被填满时,模型不再依赖会丢失细节的摘要压缩,而是跨窗口保留工作笔记,随时检索早期的代码细节、需求和测试结果,大幅提升了长时间、多文件代码调试与架构重构的连续性。
除了硬核技术指标,Astra在协同工作中的“判断力”与“审美表现”也得到了明显增强。模型不仅具备更强的视觉判断力,能够根据企业既有模板制作出格式规范、版式美观的文档、表格与演示文稿,还学会了如何在信息缺失时做合理推算。当缺少非关键细节时,它会自行补齐;当遇到会改变最终交付方向的关键决策时,它才会精准向用户提问。更实用的是,Astra支持在任务执行过程中随时接收新需求,无需中断重来即可调整后续方向。
在安全性与对齐方面,Astra成为了首个达到“关键”(Critical)级网络安全能力门槛的大模型。在漏洞利用测试ExploitBench中,它取得了100%的成绩,能够自主寻找未知的0day漏洞并构建利用链,因此OpenAI对其高阶网络安全能力实行了严格的访问隔离。同时,该模型在授权边界控制上更为严格,在防越权测试中实现了零违规,幻觉率也显著降低。不过研究也发现,其内部推理过程呈现出高度压缩的趋势,直接输出思维链的步骤减少,使得人类对其思考过程的实时监督变得更具挑战性。
根据公布的信息,GPT-6 Astra依托超过10万块GPU集群完成训练,上下文窗口为105万token,最大输出为12.8万token。其API标准价格设定为每百万输入token 10美元,每百万输出token 50美元。随着其逐步向各类订阅用户及企业接口开放,人工智能的应用形态正加速从辅助工具向能够交付完整工作成果的自主智能体演进。