Anthropic 发布的 Claude Opus 4.6 再次刷新了编程 AI 的上限,不仅代码能力大幅提升,还深度集成了 Office 全家桶,彻底重塑知识型工作的效率边界。从智能体群协作到超长上下文处理,新模型在多项基准测试中碾压竞品,标志着 AI 办公进入全新阶段。
智能速览
编程能力全方位提升,多项基准测试超越 GPT-5.2 与 Gemini 3。
深度集成 Excel、PPT 等 Office 软件,实现自动化办公。
推出 Claude Code 智能体群,支持多 Agent 并行协作开发。
首款支持 100 万 Token 上下文的 Opus 级别模型。
实测金融任务表现优异,效率较前代提升 23% 以上。
精华内容
Claude Opus 4.6 的发布不仅是模型迭代,更是生产力的范式转移,让我们一起看看它的具体表现。
编程实力碾压
在 ARC-AGI-2 基准测试中,Opus 4.6 拿下 68.8% 的高分,全面超越 GPT-5.2 和 Gemini 3 Pro。更令人瞩目的是,在 GDPval-AA 知识工作评估中,其 Elo 分数比 GPT-5.2 高出约 144 分。这标志着 AI 在推理和代码生成上实现了质的飞跃,几乎达到了“无模”能敌的境地。
办公效率革命
Opus 4.6 深度集成到 Excel 和 PPT 中,能自动遍历文件夹抓取数据差错并绘制图表。在金融咨询领域,原本需要分析师数周完成的财务建模和路演 PPT 制作,现在能在眨眼间搞定。实测显示,在真实金融任务中,Opus 4.6 比前代 Sonnet 4.5 性能提升了 23% 以上,直接影响了全球 15 亿 Office 用户的工作流。
智能体群协作
Claude Code 率先支持“智能体群”模式,一个开发者可以指挥多个 AI Agent 并行协作。官方演示中,16 个 Claude Opus 4.6 在消耗 2 万美元成本后,成功从零编写出 10 万行代码的 C 编译器,并成功运行 Linux 内核。这种多智能体协同工作的方式,彻底改变了传统的软件工程开发模式。
超长上下文
Opus 4.6 是首款在 Beta 阶段就支持 100 万 Token 上下文的 Opus 级模型。它在处理超长文档时,能有效抵抗“上下文衰减”,在 MRCR v2 测试中得分高达 76%,远超 Sonnet 4.5 的 18.5%。配合高达 128k 的输出能力,用户无需分解任务即可完成大规模数据处理,大幅扩展了 AI 的应用场景。
Claude Opus 4.6 凭借强悍的编程能力和深度办公集成,正在重新定义人机协作的边界。随着 AI 技术的指数级进化,知识工作者唯有拥抱变化,才能在未来的职场中保持竞争力。
关键评论
国内外 AI 发展差距引发热议,网友感叹国内略显沉静。
实测用户认为 Claude 编程能力强劲,能大幅提升工作效率。
面对强大的替代者,不少知识工作者流露出失业焦虑。
也有用户关注高昂的使用成本,担心普通用户难以负担。