Anthropic发布的新模型Claude Opus 4.6,不仅编程能力更强,还强势入侵财务分析、法律研究等传统高价值知识领域,引发相关行业股价震动,其能力边界与潜在影响值得深入探究。
智能速览
Claude Opus 4.6在多项基准测试中超越GPT-5.2,尤其在金融法律任务上领先144 Elo。
首次引入1M Token上下文窗口,显著提升了长文本处理与信息检索精度。
新增自适应思考与上下文压缩功能,使模型能自主调节推理深度并高效处理长对话。
Agent Teams功能实现多实例并行协作,能从零编写编译器并发现超500个安全漏洞。
模型定价维持原标准,实现加量不加价。
精华内容
Claude Opus 4.6的升级远不止于参数提升,它在核心能力与协作模式上的突破,正重新定义着AI的应用边界。
编程进阶
Claude Opus 4.6在Terminal-Bench 2.0编程评估中取得了最高分,其代码能力不再局限于简单任务。它能进行更周密的任务规划,在包含数百万行代码的大型代码库中稳定运行,代码审查与调试的精度也得到提升。
一个突出的亮点是它的自我纠错能力,能够自主发现并修复代码中的错误。此外,模型支持多语言编码,能够处理跨语言软件工程问题。官方数据显示,在执行代码库迁移这类复杂任务时,所需用时比以往减少了一半。
入侵办公
新模型正积极侵入传统办公领域,尤其对Office三件套进行了深度优化。在Cowork协作环境下,Opus 4.6可以代表用户自主执行多任务,例如一边进行复杂的财务数据分析,一边将研究成果整理成结构化文档。
这表明Anthropic正尝试将Claude从一个简单的聊天框工具,转变为能够深度融入工作流、独立完成知识工作的生产力平台,直接对标金融分析师、研究员等白领岗位。
推理飞跃
在跨领域复杂推理方面,Opus 4.6表现出了显著的进步。在“人类最后的考试”多学科推理测试中,它领先于所有其他前沿模型。在专业领域,它在法律BigLaw Bench(满分40%)上得分90.2%,并在衡量金融、法律等经济价值任务的GDPval-AA评测中,以144 Elo的优势超越OpenAI GPT-5.2。
更重要的是,这种智力飞跃并未牺牲安全性。模型不仅欺骗、奉承等负面行为极低,还解决了困扰业界的“过度拒绝”问题,对无害请求的回应更加自然流畅。
Agent实战
Opus 4.6的核心升级之一是Agent Teams,允许多个Claude实例并行协作,无需人类监督。一项压力测试中,16个Agent耗时两周,总成本不到2万美元,从零用Rust语言写出了一个10万行代码的C编译器,该编译器能在x86、ARM和RISC-V架构上编译Linux 6.9内核。
在网络安全领域,Opus 4.6的表现同样惊人。在无任何专门指令的情况下,它在一个沙箱环境中自主挖掘出超过500个此前未知的高危零日漏洞,展现了其在代码审计和安全研究方面的巨大潜力。
Claude Opus 4.6不仅展现了更强的单点能力,更通过Agent Teams开启了AI协作新范式。当AI能够独立完成复杂项目时,未来的工作形态将如何演变?