Claude 4.1 Opus发布,编程能力再进化,“更大改进”还在后面?

2025-08-10 14:40:06

新模型编程能力提升明显,尤其在代码重构和调试上的表现,对开发者来说实用性很强,值得关注

Claude 4.1 Opus发布,编程能力再进化,“更大改进”还在后面?
AI为你总结

全文概述

Anthropic发布了Claude 4.1 Opus,显著提升了编程、智能体任务和推理能力。新模型在编程基准测试中表现优异,尤其在SWE-bench Verified和Terminal-Bench中超越了竞争对手。此次发布旨在强化AI编程市场的护城河,并为即将到来的竞争做准备。

编程能力提升

Claude 4.1 Opus在软件工程基准测试SWE-bench Verified中得分74.5%,相比前代提升了2个百分点,超过OpenAI的o3模型和谷歌Gemini 2.5 Pro。在代理终端编程测试Terminal-Bench中,得分43.3%,比前代提高了4.1个百分点,远超竞争对手。

智能体任务改进

新模型增强了执行复杂任务的智能体能力,在多文件代码重构等复杂任务上表现出色。日本电商巨头乐天集团反馈称,新模型能精准定位并修正问题,避免引入新的错误,极大提升了调试效率。

推理能力保持稳定

尽管在编程领域取得了显著进展,Claude 4.1 Opus在研究生水平推理能力GPQA Diamond测试中的表现与前代持平,落后于Gemini 2.5 Pro和OpenAI o3。这表明其改进主要集中在编程领域。

商业表现及未来计划

Anthropic年化经常性收入从10亿美元增至接近50亿美元,驱动增长的核心是其在AI编程领域的技术壁垒。公司正在进行一轮高达50亿美元的融资,计划在未来几周内发布更大幅度的模型改进,以应对即将到来的GPT-5竞争。

展开 收起
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章
0
扫一下,分享更方便,购买更轻松