Anthropic 发布 Claude Sonnet 4.6,一次全面的性能升级。它在编程、计算机使用和复杂推理上表现突出,以 Sonnet 4.5 的成本,逼近 Opus 级别的智能,为专业人士和开发者提供了极具性价比的新选择。
智能速览
Sonnet 4.6 价格不变,性能全面超越前代,逼近顶级 Opus 模型。
编程能力显著提升,在 SWE-Bench Verified 基准中达到 79.6%。
计算机使用能力增强,能在模拟环境中完成多步骤复杂任务。
提供 100 万 token 超长上下文窗口,擅长长期规划和推理任务。
在智能体知识工作基准 GDPval-AA 上排名第一,但 token 消耗量也显著增加。
精华内容
Sonnet 4.6 的核心吸引力在于其性能与价格的精妙平衡,具体提升体现在多个关键领域。
编程能力飞跃
Claude Sonnet 4.6 在编程能力上实现了显著进步。其 SWE-Bench Verified 得分达到 79.6%,Terminal-Bench 2.0 得分为 59.1%,表现已非常接近更高级别的 Opus 模型。
在早期测试中,约 70% 的用户更偏好 Sonnet 4.6,认为它在理解上下文、整合代码逻辑和指令遵循方面表现更佳,幻觉和错误更少。甚至有 59% 的用户表示,相比 Opus 4.5,他们更倾向于选择 Sonnet 4.6。
计算机操作升级
Sonnet 4.6 的计算机使用能力得到明显增强,在 OSWorld 基准测试中达到 72.5 分,这一成绩已接近 Opus 4.6 的水平。
OSWorld 测试模拟真实计算机环境,要求模型通过点击鼠标和输入键盘操作 Chrome、VS Code 等软件。据反馈,Sonnet 4.6 已能以接近人类的水平完成复杂表格处理、多步骤表单填写等任务,实用性大幅提升。
推理与知识工作
在逻辑推理方面,Sonnet 4.6 在 ARC Prize 私有数据集上表现优异,ARC-AGI-1 达到 86.50%。更引人注目的是,在衡量智能体知识工作能力的 GDPval-AA 基准测试中,它以 1633 的 ELO 分数排名第一,略微领先 Opus 4.6,预期胜率超过 85%。
早期客户反馈,Sonnet 4.6 在前端代码和财务分析方面表现尤为出色,生成的可视化效果更精致,达到生产级质量所需的迭代次数也更少。
性能与成本
强大的性能背后也带来了更高的成本。在 GDPval-AA 基准测试中,Sonnet 4.6(自适应思考)的 token 使用量约为 2.8 亿,而 Sonnet 4.5(扩展思考)约为 5800 万。同等设置下,Opus 4.6 的 token 消耗量约为 1.6 亿,比 Sonnet 4.6 少约 40%。
这意味着,用户在享受更高智能水平的同时,也需要为更高的计算资源付出相应成本。
Claude Sonnet 4.6 的发布,标志着高性能 AI 模型正变得更加亲民。它在关键能力上的突破,尤其是接近顶级的综合表现,为 AI 的广泛应用打开了新的大门。它能否成为开发者和企业的主流选择?