继旗舰模型 Opus 5.5 发布后不久,Anthropic 于 9 月 28 日正式推出了 Claude 5.5 家族的第二款模型——Claude Sonnet 5.5。作为主打高效率与性价比的“主力干活”模型,Sonnet 5.5 的推出进一步补齐了 Anthropic 的产品线矩阵。在整体架构定位上,Sonnet 5.5 并非旨在全面取代高端旗舰,而是通过更快的响应速度和更高效的资源利用率,承接日常开发、文档办公和高频交互等日常主力场景。
从实际表现与各项基准测试来看,Sonnet 5.5 展现出了跨越式的能力提升,尤其是在编程与智能体任务上表现亮眼。在命令行智能体编程测试 Terminal-Bench 4.0 中,Sonnet 5.5 的得分从上一代 Sonnet 5 的 10.3% 暴涨至 70.6%,在部分特定的智能体编码场景中,其成绩甚至越过了旗舰模型 Opus 5.5。在 CursorBench 等贴近真实开发环境的测试中,它也展现出极强的代码直觉与多文件协同处理能力。此外,Sonnet 5.5 在图像识别与视觉操控方面也有显著进步,不仅能更加精准地读取复杂图表,还能仅依靠屏幕截图完成连续的游戏操作。在日常办公领域,它还表现出更好的美学品味与设计感,能够遵循模板快速生成格式精美的幻灯片和电子表格。
速度与成本控制是 Sonnet 5.5 的重要升级点。官方数据显示,该模型的输出生成速度相比 Sonnet 5 提升了 30% 以上,是目前速度最快的 Sonnet 模型。在定价策略上,Sonnet 5.5 的 API 标价与上一代持平,即输入每百万 Token 2 美元,输出每百万 Token 10 美元,价格刚好是 Opus 5.5 的一半。虽然单价未降,但由于模型在理解与执行任务时变得更加聪明,能够将多个工具调用合并打包、减少无效交互,因此完成同等任务所需的 Token 和步骤大幅缩减,常规场景下的单任务综合成本最高可降低 30%。
不过,开发者在实际使用中也需要注意“思考力度”(Effort Level)的调节。如果在复杂任务中将思考档位拉至最高(Max),模型会进行多轮深度自检和子智能体拆解,导致输出 Token 量剧增,此时单任务成本也会随之抬升。因此,在日常办公和常规代码修复等任务中,保持默认或中低档位能获得最高的性价比。
除了性能与效率的优化,Sonnet 5.5 还在安全防护和技术保护方面进行了针对性升级。它是首款搭载了与旗舰模型同级别网络安全防护及自动回退机制的 Sonnet 模型,在遇到高风险网络安全或生物领域请求时,系统会自动退回至前代防护机制进行处理,而常规软件开发和科研使用则不受影响。同时,为了防止恶意批量套取模型内部推理逻辑(即模型蒸馏),Sonnet 5.5 首次引入了防推理抽取分类器,并将模型生成的思考过程与用户账号进行绑定,进一步筑牢了技术防护墙。
综合来看,评价 9 月 28 日发布的 Claude Sonnet 5.5,可以将其视为大模型研发“能力下放”与“实用主义”趋势下的代表作品。它表明大模型竞赛正逐步从单纯追求顶级跑分,转向拼速度、拼稳定性以及真实工作流中的综合效能。随着后续轻量级模型 Haiku 5.5 的推出,Claude 5.5 家族将形成由 Opus 负责深度推理、Sonnet 承担高频主力、Haiku 覆盖高并发低成本场景的清晰分工。对于大多数开发者和企业用户而言,Sonnet 5.5 以极具竞争力的实际成本提供了接近前沿水平的综合生产力,成为了日常 AI 工作流中极具实操价值的选择。