张大妈

Claude 5史诗级泄露,史上最强编程模型评测炸裂!核心秘密曝光

源自知乎:新智元

02-05 03:06

Anthropic的新模型Claude Sonnet 5(代号Fennec)信息遭泄露,其性能超越前代旗舰Opus 4.5,价格却降低一半。更关键的是,它引入了“自动开发团队”模式,能自我组织多个子智能体并行协作完成开发任务,直指开发者对现有AI模型“慢且贵”的痛点,或将成为软件工程领域的分水岭。

Claude 5史诗级泄露,史上最强编程模型评测炸裂!核心秘密曝光智能速览

  • Claude Sonnet 5 (Fennec) 性能超越Opus 4.5,但价格降低50%。

  • 拥有100万token上下文窗口,能处理完整项目代码库。

  • 在SWE-Bench基准测试中得分超过80.9%,能独立完成大部分工程任务。

  • 首创“Dev Team”蜂群模式,能自动创建多个子智能体并行开发。

  • 该模式可自我组织,生成新智能体,并输出工程管理级别的报告。

Claude 5史诗级泄露,史上最强编程模型评测炸裂!核心秘密曝光精华内容

此次泄露的核心不仅在于性能提升,更在于一种全新的协作模式。Claude 5试图将一个完整的开发团队封装进模型中,这或许是AI编程领域的一次范式升级。

性能越级,成本减半

根据泄露信息,Claude Sonnet 5在多项内部基准测试中已全面超越前代旗舰Claude Opus 4.5。令人意外的是,其定位是中端的Sonnet系列,却拥有旗舰级的性能。在关键的SWE-Bench测试中,它的得分超过80.9%,远高于此前74.4%的最高纪录,意味着它能独立处理修复bug、重构代码、补充测试等多数软件工程师的日常工作。

更吸引人的是,其推理成本显著下降,价格仅为Opus 4.5的50%。这得益于该模型直接在谷歌TPU上进行训练和优化。同时,它还拥有100万token的上下文窗口和更快的运行速度,让开发者可以把整个项目代码库输入模型,进行全局理解和操作。

蜂群模式:AI自建开发团队

真正引发关注的是其“Dev Team”模式,也被称为“蜂群”功能。这不再是简单的代码生成工具,而是一个能自我组织的开发团队。在收到指令后,Sonnet 5会自动创建一个总指挥AI和多个专业子智能体,例如Team Leader、Front-end Builder、Backend Builder和QA Tester。

这些智能体并行工作,互相通信和校验,共同完成复杂任务。例如,在创建一个Web前端工具的任务中,模型最初创建了5个智能体,随着任务推进,它又动态生成了PI Server Agent、CSS专项Agent等,全程无需人工干预。

从编码到交付的进化

Sonnet 5的进化体现在它不再是单纯地“写代码”,而是直接“交付代码”。在蜂群模式下,模型最终输出的是完整可用、可测试、可迭代的功能模块。这种模式实现了从需求到成品的全流程自动化。

任务结束后,它还会生成项目总结和执行报告,达到了工程管理的产出级别。这种能够理解全局、分解任务、并行执行并自我迭代的模式,标志着AI编程从辅助工具向独立开发系统演进。

竞争背后的资本底气

Anthropic选择在此时发布Sonnet 5,被认为是正面迎战同样在发力编程领域的OpenAI。这份底气来源于其强大的资本实力。2026年1月底,Anthropic完成了超100亿美元的融资,估值高达3500亿美元。

此外,市场数据也显示其势头正劲。据Menlo Ventures报告,Anthropic在企业市场的占有率已达40%,远超OpenAI的27%。近期其推出的Cowork已引发行业震动,此次Sonnet 5的发布,或将进一步巩固其领先地位。

Claude Sonnet 5的出现,结合了越级的性能、更低的成本和革命性的多智能体协作模式,预示着AI编程将进入一个新阶段。它不再只是一个高效的编码助手,而是一个能自我组织的虚拟开发团队。这究竟是编程工具的又一次进化,还是软件工程范式的根本性转折点,答案即将揭晓。

Claude 5史诗级泄露,史上最强编程模型评测炸裂!核心秘密曝光关键评论

  • 有资深用户对消息来源的可信度提出质疑,认为爆料需谨慎看待。

  • 部分开发者认为SWE-Bench超过80.9%的得分,可能仅是与前代Opus 4.5持平的水平。

  • 也有观点指出,文中的部分功能已有其他开源项目实现,并非首创。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章