Anthropic发布Opus 5,性能逼近Fable 5价格减半

源自41位全网作者

13:35

精选参考来源

1
盘点一周AI大事(7月19日)|Kimi K3击败GPT Kimi发布SOTA开源大模型「Kimi K3」 Thinking Machines 开源万亿参数大模型「Inkling」 Bolt开源最美PPT制作技能「bolt-slides」 OpenMOSS开源实时视觉模型「MOSS-VL-Realtime」 PrismML 正式放出1bit模型「Bonsai 27B」 英伟达发布机器人上下文扩展模型「RoboTTT」 英伟达开源图像超分模型「PiD 1.5」 阿里开源跳舞视频模型「Wan-Dancer-14B」 阿里升级直播数字人模型「Wan-Streamer v0.3」 研究员开源极速视频生成模型「MobileWan」 工程师开发出灭蚊机器人「Tornyol」 #抖音前沿科技首发计划 #vibecoding大赏 #AI新星计划 #AI #AIGC
2
Anthropic 今天发布了 Claude Opus 5。API 价格为每百万输入 Token 5 美元、输出 Token 25 美元,与上一代 Opus 4.8 完全相同,但只有 Fable 5 的一半。官方给出的定位是:以一半的价格,提供接近 Fable 5 的前沿智能。Fable 5 是 Anthropic 于 6 月 9 日发布的最强公开模型,输入、输出价格分别为每百万 Token 10 美元和 50 美元,是史上最昂贵的通用模型。同一底座的 Mythos 5 则只向 Project Glasswing 的少数合作伙伴开放。【1】性能在 Frontier-Bench v0.1 上,Opus 5 的成绩是 Opus 4.8 的两倍多,单任务成本反而更低。在 CursorBench 3.2 上,使用最高 Effort 档时,它与 Fable 5 峰值成绩的差距不到 0.5%,每项任务的成本却只有后者的一半。【注:Effort 是可调节的思考强度档位。档位越高,模型思考得越多,价格也越高。】ARC-AGI 3 测试的是模型解决未见过的新题的能力,Opus 5 的得分达到第二名模型的三倍。Zapier AutomationBench 测试的是模型能否将一项业务从头到尾完整执行;在成本相同的情况下,Opus 5 的任务通过率约为第二名的 1.5 倍。即使使用最低 Effort 档,它完成的任务也比其他所有模型更多。在电脑操作评测 OSWorld 2.0 上,它仅用 Fable 5 三分之一出头的成本,就超过了后者的最佳成绩。在有机化学任务上,Opus 5 比 Opus 4.8 高出 10.2 个百分点;在蛋白质相关任务上,则高出 7.7 个百分点。【2】几个比分数更能说明问题的例子有一道题给了 Opus 5 一张机械零件图纸,要求它编写代码,在 FreeCAD 中重建三维模型,但故意不让模型直接“看”图。Opus 5 自己编写了一套计算机视觉流程,从原始像素中提取几何形状,再还原出整个零件,而且能够反复成功。同样配置下,其他模型尝试五次都没能完成。在一个开源包管理器的真实 Bug 中,社区补丁遗漏了一个边界情况。Opus 5 找到了根因,并补上了这个缺口;对照模型则只修复了表面症状,随后便宣布 Bug 已解决。一位交易公司的工程师使用 Opus 5,在一个会话中完成了新交易所的行情数据接入。由于找不到实时数据进行验证,Opus 5 便自行搭建了一套测试框架,用来检查解析结果是否正确。【3】谁现在就能用Claude Max 的默认模型已经切换为 Opus 5,Pro 用户目前能够使用的最强模型也是它。开发者可以通过 `claude-opus-5` 调用 API。Fast 模式的速度约为普通模式的 2.5 倍,价格则翻倍。此次上线的两个 Beta 功能,对开发 Agent 的人很有实际价值。一是对话进行到一半时,即使更换工具,也不会导致 Prompt 缓存失效。过去只要修改一次工具列表,整段缓存就会作废,成本随即上升。二是 API 可以启用自动降级功能。被安全分类器拦截的请求会自动转交给其他模型处理,而不是直接失败。【4】安全与拦截Anthropic 表示,Opus 5 是其迄今为止对齐程度最高的模型。在自动化行为审计中,它的综合失准得分为 2.3,低于 Opus 4.8、Sonnet 5 和 Fable 5,欺骗行为所占比例也是最低的。网络安全部分有一个值得注意的细节:Anthropic 刻意没有使用网络攻防任务训练 Opus 5,但随着通用能力提升,它发现漏洞的水平已经接近 Mythos 5。不过,在将漏洞转化为可用攻击代码方面,两者仍有很大差距。安全分类器允许 Opus 5 在源代码中寻找漏洞,但会拦截二进制层面的漏洞扫描、渗透测试和 Exploit 生成。它的拦截频率比 Fable 5 低约 85%。在 Claude.ai、Claude Code 和 Cowork 中,被拦截的请求默认会回退至 Opus 4.8。生物领域的限制则有所放宽:原本在 Fable 5 上被拦截的生物类请求,现在会转交给 Opus 5,而不是此前的 Opus 4.8。Anthropic 称,Opus 5 是目前面向科研场景能力最强的公开模型,但它在长时间自主研究任务上仍存在明显限制。
全部
来源
内容由AI生成

精选参考来源

1. 盘点一周AI大事(7月19日)|Kimi K3击败GPT Kimi发布SOTA开源大模型「Kimi K3」 Thinking Machines 开源万亿参数大模型「Inkling」 Bolt开源最美PPT制作技能「bolt-slides」 OpenMOSS开源实时视觉模型「MOSS-VL-Realtime」 PrismML 正式放出1bit模型「Bonsai 27B」 英伟达发布机器人上下文扩展模型「RoboTTT」 英伟达开源图像超分模型「PiD 1.5」 阿里开源跳舞视频模型「Wan-Dancer-14B」 阿里升级直播数字人模型「Wan-Streamer v0.3」 研究员开源极速视频生成模型「MobileWan」 工程师开发出灭蚊机器人「Tornyol」 #抖音前沿科技首发计划 #vibecoding大赏 #AI新星计划 #AI #AIGC

2. Anthropic 今天发布了 Claude Opus 5。API 价格为每百万输入 Token 5 美元、输出 Token 25 美元,与上一代 Opus 4.8 完全相同,但只有 Fable 5 的一半。官方给出的定位是:以一半的价格,提供接近 Fable 5 的前沿智能。Fable 5 是 Anthropic 于 6 月 9 日发布的最强公开模型,输入、输出价格分别为每百万 Token 10 美元和 50 美元,是史上最昂贵的通用模型。同一底座的 Mythos 5 则只向 Project Glasswing 的少数合作伙伴开放。【1】性能在 Frontier-Bench v0.1 上,Opus 5 的成绩是 Opus 4.8 的两倍多,单任务成本反而更低。在 CursorBench 3.2 上,使用最高 Effort 档时,它与 Fable 5 峰值成绩的差距不到 0.5%,每项任务的成本却只有后者的一半。【注:Effort 是可调节的思考强度档位。档位越高,模型思考得越多,价格也越高。】ARC-AGI 3 测试的是模型解决未见过的新题的能力,Opus 5 的得分达到第二名模型的三倍。Zapier AutomationBench 测试的是模型能否将一项业务从头到尾完整执行;在成本相同的情况下,Opus 5 的任务通过率约为第二名的 1.5 倍。即使使用最低 Effort 档,它完成的任务也比其他所有模型更多。在电脑操作评测 OSWorld 2.0 上,它仅用 Fable 5 三分之一出头的成本,就超过了后者的最佳成绩。在有机化学任务上,Opus 5 比 Opus 4.8 高出 10.2 个百分点;在蛋白质相关任务上,则高出 7.7 个百分点。【2】几个比分数更能说明问题的例子有一道题给了 Opus 5 一张机械零件图纸,要求它编写代码,在 FreeCAD 中重建三维模型,但故意不让模型直接“看”图。Opus 5 自己编写了一套计算机视觉流程,从原始像素中提取几何形状,再还原出整个零件,而且能够反复成功。同样配置下,其他模型尝试五次都没能完成。在一个开源包管理器的真实 Bug 中,社区补丁遗漏了一个边界情况。Opus 5 找到了根因,并补上了这个缺口;对照模型则只修复了表面症状,随后便宣布 Bug 已解决。一位交易公司的工程师使用 Opus 5,在一个会话中完成了新交易所的行情数据接入。由于找不到实时数据进行验证,Opus 5 便自行搭建了一套测试框架,用来检查解析结果是否正确。【3】谁现在就能用Claude Max 的默认模型已经切换为 Opus 5,Pro 用户目前能够使用的最强模型也是它。开发者可以通过 `claude-opus-5` 调用 API。Fast 模式的速度约为普通模式的 2.5 倍,价格则翻倍。此次上线的两个 Beta 功能,对开发 Agent 的人很有实际价值。一是对话进行到一半时,即使更换工具,也不会导致 Prompt 缓存失效。过去只要修改一次工具列表,整段缓存就会作废,成本随即上升。二是 API 可以启用自动降级功能。被安全分类器拦截的请求会自动转交给其他模型处理,而不是直接失败。【4】安全与拦截Anthropic 表示,Opus 5 是其迄今为止对齐程度最高的模型。在自动化行为审计中,它的综合失准得分为 2.3,低于 Opus 4.8、Sonnet 5 和 Fable 5,欺骗行为所占比例也是最低的。网络安全部分有一个值得注意的细节:Anthropic 刻意没有使用网络攻防任务训练 Opus 5,但随着通用能力提升,它发现漏洞的水平已经接近 Mythos 5。不过,在将漏洞转化为可用攻击代码方面,两者仍有很大差距。安全分类器允许 Opus 5 在源代码中寻找漏洞,但会拦截二进制层面的漏洞扫描、渗透测试和 Exploit 生成。它的拦截频率比 Fable 5 低约 85%。在 Claude.ai、Claude Code 和 Cowork 中,被拦截的请求默认会回退至 Opus 4.8。生物领域的限制则有所放宽:原本在 Fable 5 上被拦截的生物类请求,现在会转交给 Opus 5,而不是此前的 Opus 4.8。Anthropic 称,Opus 5 是目前面向科研场景能力最强的公开模型,但它在长时间自主研究任务上仍存在明显限制。

3. Claude Opus 5 被曝今晚发布,Fable 5 的水平,腰斩的价格

4. 实测千问Qwen3.8 预览版,国产模型开始围攻 Fable 5

5. Kimi K3 突然爆火!实测到底有多强?100%开源,模型已被越狱!直逼 Claude Fable 5 / GPT-5.6 | 零度解说

6. 这个视频时一场由 Simon Willison 主持的 51 分钟炉边谈话,嘉宾为 Anthropic 的 Cat Wu (产品负责人)和 Thariq Shihipar。谈话围绕 Claude Code、Claude Fable 和 Claude Tag 三款产品的最新进展,以及 Anthropic 内部的工程文化与安全实践展开。里面提到Fable 让很多用例可以一次性(oneshot)完成功能。系统提示词因此削减了 80%——去掉过度约束和示例,转向"多给上下文、少给禁令",更多依赖模型自身的判断力。面对工作被模型取代的危机,嘉宾的建议是"变得更有野心"——比如把整个 bun 用 Rust 重写、用 Fable 一次性完成复杂视频剪辑(自动转录、动态裁剪、追踪演讲者、生成动画),以及用 Claude Code 做街霸格斗游戏和攀岩路线规划应用 (用不起啊。。)#How I AI# 蚁工厂的微博视频

7. Claude Opus 5 今晚正式发布?

8. 神秘Opus 5意外曝光!达里奥紧急开会

9. Claude Opus 5或在24小时内发布

10. Opus5发布,Codex周四打算重置一次?

11. 独家爆料刷屏全网:Claude Opus 5本周空降?Fable配额三次跳票后深夜惊魂下架!

12. 谷歌启动Gemini 4最大预训练、 Gemini 3.5 Pro 开始预览测试、Claude Opus 5本周或下周发布 | 7月22日 AI日报

13. 凌晨惊魂:Fable 5被曝提前两天下架!Anthropic连夜改口甩声明,仓促端出“平替”Opus 5能扛住GPT-6和Kimi的绞杀吗?

14. Claude Opus 5、GPT 5.6 Sol Ultra发布在即

15. 突发:Claude Opus 5 预计下周三发布 昨天Claude估值暴跌 最近先被gtp5.6压制,然后又被kimi k3冲击 自身价格又贵,A社现在压力巨大 急需一个差不多价格的模型出来干仗,Opus 5明显就不错。 而且还要快点出来,隔壁gpt用户突破800万,还在上涨,抢用户得趁早。 所以很多人都觉得下周应该就要出新模型了。 最近各个模型更新频率都变快了。 AI之争,慢一步,想追赶可就不容易了

16. Claude最强模型死期曝光,Anthropic连夜改判:Opus 5仓促救场,低价用户先出局!

17. 传言称 Opus 5 周四发布

18. Claude Fable一夜“消失”,用户连夜哭喊完了!独家爆料人赌上Opus 5空降,转头却被Anthropic打脸

19. Claude Opus 5未发先火:它真能用更少Token,击败GPT-5.6吗?

20. Claude Opus 5 要来了?

21. 突发,Claude Fable 5下线,这是要给Opus 5让道?

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章