成本暴降75%性能大跃升,Haiku5.5测试表现速览

源自23位全网作者

07:47

Anthropic推出的Claude Haiku 5.5在人工智能领域引发了广泛关注。作为该系列中主打轻量化和低成本的模型,Haiku 5.5不仅在性能上实现了相比前代的跨越式升级,更通过大幅度降低的使用成本,重新定义了小型模型在AI应用生态中的定位。以往被视为处理简单任务廉价选择的轻量模型,如今已演变为能够支撑复杂智能体高频执行的核心工具。

在基础规格与成本控制方面,Haiku 5.5表现出极高的性价比。对于10万Token以内的请求,其输入和输出价格分别为每百万Token 0.10美元和0.50美元,相比上一代Haiku 4.5降幅达90%;即使在超出10万Token的场景下,价格也比前代优惠约一半。根据官方估算,综合考虑绝大多数短上下文请求的实际比例,用户的总体运行成本平均可降低约75%。与此同时,Haiku 5.5的上下文窗口扩大到了100万Token,最大输出能力提升至12.8万Token,并首次引入了自适应思考与五档可调节的算力深度设置,使用户可以根据任务难度自由平衡成本与智能程度。

综合基准测试数据直观反映了Haiku 5.5的能力跃升。在权威机构Artificial Analysis的综合智能指数测试中,Haiku 5.5获得了43分的高分,较前代提升了26分,这一表现已微弱领先于GLM-5.3 Flash、Gemini 3.8 Flash以及GPT-6 Luna等同类轻量级模型。特别是在计算机与终端操作能力上,Haiku 5.5展现出了显著优势。在衡量电脑操作能力的OSWorld 2.1测试中,其成绩从上一代的15.7%暴涨至72.4%;而在终端代码交互测试Terminal-Bench 4.0中,它也从前代的零得分提升至39.2%,具备了相当扎实的桌面自动化与智能体编程执行能力。

在知识工作与代码表现方面,Haiku 5.5在GDPval-AA v2.1和AA-Briefcase v1.1中分别取得了1620分和1578分的成绩,FrontierCode 1.1代码测试得分达到46.4%,均处于同级别模型的领先水平。值得注意的是,该模型在事实性知识问答(如AA-Omniscience测试)中的绝对准确率并不算突出,仅为36%,但它的幻觉率显著低于行业平均水平。这主要是因为它更倾向于在不确定时直接承认不知道,而非盲目生成错误信息。

除了通用能力,Haiku 5.5在真实前沿科学工作流中的表现同样值得关注。测试显示,该模型已开始具备协助生命科学研究的能力,在生物信息学测试SpatialBench与SingleCellBench上分别拿到67.7%和56.2%的准确率,在实验流程理解上达到64.1%,部分指标甚至接近或超过了更高级别模型。不过测试也揭示了AI在科学研究上的边界:虽然它在RNA性质预测等分析任务中表现出色,但要求其独立设计全新RNA或在长期自适应实验中持续优化时,能力依然会出现下降。

综合来看,Haiku 5.5的发布展示了轻量模型演进的新方向。虽然在面临重度复杂推理和宏观规划任务时,它与Sonnet 5.5或Opus 5.5等高端主力模型仍有客观差距,但其凭借极低的部署成本、出色的自动化执行力以及对工具的灵活调用,成功搭建起了高频子任务执行层的支柱。这种“大模型负责思考规划、小模型负责高频干活”的协同架构,正在为智能体应用的规模化普及铺平道路。

内容由AI生成

精选参考来源

1. Claude Haiku 5.5发布——小模型生物研究员

Claude Haiku 5.5发布——小模型生物研究员 Claude Haiku 5.5 发布了。 这次最值得看的,不只是“小模型变强了”,而是 Anthropic 已经开始系统测试 Claude

2. Anthropic 把Claude 价格直接降 90%

Anthropic 把Claude 价格直接降 90% Anthropic 把 Claude 的“小模型”又往前推了一步 Claude Haiku 5.5 今天发布。它的定位很简单:快、便宜、适合

3. Haiku 5.5 与中国模型对比 | A÷送 token

Haiku 5.5 与中国模型对比 | A÷送 token Anthropic 这个 Haiku 5.5 真是盯着中国的这几个甜点级模型打,太恶心了! 我对比了一下它和几个中国竞品的价格和测试评

4. Anthropic最快、最便宜模型:Claude Haiku 5.5登场,运行成本较4.5低约75%

Anthropic最快、最便宜模型:Claude Haiku 5.5登场,运行成本较4.5低约75% Anthropic最快、最便宜模型:Claude Haiku 5.5登场,运行成本较4.5低约75

5. Haiku 5.5智指数涨26分

Haiku 5.5智指数涨26分 Anthropic发布Claude Haiku 5.5,在Artificial Analysis Intelligence Index上得分43,较一年前上代提升26

6. Haiku 5.5能对标哪一代的Sonnet甚至Opus?

Haiku 5.5能对标哪一代的Sonnet甚至Opus? 今天凌晨 Haiku 5.5 发布后,我很好奇这个身材最小、调用最便宜的小杯,如果拉回自家演进史里横向对比,到底能对标哪一年的 Opus 或

7. Claude Haiku5.5发布:这次小模型有点离谱!

Claude Haiku5.5发布:这次小模型有点离谱! 一句话总结:价格砍到 Haiku 4.5 的约 1/10,但不少能力已经摸到甚至超过 GPT-6 Luna。 几个比较值得看的数据:

8. Haiku 5.5 发布,又要吃掉一波Flash级模型

Haiku 5.5 发布,又要吃掉一波Flash级模型 首先,A/ 现在是真的卷。 Claude 5.5 这一代,大杯、中杯、小杯几乎连着发: 🔹 Opus 5.5:9 月 22 日 🔹 Sonn

9. Anthropic 又把小模型价格砍了一刀:直接降

Anthropic 又把小模型价格砍了一刀:直接降 Anthropic 发布 Claude Haiku 5.5。 Haiku 本来就是 Claude 家族里主打“快、便宜、跑量”的模型,这次最狠的不是

10. Haiku 5.5 降价,最难受的不是开发者,是那批“能力差一点,但胜在便宜”的二三流模型。 10万 Token 以...

Haiku 5.5 降价,最难受的不是开发者,是那批“能力差一点,但胜在便宜”的二三流模型。 10万 Token 以... Haiku 5.5 降价,最难受的不是开发者,是那批“能力差一点,但胜在

11. Haiku 5.5发布,Anthropic开始撒钱

Haiku 5.5发布,Anthropic开始撒钱 Haiku 5.5发布,Anthropic开始撒钱字母榜1791417350 前几天Claude刚增加了简体中文界面,这会儿国庆假期刚过,Anthr

12. Claude开启价格战!比Deepseek还低

Claude开启价格战!比Deepseek还低 Haiku 5.5来了,支持100万上下文。标准API按提示长度分档:不超过10万tokens,每百万输入/输出是$0.10/$0.50;超过后是$0.

13. 中国大模型的斩杀线,被斩杀了

中国大模型的斩杀线,被斩杀了 文|Sleepy 10 月 8 日,Anthropic 发布 Haiku 5.5。对于不超过 10 万 token 的短请求,每百万 token 输入收 0.1 美元、

14. Haiku 击败 DeepSeek,成为新的性价比之王

Haiku 击败 DeepSeek,成为新的性价比之王 Haiku 击败 DeepSeek,成为新的性价比之王 一直以来在我们的测试中,DeepSeek 都是性价比最高的选择。 我们在 motio

15. Claude Haiku 5.5发布:价格暴降90%!

Claude Haiku 5.5发布:价格暴降90%! 10月7日,Anthropic 正式发布 Claude Haiku 5.5,号称自家迄今最便宜、最快、能力最强的小模型。 这次值得关注的,不

16. 📖Claude模型先HAIKU再S哥O姐

📖Claude模型先HAIKU再S哥O姐 Hello大家好,这里是小钥的AI尝试日记02📓Claude模型比别家更多,更有选择,但tokens也更贵,我们该怎么选呢? ✨先说一个我和Claude聊

17. Claude四个模型怎么选?一张表看懂

Claude四个模型怎么选?一张表看懂 对比Claude四个模型:Fable 5.1、Opus 5.5、Sonnet 5.5、Haiku 4.5。 复杂任务看判断能力,日常任务看速度和成本。

18. Claude Haiku 5.5 测评报告!究竟有多能打

Claude Haiku 5.5 测评报告!究竟有多能打 测评 Claude Haiku 5.5实测报告出炉!我把思考模式拉到High,看看这号称性价比之王的模型到底有多强?先来个硬核指令测试——从1

19. 使用claude code时出现的隐藏模型调用

使用claude code时出现的隐藏模型调用 今天用 Claude Code 的碰见了个诡异情况:/model 里选的是 Opus,翻日志却冒出一行 claude-haiku-4-5,卧槽,我被🀄转

20. Claude最强迷你模型登场,价格暴降90%,直逼DeepSeek?

Claude最强迷你模型登场,价格暴降90%,直逼DeepSeek? Claude最强迷你模型登场,价格暴降90%,直逼DeepSeek?智东西1791442871 智东西编译 | 程茜编辑 | 云鹏

21. Opus 5.5感受

Opus 5.5感受 满分一百分我给打95,属于跨时代的作品了,不完美但是足够震撼: 1. 思维很敏捷,而且不跟用户抬杠(说的就是你opus5)… 2. coding非常强,一些疑难杂症之前o5鬼打墙

22. 突发,Sonnet 5.5偷跑,实测碾压GPT-6 Sol直逼Astra

突发,Sonnet 5.5偷跑,实测碾压GPT-6 Sol直逼Astra 突发,Sonnet 5.5偷跑,实测碾压GPT-6 Sol直逼Astra36氪1790568012 谁能想到,Opus 5.5

23. Opus 5.5 刚刚发布,有点夯啊

Opus 5.5 刚刚发布,有点夯啊 虽然不喜欢这个公司,但不得不承认模型确实厉害。 Opus 5.5 Terminal-Bench从52.3%涨到66.4%, API输入、输出单价还各降了20%
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章