Anthropic 发布的 Claude Haiku 5.5 标志着其 5.5 家族矩阵的成型。作为该系列中主打轻量、高速和低成本的小型模型,Haiku 5.5 在保持高并发、低延迟优势的同时,实现了基准性能与成本控制的跨越,引发了行业对轻量级模型能力上限与性价比的广泛讨论。
从综合能力基准来看,Haiku 5.5 突破了以往小模型仅能处理简单简单文本的局限。在 Artificial Analysis Intelligence Index 测评中,该模型获得了 43 分的综合得分,相比一年前的前代产品大幅提升。在关键的自动化与编程能力项上,其计算机自动化操作能力在 OSWorld 2.1 测试中的得分从上一代的 15.7% 提升至 72.4%;在终端智能体编程测试 Terminal-Bench 4.0 中,得分也从前代接近于零的水平上升至约 39%。此外,在无工具辅助的跨学科综合推理测试中,其得分达到 45.9%。测评数据表明,尽管 Haiku 5.5 在绝对事实知识库的覆盖上略逊于部分竞争对手,但它展现出了较低的幻觉率,在面对未知知识时更倾向于承认无法回答,从而提升了自动化任务中的可信度。
价格与算力调优机制是 Haiku 5.5 测评中备受瞩目的核心要素。在定价策略上,针对单次请求在 10 万 Token 以内的常见场景(该类场景占历史调用的绝大多数),模型的输入与输出单价相比上一代直接下降了 90%,整体平均运行成本降低了约 75%。与降价同步引入的,还有首度在 Haiku 系列中搭载的可调节思考强度(Effort)参数与自适应思考功能。这改变了轻量模型单一的运行模式,使开发者能够根据具体任务的复杂度灵活调配算力,在快速响应、低成本输出与高准确率的深度推理之间自主寻找最佳平衡点。不过实际测试也显示,在最高思考强度下,模型消耗的 Token 数量会显著增加,因此在具体部署时仍需根据工况合理选择档位。
在实际应用落地与工作流设计方面,Haiku 5.5 被定位为大规模高频任务的执行引擎。它能够高效完成文本摘要、高通量数据分类、实时客服交互、数据整理以及浏览器自动化等轻量级场景。更重要的是,它被设计为复杂 Agent 架构中的子智能体(Sub-agent)。在这种多模型协同模式下,顶级模型负责总体规划与难题突破,而 Haiku 5.5 则承接拆解出来的密集型重复任务,从而大幅压低了长时运行工作流的整体账单。
综合各项测评表现来看,Haiku 5.5 的发布反映了当前大模型行业竞争焦点的转移。随着轻量级模型在计算机控制、代码执行和逻辑推理等核心能力上的补齐,“便宜够用”的门槛被重新划定。市场的评估标尺正逐渐从单纯的基准得分高低,转向单位成本下所能完成的实际有效工作量。Haiku 5.5 以极具竞争力的价格和显著提升的能力,为大规模商业化 Agent 的落地提供了更具性价比的技术选项。