2月14日,字节跳动正式发布了豆包大模型2.0(Doubao-Seed-2.0)系列,这是豆包大模型自正式发布以来的首次大版本跨代升级。此次更新并非孤立进行,在此之前,字节已先后发布了备受关注的视频生成模型Seedance 2.0和图像创作模型Seedream 5.0 Lite。这一系列动作标志着字节跳动在多模态AI领域实现了从基础模型到图像、视频创作的全链路技术布局。
豆包大模型2.0的核心目标是更好地执行真实世界的复杂任务,为此针对大规模生产环境的使用需求进行了系统性优化。为了灵活适配各类业务场景,新版本推出了一个包含多款模型的“全家桶”矩阵:
* 豆包2.0 Pro:作为旗舰版本,面向深度推理和长链路任务执行场景,其性能对标国际顶尖模型。
* 豆包2.0 Lite:在性能与成本之间取得平衡,其综合能力已超越上一代主力模型豆包1.8。
* 豆包2.0 Mini:主要面向对延迟、并发和成本要求较高的轻量级应用场景。
* 豆包2.0 Code:专为编程场景打造的优化模型,与字节的AI编程工具TRAE结合使用效果更佳。
在功能和体验上,豆包大模型2.0带来了多项显著升级。
模型向“智能体(Agent)”方向进化,强化了复杂任务的执行能力。新模型不再仅仅是一个聊天工具,而是更像一个能执行复杂任务的“数字员工”。它在长程任务规划、多轮指令遵循、工具调用和搜索能力上显著增强,能够更好地理解和执行包含多个步骤和约束的复杂指令,在数据分析、智能客服等企业级场景中表现出色。

多模态理解能力实现全面跃升。豆包2.0在视觉理解方面表现突出,能够更精准地解析复杂的文档、表格、图表乃至视频内容。评测显示,其在视觉推理、空间感知和长视频理解等多个方面达到了世界顶尖水平。例如,模型可以分析实时视频流,实现环境感知和主动交互,为健身指导、穿搭建议等生活场景提供了新的可能性。同时,其非结构化文档处理能力,如从扫描版PDF或图片中提取信息,也对办公场景非常实用。

再者,推理、数学和编程等核心基础能力大幅增强。豆包2.0 Pro在多个国际数学和编程竞赛的基准测试中取得了金牌成绩,展现了强大的逻辑推理能力。它还加强了对科学、健康等“长尾领域”知识的覆盖,并通过融入实时检索功能,确保了信息输出的时效性和准确性。专用的Code模型则显著提升了代码能力,尤其在前端开发领域,能够辅助开发者快速构建复杂的互动应用。
极具竞争力的成本优势是本次升级的另一大亮点。官方信息显示,豆包2.G系列模型在保持与业界顶尖模型相当性能的同时,token定价降低了约一个数量级。例如,豆包2.0 Pro的输入定价为3.2元/百万tokens(32k上下文内),而Lite版本的输入价格仅为0.6元/百万tokens。在需要大规模推理和长链路生成的复杂任务中,这一成本优势将极大降低企业和开发者的使用门槛。

目前,普通用户可以通过豆包App、电脑客户端或网页版的“专家模式”体验到豆包2.0 Pro模型。而企业和开发者则可以通过火山引擎平台接入豆包2.0全系列模型的API服务。此次升级,豆包大模型正从一个对话工具,向一个能够深入真实生产环境、解决复杂问题的实用AI能力平台迈进。