DeepSeek发布V3.1 Terminus版本,针对用户反馈进行精准优化。新版聚焦语言一致性与Agent能力提升,并在多项测评中取得显著进步,实用性大幅增强。
智能速览
聚焦语言一致性,解决中英文混杂问题
优化Code与Search Agent,工具调用更高效
Humanities Last Exam分数显著提升至21.7
BrowseComp能力大幅提升至38.5
全面覆盖APP、API及开源平台
精华内容
此次迭代虽非重构,但精准击中用户痛点,通过数据优化提升了模型的稳定性与实用性。
语言一致性优化
针对之前用户反馈的中英文混杂和异常字符问题,V3.1 Terminus进行了重点修复。模型输出的文本规整度大幅提高,无论是日常对话还是专业内容生成,都能有效减少干扰,提供更流畅的阅读体验。
Agent能力进阶
重点打磨了Code Agent和Search Agent的表现。对于需要借助模型完成专业任务的用户,新版在代码生成和信息检索等工具调用场景下的效率显著提升,能够更好地辅助复杂工作流。
核心测评表现
在非Agent及Thinking模式测评中,多项指标稳步提升。MAMLU Pro升至85.0,GPA Diamond增至80.7。特别是Humanities Last Exam,分数从15.9跃升至21.7,显示出模型在处理复杂问题上的突破。
综合能力数据
Agent测评方面表现亮眼,BrowseComp从30.0大幅提升至38.5,SimpleQA高达96.8。虽然部分指标如Codeforces略有波动,但整体优势依然突出。目前该版本已全渠道上线。
DeepSeek V3.1 Terminus通过精准优化,切实提升了模型的实用性与稳定性。对于关注AI工具效能的用户而言,此次更新值得关注与体验。