当前位置:
转载文章详情

成本1/68,超越Opus?体验DeepSeek V3.1一夜后,我怀疑它有人格分裂

2025-08-22 11:42:26

这研究方向太有前景了,动态多模态伪造检测听着就高级,感觉能解决不少实际问题,必须分享一波

成本1/68,超越Opus?体验DeepSeek V3.1一夜后,我怀疑它有人格分裂
AI为你总结

全文概述

DeepSeek V3.1在编程能力、逻辑推理和成本效益方面表现出色,但物理模拟和视觉设计存在明显短板。其上下文窗口扩展至128K,编程能力超越Claude 4 Opus且成本仅为1/68。然而,在复杂算法和审美方面仍有待提升。

编程能力与成本效益

DeepSeek V3.1在Aider编程基准测试中得分高达71.6%,首次超过Claude 4 Opus,并且完成相同任务的成本仅为Opus的1/68。这使得它在开发实时音乐播放器等项目时表现优异,代码执行效率高且无需修改即可运行。

逻辑推理能力

在面对复杂的“星球殖民”问题时,V3.1展示了出色的逻辑推理能力,能够综合分析不同行星的优劣势并给出合理的建议。相比Gemini 2.5Pro,V3.1在数据细节上的阐述更为精准。

物理模拟与视觉设计

尽管V3.1在常规编程和推理任务中表现出色,但在处理需要精确物理引擎模拟的任务(如六边形内弹跳小球)时,表现不佳。此外,其生成的三维全息宇宙背景缺乏科技感和未来感,审美能力有待提高。

超长上下文稳定性

V3.1在处理超长上下文任务时出现了一些不稳定现象,例如在生成十万字小说的过程中突然中断并丢失历史输出。这种不稳定性表明其在长时间运行或处理大规模文本时可能存在技术缺陷。

架构变化与新功能

V3.1引入了新的特殊Token,如,增强了模型的思维链过程和原生搜索能力。这些改进使其在处理复杂问题和实时信息任务时更具优势。

展开 收起
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章
0
扫一下,分享更方便,购买更轻松