张大妈

DeepSeek 1M上下文新模型灰度实测|所有Prompt直接复制,差距一眼看懂

源自公众号:昱汐AI

02-11 22:17

DeepSeek 悄然推出 1M 上下文新模型,一场围绕其实力的实测已经展开。通过复制八个高难度提示词,从经典逻辑题到复杂代码生成,直接对比了它与市场主流模型的表现差距。这次评测旨在揭示新模型在真实应用场景下的能力边界,为开发者和技术爱好者提供一份详尽的参考。

DeepSeek 1M上下文新模型灰度实测|所有Prompt直接复制,差距一眼看懂智能速览

  • 新版 DeepSeek 核心参数升级至 1M 上下文,知识截止至2025年5月。

  • 在经典逻辑推理题中,新版 DeepSeek 表现出超越竞品的“人间清醒”水平。

  • 代码生成能力中规中矩,但在可玩性游戏生成任务中表现惊艳。

  • 面对富文本编辑器、企业官网等复杂网页生成任务,表现弱于 Gemini 3 Pro。

  • 在顶级动效网站和 3D 可视化页面的生成上,与专业水准仍有差距。

DeepSeek 1M上下文新模型灰度实测|所有Prompt直接复制,差距一眼看懂精华内容

为了探究新模型的真正实力,直接复制了八个高难度 Prompt,在不同维度上进行了硬核对比,结果一目了然。

逻辑推理测试

在经典的“50米洗车店开车还是走路”问题中,多数大模型仍倾向于给出“锻炼身体”这类绕圈子的答案。新版 DeepSeek 则表现出色,言简意赅地给出了最符合常识的结论,直接通关了这道困扰许多 LLM 的灵魂拷问,展现了其在基础逻辑和现实理解上的进步。

代码与游戏生成

在代码生成能力上,新模型的表现中规中矩。测试生成游戏手柄 SVG 图像时,其结果虽专业但整体观感仍不如 Kimi 出色。然而,在更具挑战性的任务上,如通过一句 Prompt 生成一个完整的可玩台球游戏,新版 DeepSeek 成功交付了一个逻辑完整、真实可玩的 HTML 文件,展现了其在复杂逻辑构建方面的潜力。

DeepSeek 1M上下文新模型灰度实测|所有Prompt直接复制,差距一眼看懂

复杂网页设计挑战

当挑战升级到生成 Word 级别的富文本编辑器、企业官网乃至 AAA 游戏宣传页时,新版 DeepSeek 显得有些吃力。在生成富文本编辑器和企业级落地页的任务中,其表现弱于 Gemini 3 Pro。面对顶级工作室风格的炫酷网站和奢侈品级的 3D 智能手表官网这类需要高度定制化动效和设计的任务,新模型目前还无法达到专业水准,暴露了其在高端设计实现上的短板。

总体来看,DeepSeek 新模型在基础逻辑和复杂代码构建上取得了显著进步,但在高阶设计和创意实现方面仍有提升空间。随着国产大模型竞争日益激烈,这次更新为行业带来了新的活力,未来的迭代更值得期待。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章