DeepSeek 悄然推出 1M 上下文新模型,一场围绕其实力的实测已经展开。通过复制八个高难度提示词,从经典逻辑题到复杂代码生成,直接对比了它与市场主流模型的表现差距。这次评测旨在揭示新模型在真实应用场景下的能力边界,为开发者和技术爱好者提供一份详尽的参考。
智能速览
新版 DeepSeek 核心参数升级至 1M 上下文,知识截止至2025年5月。
在经典逻辑推理题中,新版 DeepSeek 表现出超越竞品的“人间清醒”水平。
代码生成能力中规中矩,但在可玩性游戏生成任务中表现惊艳。
面对富文本编辑器、企业官网等复杂网页生成任务,表现弱于 Gemini 3 Pro。
在顶级动效网站和 3D 可视化页面的生成上,与专业水准仍有差距。
精华内容
为了探究新模型的真正实力,直接复制了八个高难度 Prompt,在不同维度上进行了硬核对比,结果一目了然。
逻辑推理测试
在经典的“50米洗车店开车还是走路”问题中,多数大模型仍倾向于给出“锻炼身体”这类绕圈子的答案。新版 DeepSeek 则表现出色,言简意赅地给出了最符合常识的结论,直接通关了这道困扰许多 LLM 的灵魂拷问,展现了其在基础逻辑和现实理解上的进步。
代码与游戏生成
在代码生成能力上,新模型的表现中规中矩。测试生成游戏手柄 SVG 图像时,其结果虽专业但整体观感仍不如 Kimi 出色。然而,在更具挑战性的任务上,如通过一句 Prompt 生成一个完整的可玩台球游戏,新版 DeepSeek 成功交付了一个逻辑完整、真实可玩的 HTML 文件,展现了其在复杂逻辑构建方面的潜力。

复杂网页设计挑战
当挑战升级到生成 Word 级别的富文本编辑器、企业官网乃至 AAA 游戏宣传页时,新版 DeepSeek 显得有些吃力。在生成富文本编辑器和企业级落地页的任务中,其表现弱于 Gemini 3 Pro。面对顶级工作室风格的炫酷网站和奢侈品级的 3D 智能手表官网这类需要高度定制化动效和设计的任务,新模型目前还无法达到专业水准,暴露了其在高端设计实现上的短板。
总体来看,DeepSeek 新模型在基础逻辑和复杂代码构建上取得了显著进步,但在高阶设计和创意实现方面仍有提升空间。随着国产大模型竞争日益激烈,这次更新为行业带来了新的活力,未来的迭代更值得期待。