近期,围绕国产大模型DeepSeek的讨论热度骤然升温,其最新一轮的灰度测试成为了业界和用户关注的焦点。综合多方信息来看,这一系列事件并非一次简单的版本更新,而是展现了DeepSeek在技术能力、产品策略和社区互动等多个层面的动态变化。
事件的起因是,继8月13日DeepSeek V4 Pro正式版发布后,不少用户反馈其表现未达到此前灰度测试时的高水平,引发了社区的广泛讨论。然而在8月19日前后,有用户发现通过特定方式可以再次触发一个性能远超正式版的模型版本,这被外界视为新一轮的灰度测试。

与此前灰度测试相比,这次被“解锁”的版本在能力上展现出显著的超越。一个广为流传的区分方法是通过模型在执行任务时的“思维链”(Chain-of-Thought)来判断。早期灰度测试中,高性能版本的标志是“I'm”或“I'll”开头的思考过程,而8月13日发布的正式版则多以“Let me”开头,表现相对逊色。最新的发现是,通过使用DeepSeek官方推出的智能体(Agent)框架“DeepSeek Harness”的极简模式,用户能够触发一个以“we need”等新特征开头的模型,其性能被认为与早期灰度测试中的顶尖水平相当,甚至在某些方面更强。

社区用户通过大量实测发现,这个新版本的模型在代码生成,尤其是处理复杂的SVG图像和3D网页游戏生成等任务上,表现尤为突出,其完成度和效果被认为达到了行业领先水平。一些测试甚至显示,它在特定全栈式工程任务上的表现,可以和国际顶尖的Fable 5等模型相提并论。这表明DeepSeek V4的基座模型本身具备极高的能力上限,但如何稳定地将其释放给所有用户,成为了一个新的挑战。
除了核心的模型能力,DeepSeek近期也开启了多模态能力的灰度测试。部分用户获得了“识图模式”的体验权限,该模式能够处理图像输入。从初步的实测来看,其在OCR文字识别、根据图片生成网页代码(HTML)等实用功能上表现出色,且响应速度很快。不过,在复杂的逻辑推理和图片找不同等任务上,其能力仍在持续优化中。有趣的是,有用户发现“识图模式”可能是一个独立于V4文本模型的新模型,其知识库截止日期和世界知识的范围与纯文本模型存在差异。
这一系列技术动态的背后,是DeepSeek公司层面更广泛的战略调整。最引人注目的变化之一是其API服务定价策略的调整。DeepSeek近期宣布上调API价格,并引入了“峰谷分时定价”模式,在日间高峰时段的调用成本会更高。官方在与用户的沟通中提到,此举是为了将更多算力资源集中用于研发更强的下一代模型。这在一定程度上解释了为何在模型能力备受期待的同时,公司却选择提高使用成本。

此外,DeepSeek在底层硬件适配上也迈出了关键一步。有信息指出,V4版本从开发之初就考虑了对华为昇腾等国产AI芯片的兼容和适配。这一“去CUDA化”的战略举措,旨在降低对单一硬件生态的依赖,为国产大模型与国产算力的深度结合提供了范例,对整个行业具有长远意义。

近期围绕DeepSeek的灰度测试风波,揭示了一个多维度的发展图景:技术上,其核心模型能力已达到相当高的水准,但如何将这种能力稳定、高效地产品化,仍是其面临的课题;产品上,多模态和Agent智能体框架(DeepSeek Harness)正成为其发力的重点方向;而在商业和战略上,通过价格调整和硬件适配,DeepSeek正在为其下一阶段的技术研发和市场竞争储备资源。这一系列复杂的动态,共同构成了当前国产大模型激烈竞争与快速迭代的生动缩影。