近日,国产大模型公司DeepSeek在深夜悄然更新了其API,正式推出了DeepSeek V4 Pro的正式版(版本号0813)。此次发布没有举办大型发布会,最初由开发者在API文档和定价页面的变化中发现,但其引发的行业关注却不容小觑。
根据官方公布的信息,该模型具备100万token的超长上下文窗口和高达38.4万token的最大输出能力,并支持思考/非思考模式切换、工具调用、JSON输出等一系列面向复杂应用的功能。与此前的预览版相比,正式版V4 Pro的性能,尤其是在智能体(Agent)相关任务上,实现了显著提升。据流传的官方评测数据显示,新模型在多项基准测试中的表现已十分接近甚至在个别项目上超越了如Claude Fable 5等国际顶尖模型。特别是在软件工程、网络安全和自动化任务等代表模型“实际干活”能力的测试中,其分数较预览版有大幅增长。
巧合的是,DeepSeek V4 Pro的上线几乎与马斯克旗下SpaceXAI发布的Grok 4.6在同一天。两款模型都以高性能和高性价比为卖点,共同向由OpenAI和Anthropic主导的顶尖模型市场发起了冲击。其中,DeepSeek V4 Pro的价格策略尤为引人注目,其API调用成本(每百万token输入约3元,输出约6元)仅为V4 Flash版本的三倍,但相较于Claude Fable 5等顶尖模型,价格差距可达数十倍。这种极致的低价策略被视为对现有市场格局的有力挑战,旨在推动AI能力从“高不可攀”向“普惠可用”转变。
然而,在新模型上线后,社区的实际测试反馈呈现出复杂且矛盾的景象。一方面,一些开发者和用户通过实际测试,成功利用V4 Pro完成了从零构建3D游戏、交互式网站等复杂任务,在与Grok 4.6的同题对决中也各有胜负,展示了其强大的代码生成和执行能力。但与此同时,也有大量用户反映,正式版的实际表现并未达到预期,甚至在某些任务上不如更便宜的V4 Flash版本。有测试指出模型在处理一些看似简单的任务时会出错,且部分用户体验到了不稳定的性能。
这种体验上的巨大差异,加上有用户发现官网的宣传信息一度被撤下,引发了社区的广泛讨论和猜测。有观点认为,可能是模型部署初期出现了问题,例如请求被路由到了旧版本,或是推理服务尚未完全稳定。这些争议使得对V4 Pro正式版的评价出现了分化,一些用户对其性价比和追赶速度表示赞赏,另一些用户则对其稳定性与实际效果感到失望。
此外,DeepSeek官方在定价页面明确预告,“计划近期整体上调DeepSeek API服务的定价,预计涨幅较大”,这意味着当前的低价窗口期可能不会长期持续。
总的来看,DeepSeek V4 Pro正式版的发布,是AI大模型领域激烈竞争的一个缩影。它不仅展示了国产模型在智能体等前沿技术方向上的快速追赶,更通过激进的定价策略,加速了全球AI算力成本的下降。同时,它也揭示了从基准测试跑分到用户实际体验之间可能存在的差距,以及新模型上线后面临的工程挑战。未来,随着官方可能的价格调整以及配套的Harness(运行框架)的推出,其最终的市场表现和行业影响力,仍有待进一步观察。