8月12日深夜,DeepSeek V4 Pro正式版在几乎没有预告的情况下悄然上线,仅通过更新API文档的方式宣告其到来。这一低调的发布,恰逢马斯克旗下xAI的Grok 4.6在同一天登场,两款备受瞩目的模型同期发布,迅速点燃了AI社区的讨论热情。
根据DeepSeek官方社群及部分媒体披露的初期评测数据,DeepSeek V4 Pro正式版在性能上展现了巨大飞跃,尤其是在体现“动手能力”的智能体(Agent)相关测试中。例如,在衡量软件工程能力的DeepSWE基准测试中,其得分从预览版的12.8分暴涨至62.7分;在衡量终端操作能力的Terminal Bench 2.1测试中,得分达到87.9,与当时全球顶尖的闭源模型Claude Fable 5的88.0分仅相差0.1分。此外,在网络安全(Cybergym)和自动化任务(AutomationBench)等评测项目上,其表现甚至超越了部分海外旗舰模型。

DeepSeek V4 Pro的核心特点在于其高效的系统架构。它采用了混合专家(MoE)模型设计,总参数量达到1.6万亿,但在每次推理时,仅激活约490亿参数。这种“按需调用专家”的模式,使其能够在不显著增加单次推理成本的前提下,拥有庞大的知识储备和能力上限。同时,模型支持100万Token的超长上下文和高达38.4万Token的输出,这为处理大型代码库、长篇报告和执行复杂Agent任务提供了坚实基础。
更为市场关注的是其极具竞争力的定价策略。在性能大幅提升的同时,DeepSeek V4 Pro正式版上线初期的API价格维持在预览版降价后的水平,即输入每百万Token约3元人民币,输出约6元人民币。相较于性能相近的海外顶尖模型动辄数十甚至数百元的价格,其成本优势极为突出,部分评测显示价差可达数十倍。这一策略延续了DeepSeek一贯的“极致性价比”路线,旨在推动顶级AI能力从少数高价值场景走向更广泛的产业应用。
然而,伴随高调跑分而来的,是实际使用中的一些争议和疑问。V4 Pro正式版上线后,官方并未发布正式的更新日志,甚至一度撤下了官网的相关宣传信息。许多开发者和用户在第一时间进行实测后反馈,模型的实际表现并未完全达到预期,部分用户认为其体验不如Kimi K3等国内竞品,甚至与自家的V4 Flash版本相比也未拉开质的差距。第三方评测机构Artificial Analysis给出的智能指数也低于社区预期。
对于官方数据与用户实测体验之间的差异,社区中出现了多种解释。一种观点认为,官方评测可能是在即将发布的、专门优化的运行框架“DeepSeek Harness”下进行的,而普通的API调用未能完全发挥模型潜力。另一种猜测则指向了部署初期可能存在的bug或配置问题。无论原因为何,这一系列的波折都为DeepSeek V4 Pro的真实能力画上了一个问号。
尽管存在争议,DeepSeek V4 Pro的发布依然意义重大。它清晰地展示了一条以极致效率和成本控制来追赶并挑战全球顶级模型的路径。它与Grok 4.6等模型几乎同时将目光聚焦于Agent能力和更低的调用成本,反映出AI行业的竞争正从单纯比拼通用聊天能力和基准跑分,转向比拼谁能更低成本、更稳定地完成实际工作。虽然DeepSeek官方已预告未来将上调API价格,但其“让顶级AI更便宜”的战略思路,已经对全球大模型的成本结构和市场格局产生了深远影响。