近期Deepseek被部分用户认为“变冷淡”,聊天体验不如以往。这并非简单的退步,背后是其模型策略的重大调整,优先发展Agent能力,从而在通用对话上做出了取舍,揭示了AI发展的深层逻辑。
智能速览
Deepseek新模型被指在聊天对话中表现冷淡,用户体验下降。
新模型据传是200B参数的Agent特化模型,主打超长上下文与高速推理。
模型规模的限制使其无法兼顾Agent性能与通用聊天体验。
母公司幻方将此模型用于应对C端用户,同时进行测试并优化算力资源。
精华内容
Deepseek模型表现的变化,揭示了AI公司在技术路线和资源分配上的深层考量与无奈。
策略转向
近期用户感知的Deepseek“变冷淡”,其根源在于模型策略的根本性转变。据悉,其新推出的模型(暂称v4 lite)并非为了优化通用对话而生,而是为一个特定目标服务:成为高效的AI Agent。这一转变意味着其核心能力优先级发生了变化,从日常聊天的亲和力转向了处理复杂任务的效率与深度。这种战略性调整直接影响了普通用户的交互体验。
模型特化
这款新模型传闻是一个拥有2000亿(200B)参数的模型,其设计亮点在于支持高达100万token的超长上下文窗口和极快的推理速度。这些特性使其在执行需要大量信息记忆和多步骤规划的Agent任务时表现出色。
然而,技术上的“特化”必然带来取舍。一个200B规模的模型难以同时成为全能选手,其在开放域聊天、创意写作等需要“人性化”交互的场景下,表现力自然会相对减弱。这并非模型能力不行,而是设计目标的必然结果。
资源考量
从运营角度看,幻方(Deepseek母公司)的选择也反映了现实的资源约束。与拥有雄厚算力和多模型矩阵的OpenAI不同,幻方手头并没有富余的算力,也没有备用的高性能通用对话模型可以随时切换。
因此,将这款Agent特化模型部署给C端用户,一方面可以应对市场期待,另一方面也能在真实场景中收集测试数据,同时还能最大化利用服务器资源,是一种多目标下的务实选择。
Deepseek的这次调整,是AI发展路径选择的一个缩影。未来,通用大模型与专用小模型将如何共存?这或许是整个行业需要共同思考的问题。