DeepSeek模型迎来重大更新,在实现1M超长上下文与处理速度飞跃的同时,其语言风格也引发了用户的广泛讨论。此次升级是一次技术进化与个性保留的权衡,深入解析其优缺点,有助于理解AI模型迭代的复杂性。
智能速览
新模型上下文扩展至1M,处理16万字文本仅需7秒。
指令服从度与人设延续性显著增强,角色扮演更稳定。
文风改变,部分场景下语言表达略显模板化,缺乏温度。
用户反馈是模型迭代的关键,此次更新或为技术取舍。
新版本目前仅在App端上线,API尚未更新,或为V4lite版。
精华内容
DeepSeek的这次更新引发了广泛讨论,它在性能上实现了跨越,但在语言质感上似乎也发生了变化。下面将从多个维度深入剖析这次升级的具体表现。
性能显著飞跃
本次更新的核心亮点在于性能的巨大提升。模型的上下文窗口从之前的基础上大幅扩充至1M,意味着能够处理更长的文档和对话,知识库的截止日期也更新到了2025年5月。
思考速度也明显加快,实测显示,阅读16万字的文本仅需7秒,大幅缩短了等待时间。这得益于可能采用的DSA注意力机制,使得模型在处理海量信息时,注意力更强,能准确定位到关键信息,有效减少了同上下文内的幻觉现象。
指令服从增强
新模型在遵循指令方面表现出了更高的服从度,尤其对于精心设计的prompt。用户反馈,在角色扮演场景中,模型能够很好地维持人设,即使在长达十几轮的对话后,角色的核心设定依然稳定,不会轻易出现“OOC”(角色扮演出格)的情况。
只要设定足够清晰,模型就能精准地执行指令,这对于需要高度稳定性和可控性的应用场景来说,无疑是一个巨大的进步。
语言质感变化
然而,升级也带来了副作用。许多用户反映,新模型在人文社科和创意写作方面的表现有所退步,语言风格变得陌生。它有时会冒出如“我接住了你”、“你不是……而是……”这类略显刻板和重复的句式,被社群戏称为“薯塔体”。
在情绪支持或日常闲聊等需要情感互动的场景中,新模型的回复不如以往自然和温暖,少了一些细腻的“人味儿”,变得更像一台高效但缺乏个性的机器。
版本更新推测
关于此次更新,目前官方尚未发布任何正式公告或技术文档。社群观察发现,此次模型更新仅在官方APP端生效,API端并未同步上线。
基于此,有用户推测这并非最终定型的V4版本,而可能是一个过渡性的V4lite版本,用于测试市场反应。这种技术迭代的取舍,即用部分语言质感换取性能的巨大提升,或许正是这次更新的核心策略。