张大妈

如何评价谷歌研究发现「DeepSeek推理分裂出多重人格」?为什么会发生这种现象?

源自知乎:月半绮绮

01-23 14:43

近期谷歌关于DeepSeek「多重人格」的研究引发热议,但这其实是种误读。真相是AI在追求极致可靠性时陷入了「过度思考」的困境,导致推理链过长和幻觉率飙升。这项研究的真正价值在于提供了一套量化诊断AI思维的工具,让我们能精准调优模型。

如何评价谷歌研究发现「DeepSeek推理分裂出多重人格」?为什么会发生这种现象?智能速览

  • DeepSeek-R1的「多重人格」其实是过度思考的误读。

  • DeepSeek追求可靠性导致其推理图出现大量无效循环。

  • 多步推理链会放大微小偏差,显著增加幻觉率。

  • 推理图技术实现了对AI思维过程的量化诊断。

  • 未来可通过靶向调优来优化AI的推理模式。

如何评价谷歌研究发现「DeepSeek推理分裂出多重人格」?为什么会发生这种现象?精华内容

AI的「多重人格」并非意识觉醒,而是推理能力过度优化的副作用。这背后揭示了当前AI发展的核心矛盾。

误解的根源

将DeepSeek-R1推理过程中的语言切换解读为「多重人格」是一种吸引眼球但并不准确的描述。根据Google DeepMind的研究,这种现象的本质是模型在过度思考。不同于OpenAI o1系列追求效率的线性短路径推理,DeepSeek-R1为了确保100%正确,会进行反复的循环验证和穷尽式分支探索。这种设计哲学导致了其推理图呈现出大量循环的特征,最终在复杂路径中「迷路」,语言切换只是思维链断裂的表象。

推理的代价

推理能力的强化并非没有代价。研究数据显示,推理能力越强的模型,其幻觉率反而越高,高出接近4倍。原因在于,一个长长的推理链中,每一步生成的微小偏差都会被逐步放大。假设一个10步的推理链,每一步仅有5%的偏差概率,累积到最后,整个结论出错的概率将变得非常高。这是所有追求深度推理模型,包括OpenAI的o3和o4-mini,共同面临的困境。

诊断新工具

这项研究最大的贡献并非发现了「多重人格」这类现象,而是提供了一套名为「推理图」的定量诊断工具。通过这套工具,我们可以量化分析模型的循环数量、图直径和思维探索广度。这使得AI的优化从过去依赖感觉的「它好像更聪明了」阶段,跃升至精准定位问题的「诊断出AI哪里有问题」的阶段。未来,针对过度思考的模型,可以用高质量数据压缩循环;对欠思考的模型,则通过强化学习拉长推理链。

使用建议

对于DeepSeek-R1的用户而言,必须正视其14.3%的幻觉率。在处理关键信息或进行重要决策时,这一数据是不可接受的。因此,强烈建议结合使用RAG(检索增强生成)技术,并对输出结果进行多源交叉验证。要理解,DeepSeek-R1只是一个被设计成「宁可多想也不能错」的工具,而「多想多错」的规律,在AI世界同样适用。

从「多重人格」的喧嚣中回归,我们看到的更深层价值是AI推理诊断能力的诞生。这为未来模型的靶向优化铺平了道路,但如何平衡效率与可靠性,仍是待解的难题。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章