张大妈

实验室又一篇Tpami!

源自小红薯:中山大学通用具身智能中心

01-16 19:08

多模态大模型在处理复杂逻辑推理时常因“快思考”产生幻觉。AtomThink框架引入人类“慢思考”机制,将推理拆解为原子步骤,显著提升了模型的逻辑严密性和推理效率,为AI在几何、物理等领域的应用提供了新思路。

实验室又一篇Tpami!智能速览

  • 多模态大模型(MLLM)在复杂逻辑推理中存在“快思考”幻觉问题。

  • AtomThink框架引入人类“慢思考”机制,提升逻辑严密性。

  • 自结构化思维链(SCoT)将推理过程拆解为最小的“原子步骤”。

  • 通过超10万步骤级别数据训练,模型学会了依赖上下文的逐步推理。

  • 相比经典方法,AtomThink推理效率提升85.3%,数据效率提升5倍。

实验室又一篇Tpami!精华内容

传统思维链(CoT)步幅过大,逻辑跳跃频发。AtomThink如何通过“原子级”拆解,让模型走稳每一步?

原子级推理

传统的思维链方法在处理复杂问题时,常因步幅过大而产生逻辑跳跃,导致错误累积。AtomThink提出的自结构化思维链(SCoT)则强制模型将推理过程分解为最小的语义单元,即“原子步骤”。

例如,求解一个几何图形的面积时,模型不再是直接输出“求出面积”这一笼统步骤,而是被引导拆解为:“识别底边”→“识别高”→“调用面积公式”→“代入数值计算”。这种精细化的步骤控制,从根本上减少了因一步踏空而引发的连锁性错误,显著增强了推理的严谨性。

数据驱动优化

高质量的“慢思考”能力离不开数据的精心打磨。为此,研究团队收集并标注了超过10万步骤级别的推理数据。通过监督指令微调,模型在多轮对话中学习,逐步掌握如何依据前序步骤的上下文,来推导下一步的原子操作。

这种训练方式模拟了人类在解决复杂问题时“深思熟虑”的过程:每一步都建立在上一步的正确基础上,环环相扣。这使得模型不再依赖海量数据的暴力堆砌,而是通过高信息密度的原子步数据,高效地掌握了核心推理逻辑。

效率惊人提升

“慢思考”通常意味着更高的计算成本,但AtomThink的实验结果却出人意料。通过在测试时引入步骤级别和路径级别的搜索机制,模型虽然思考过程更细致,但整体效率却实现了质的飞跃。

与经典的LLaVA-CoT方法相比,AtomThink的推理效率提升了惊人的85.3%。其原因在于,每一步的严谨性减少了大量无效尝试和错误路径的回溯。此外,得益于原子步骤数据的高效性,模型的数据效率也提升了5倍,证明了这种方法的实用性与优越性。

AtomThink框架为多模态大模型的逻辑推理能力开辟了新路径。它证明了结构化的“慢思考”不仅能提升准确性,更能带来效率的革命性突破,AI的未来推理能力值得期待。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章