近期,DeepSeek正式发布了其备受期待的多模态大模型,并在其聊天机器人产品中开启了“识图模式”的灰度测试,标志着这头以文本和代码能力著称的“鲸鱼”终于“睁开了眼睛”,补齐了视觉能力的短板。
当前许多多模态模型虽然能够“看见”图像,但常常在复杂的推理任务中表现不佳,例如精确计数、在复杂场景中定位物体等。DeepSeek将此问题命名为“指代鸿沟”(Reference Gap),即模型能感知图像内容,却无法在思考过程中精确指代具体对象。就像人类在数数时会用手指逐个确认,自然语言中的“左边那个”、“中间的物体”等描述在密集或复杂的场景中往往不够精确,导致模型的推理逻辑在多步之后出现混乱或“漂移”。
为此,DeepSeek联合清华、北大的研究团队在发布的技术报告《Thinking with Visual Primitives》(以视觉原语思考)中,提出了一种全新的推理范式。其核心思想是,将点坐标和边界框(Bounding Box)这类“视觉原语”提升为模型思维链(CoT)中的基本单位。模型在推理时,不再仅仅依赖模糊的语言描述,而是能够像伸出“赛博手指”一样,直接在思维链中引用具体的位置坐标,从而将抽象的逻辑牢牢锚定在图像的物理空间中,实现“边指边想”。

该模型依托于DeepSeek-V4-Flash语言模型和自研的视觉编码器。其一大亮点是高效的视觉压缩技术,通过多级处理,实现了超过7000倍的视觉信息压缩率,使得模型在处理图像时资源消耗远低于其他主流模型,提高了运行效率。此外,为了让模型掌握这种“边指边想”的能力,研发团队构建了覆盖计数、空间推理、迷宫导航、路径追踪等多种任务的数千万条高质量训练数据,进行了针对性的优化。

在性能方面,尽管模型规模相对紧凑,但在多个具有挑战性的基准测试中,DeepSeek多模态模型在特定任务上表现出色,尤其是在计数、空间推理和拓扑推理(如走迷宫、路径追踪)等领域,其性能媲美甚至超越了一些业界前沿的闭源模型。
然而,从早期用户的实际测试来看,模型目前在某些方面仍有提升空间。例如,它在网页截图转代码、地理信息分析等场景表现亮眼,但在处理复杂的视觉错觉或高难度的“找不同”任务时,仍可能出错,展现出一定的“神鬼二象性”。

DeepSeek多模态的发布,是其产品能力的一次关键补全。其提出的“以视觉原语思考”框架,为解决多模态模型在复杂推理中的“指代鸿沟”问题提供了一个创新且有效的思路。有趣的是,相关的技术报告在发布后曾被短暂撤回,引发了关于其技术可能过于超前的猜测,也从侧面反映了这一新范式的潜在影响力。虽然模型在部分复杂场景下的泛化能力仍需完善,但它无疑为多模态AI朝着更懂视觉逻辑、更精准思考的方向迈出了坚实的一步。