好的,遵照您的要求,我将根据提供的内容,以《DeepSeek 刚刚上线的多模态识图模式》为主题,为您总结生成一篇文章。
---
近期,人工智能领域再次迎来一个引人注目的事件:以强大的文本和代码能力著称的DeepSeek,悄然为其产品矩阵补上了一块关键拼图——多模态识图能力。这一切的开端,源于DeepSeek多模态团队研究员在社交平台发布的一张图片:品牌标志性的鲸鱼摘下了眼罩,配文“Now, we see you”(现在,我们能看见你了)。这一充满象征意义的举动,迅速引发了业界的广泛关注。

紧随其后,部分用户发现,DeepSeek的网页版和App端在原有的“快速模式”和“专家模式”之外,新增了一个名为“识图模式”的选项,并标注有“图片理解功能内测中”。这标志着DeepSeek正式开启了其多模态能力的灰度测试,产品能力从纯文本对话延伸至图文交互领域。
从早期获得测试资格用户的反馈来看,DeepSeek的“识图模式”展现了相当不错的综合能力。它不仅仅是简单的OCR文字识别,而是能够真正理解图片内容。在基础的看图说话任务上,它能详细描述画面细节,识别图中角色、物品,甚至分析光影氛围和构图。有用户测试用一张博物馆藏品的照片,它能准确分析出其风格、推断其来源(如清代痕都斯坦风格玉器)。对于包含复杂文字和设计的海报,它也能高效提取大部分信息。此外,它还能理解一些网络“梗图”的笑点,并进行本土化的解释,展现了其结合视觉信息和背景知识的推理能力。

然而,作为尚在内测中的初版功能,DeepSeek的识图能力也表现出一定的“神鬼二象性”——时而惊艳,时而“翻车”。在处理一些高难度的视觉挑战时,它仍有进步空间。例如,在经典的“数手指”或在复杂图案中计数的任务上,它会出现数错的情况。面对一些精心设计的视觉错觉图片,它虽然能分析出正确的色彩信息,但有时仍会被“欺骗”,无法得出正确答案。有用户用一张倒置的城市夜景图测试,它会误认为是空间站拍摄的地球照片。这些实例表明,模型在处理极限、非常规或需要深度逻辑推理的视觉任务时,表现尚不稳定。
更引人关注的是其背后的技术实现。伴随着识图模式的内测,一份名为《Thinking with Visual Primitives》(以视觉原语思考)的技术报告被短暂公布后又迅速撤下,引发了业内的热烈讨论。根据已披露的信息,DeepSeek为解决多模态模型在复杂推理中的“指代鸿沟”问题,提出了一种创新框架。
所谓“指代鸿失”,指的是模型虽然能“看见”图像,但在进行多步推理时,很难用模糊的自然语言(如“左边那个”)精确、持续地指向图像中的某个具体对象,从而导致逻辑混乱。DeepSeek的解决方案,被形象地比喻为“给AI装上了一根手指”。它让模型在思考过程中,使用“视觉原语”(点和边界框)来辅助推理。当模型需要处理一个视觉对象时,它会在内部的“思维链”中直接嵌入该对象的坐标或边界框,就像人类用手指点着东西思考一样。这种方法将抽象的语言逻辑锚定在具体的图像物理坐标上,大大提高了复杂场景下(如走迷宫、路径追踪、精细计数)推理的准确性和稳定性。
从更宏观的行业视角看,DeepSeek上线识图模式是一个重要的战略补全。在当今主流大模型普遍具备多模态能力的背景下,这一功能的缺失曾被视为DeepSeek的明显短板。补齐视觉能力不仅使其产品体验向GPT-4o、Gemini等顶尖模型看齐,更重要的是,为未来发展更强大的AI Agent(人工智能体)奠定了基础。因为AI Agent要真正在现实世界中执行任务,就必须具备理解截图、网页界面、图表等视觉信息的能力。

DeepSeek的“识图模式”虽然仍在初期灰度测试阶段,表现有好有坏,但其背后新颖的“视觉原语思考”技术框架,以及这一功能对DeepSeek整体战略的补强,都预示着这家以技术和效率著称的公司,正在多模态领域迈出坚实而关键的一步。这头“摘下眼罩的鲸鱼”将如何观察并影响这个世界,值得行业持续期待。