近期,以强大文本和代码能力著称的国产AI大模型DeepSeek,正式向所有用户开放了备受期待的“识图模式”,标志着它从纯文本处理正式跨入图文多模态交互时代。这一功能的上线,迅速在用户和开发者社区引发了广泛的实测与讨论。
此前,DeepSeek凭借其出色的逻辑推理能力被誉为“理科高手”,但视觉能力的缺失一直是其明显短板。此次“识图模式”的推出,被普遍视为DeepSeek补齐核心能力、从“专才”迈向“全能助理”的关键一步。该功能在网页端和App上与“快速模式”、“专家模式”并列,用户可直接上传图片,让AI“看见”并理解世界。

综合大量用户实测反馈,DeepSeek的识图能力远超传统的光学字符识别(OCR)。在生产力场景中,它展现了惊人的实用性。最受好评的功能之一是“截图转码”,用户上传一张包含复杂界面的网页或应用截图,DeepSeek不仅能提取所有文字,甚至可以反向生成功能完整的HTML代码,连原网页的跳转按钮都能一并复原。在专业知识领域,它也表现出“博物学家”的潜力,能够根据用户上传的文物照片,详细描述其纹理、材质,并准确推断出其所属的年代与艺术风格,例如成功识别出清代乾隆时期的“痕都斯坦风格”玉器。此外,该模式还展现了出色的“网感”,能够精准解读时下流行的表情包和梗图,甚至能在一张合影中同时分辨出现实人物与动漫角色。

在技术层面,DeepSeek公开了其背后的核心框架——“以视觉原语思考”。这一创新机制旨在解决传统多模态模型在面对复杂图像时容易产生的“指代鸿沟”问题。简单来说,它让模型在推理过程中,能够像人类用手指一样,直接在“脑海”中精确地指向图片中的特定区域(如点、边界框)来进行思考,从而避免了因语言描述模糊不清导致的逻辑混乱。这一框架的另一大优势是极高的计算效率,在处理相同分辨率的图片时,其所需消耗的计算资源远低于行业内其他主流模型。
当然,作为一项新上线的内测功能,初次“睁眼看世界”的DeepSeek识图模式也并非完美无缺,用户在测试中发现了一些明显的不足之处。
首先是广为流传的“脸盲”问题,尤其是在人物识别上表现不佳。许多用户在测试中哭笑不得地发现,DeepSeek经常无法识别其创始人梁文锋的照片,反而会将其误认为其他科技名人,甚至有时会“看谁都像梁文锋”,显示出其在人脸识别方面的短板。

在处理高难度的视觉推理任务时,其表现尚不稳定。例如,在面对需要空间想象力的立方体拼接题时,普通模式下容易给出错误答案;虽然开启“深度思考”模式后能够耗费数分钟得出正确解,但过程显得较为冗长和曲折。对于一些视错觉图片或精细的“找不同”游戏,模型也时常出现幻觉,甚至在深度思考后反而逻辑崩溃。

此外,知识库的更新滞后也是一个问题。由于模型的训练数据有截止日期,它在识别较新的产品或事件时,虽然推理逻辑可能正确,但最终会因为信息过时而给出错误的答案。
最后需要明确的是,当前上线的识图模式本质上是一个纯视觉理解模块,专注于图片内容的识别与分析,尚未集成图像生成、视频理解或更广泛的跨模态交互功能。

DeepSeek识图模式的上线是一次意义重大的战略性升级,它以一种高效且创新的方式补齐了自身在多模态感知上的关键短板,使其能够与国际顶尖模型在更广阔的舞台上展开竞争。尽管初版体验在人物识别、复杂推理和知识时效性上仍有明显的打磨空间,但其展现出的强大潜力与独特的技术路径,已经让广大用户对它的未来迭代充满了期待。