近日,国产大模型厂商 DeepSeek 低调上线了其备受期待的“识图模式”,并已进入小范围灰度测试阶段。这一更新意味着 DeepSeek 标志性的“鲸鱼”Logo 终于“开眼”,正式补齐了此前作为纯文本模型最明显的短板,迈入了多模态领域。该功能一经曝光,便在科技圈引发了广泛关注和讨论。

根据首批获得测试资格用户的反馈,DeepSeek 的“识图模式”在多个场景下表现出了令人惊喜的能力。许多用户认为,其功能并非简单的图像识别,而是某种程度上“复刻了人类的思考逻辑”。例如,在解读网络“梗图”时,模型不仅能描述画面内容,还会主动分析图片背后的隐喻、发布者意图、Logo 细节等,甚至会进行自我提问、联想和纠错,展现出类似人类刷到趣图时的脑回路。在日常应用中,它也能快速准确地识别电影剧照、商品、抽象画等,响应速度很快。有用户使用医学 CT 图像进行测试,发现模型能够进行较为专业的分析,并给出可能的疾病方向判断。

不过,作为内测版本,该识图模式也暴露出一些短板和有趣的“翻车”时刻。在一些经典的 AI 视觉测试中,如数清图片中的手指数量、识别视觉错位图(如爱心图案)时,DeepSeek 会出现错误。有用户将其与国内其他主流多模态模型(如通义千问 Qwen3.5-Plus)进行对比后指出,DeepSeek 在表格的精细化还原、复杂逻辑推理和空间推理等方面仍有提升空间。此外,当前版本的知识库无法联网更新,且不支持 HEIF 等部分图片格式。
业内分析普遍认为,此次更新对 DeepSeek 具有战略性意义。在当前的大模型竞争格局中,原生多模态能力已成为跻身第一梯队的“入场券”。此前,DeepSeek V4 模型虽在文本、代码和长上下文处理方面表现优异,但无法直接“看见”世界,这限制了其在诸多场景的应用,尤其是在愈发重要的 Agent(智能体)领域。一个无法理解截图、图表和用户界面的 Agent,其能力将大打折扣。因此,识图模式的上线,被视为 DeepSeek 补齐关键能力、获取进入下一阶段竞争“门票”的重要一步。

从技术层面看,许多用户和分析人士推测,当前灰度测试的“识图模式”可能并非完全原生的多模态模型,而更像是在其强大的 V4 文本模型主干上,挂载了一个高效的视觉理解模块,这或许也得益于 DeepSeek 此前在 OCR(文字识别)技术上的深厚积累。
此次更新引发的另一个核心关注点在于其未来的定价策略。DeepSeek 以其极具竞争力的低价策略而闻名,曾多次通过“自杀式”降价搅动市场。如果其多模态能力也能以“白菜价”提供给开发者和企业,无疑将对当前市场上的同类服务构成巨大冲击,甚至可能引发新一轮的行业洗牌。毕竟对于广大开发者而言,一个“好用且极度便宜”的模型,才是推动应用生态繁荣的硬道理。

DeepSeek“识图模式”的推出,标志着这家以技术和成本效率著称的公司,终于加入了多模态的战场。尽管目前尚处内测阶段,功能仍有待完善,但它所展现出的潜力和背后可能的价格策略,已经让整个行业对其后续的正式发布以及可能带来的市场变革,充满了期待。