DeepSeek识图模式正式上线,多模态能力补齐最后一块短板

2026-06-19 13:00:45 8点赞 37收藏 10评论
图片图片

6月18日,DeepSeek多模态研究员Xiaokang Chen在X平台宣布,DeepSeek识图模式已在网页端和App端正式上线,与原有的"快速模式"、"专家模式"并列作为一级对话入口。

这是DeepSeek从纯文本模型向原生多模态引擎演进的关键一步。该功能曾于4月底开启灰度测试,5月9日大范围开放,6月18日全量上线。

功能特性

用户开启识图模式后,可直接上传图片、截图或含图表的文档,搭配文字提问让模型进行视觉理解与推理。

核心能力包括三个方面:

基础视觉理解:物体识别、场景描述、文字OCR提取。

结构化信息解析:文字、表格、数学公式的识别和提取。

画面描述与推理:对复杂图像进行结构化描述,支持逻辑推理链条,并支持开启"深度思考"进行多步推理。

不同于传统仅做文字提取,DeepSeek识图模式依托自研视觉理解框架,可对日常实物、复杂表格、数学公式、工程图纸及场景语义进行深度分析。

技术架构

DeepSeek识图模式采用"语义优先"的视觉编码方案。

传统多模态模型处理图片时,通常将图片切分为patch,每个patch编码成token后与文本token一起送入大模型。这种方式token消耗较大,一张高清图片可能占用上千token。

DeepSeek的方案不同。视觉编码器按语义含义压缩图像信息,重复纹理和无信息区域被压缩,关键语义部分保留。这种方案使token消耗大幅降低,同等图片的token用量远低于GPT-4o。

识图模式背后可能是一个独立于V4 flash/pro的新模型。有用户发现,识图模式的知识库与V4 flash/pro不完全一致,包含部分V4版本不具备的信息。

实测表现

根据多方测试,DeepSeek识图模式呈现以下特点:

速度方面,非思考模式响应极快,点击发送后几乎无需等待即可获得结果。

OCR能力方面,技术报告截图、表格、手写笔记等均可准确识别,markdown格式表格输出准确。测试显示,即使是有遮挡的图片,模型也能通过推理能力识别出被遮挡的文字。

推理能力方面存在差异。空间推理题中,非思考模式响应快但准确率低;开启深度思考后准确率提升,但思考时间较长。

图片找不同测试中,非思考模式较快找到7处不同,但存在幻觉现象;思考模式找到12处不同,但幻觉数量增加。

此外,模型通过了"隐藏图片"测试,但在色盲测试中出现翻车。

与竞品对比

维度

DeepSeek V4 Pro

GPT-4o

Claude 3.5

Qwen-VL-Max

图像理解

⭐⭐⭐⭐

⭐⭐⭐⭐⭐

⭐⭐⭐⭐⭐

⭐⭐⭐⭐

OCR能力

⭐⭐⭐⭐⭐

⭐⭐⭐⭐

⭐⭐⭐⭐

⭐⭐⭐⭐

Token成本

推理能力

⭐⭐⭐⭐⭐

⭐⭐⭐⭐

⭐⭐⭐⭐⭐

⭐⭐⭐⭐

中文场景

⭐⭐⭐⭐⭐

⭐⭐⭐

⭐⭐⭐

⭐⭐⭐⭐⭐

DeepSeek在OCR能力和中文场景中具有优势,Token成本较低。图像理解和推理能力方面,GPT-4o和Claude表现更优。

当前局限

根据测试,DeepSeek识图模式存在以下限制:

不支持联网搜索,仅基于知识库回答,无法识别最新内容

文件格式支持有限,不支持HEIF格式图片

极限视觉场景(低分辨率、强噪点图像)识别率受限

复杂图表的数据精确提取稳定性不足

视频理解能力暂未开放

API接入

DeepSeek Vision兼容OpenAI API格式。接入参数如下:

base_url:https://api.deepseek.com

model:deepseek-v4-pro

可开启thinking参数增强复杂图像分析,但会显著增加响应时间。

行业影响

DeepSeek识图模式全量上线,使国产大模型在多模态赛道的竞争进入新阶段。

此前,Kimi、通义千问、智谱等模型已支持图片理解,但推理能力和编程能力不及DeepSeek。DeepSeek补齐多模态后,形成"推理+编程+视觉"的完整能力栈,对其他国产模型形成竞争压力。

从成本角度看,DeepSeek的语义优先方案降低了视觉能力的token消耗,同等图片调用成本约为GPT-4o的五分之一到十分之一。这一成本优势可能推动多模态应用场景的扩展。

后续关注

DeepSeek方面表示,公司正推进新一轮融资,目标金额500亿元,并计划于下月推出V4.1版本更新。

后续需关注的问题包括:幻觉问题的优化进展、推理效率的提升、联网能力的开放,以及视频理解功能的上线时间。

展开 收起
10评论

  • 精彩
  • 最新
  • 先把专家模式的搜索功能恢复把,无语了

    校验提示文案

    提交
  • 试过了,还要完善。例如,你打开一个网页,然后在网页前面开一个软件,问deepseek,这个软件上说了什么,deepseek会把作为背景的网页内容读进去

    校验提示文案

    提交
    浏览器怎么不是软件呢 [喜极而泣]

    校验提示文案

    提交
    收起所有回复
  • 没搞懂,为什么不整合在一起?

    校验提示文案

    提交
    能力不行

    校验提示文案

    提交
    收起所有回复
  • 啥?api 调用的是同一 model?

    校验提示文案

    提交
  • 现在有哪个大模型通 API 接口能处理图片和 PDF 文稿的?

    校验提示文案

    提交
  • 请问API支持多模态吗?

    校验提示文案

    提交
  • 千问早就有了吧

    校验提示文案

    提交
  • 这个可以

    校验提示文案

    提交
提示信息

取消
确认
评论举报

相关文章推荐

更多精彩文章
更多精彩文章
最新文章 热门文章
37
扫一下,分享更方便,购买更轻松