当前位置:
文章详情

DeepSeek,能看懂图了

2026-08-22 13:24:07 0点赞 1收藏 0评论
DeepSeek,能看懂图了

2026年8月21日下午,DeepSeek官方API文档的“模型细节”页面出现了一个新的名字:deepseek-v4-flash-vision-exp。

一个实验性质的模型。DeepSeek V4系列首款原生支持图片输入的视觉模型。纯文本能力与V4-Flash正式版持平,视觉理解能力大幅提升,多模态Agent能力已接近Anthropic的旗舰模型Opus-4.8。

上线时间,恰好是DeepSeek Harness发布一周之后。

一周前,DeepSeek的模型还看不见图。

——

一周前,它还看不见

2026年4月下旬,DeepSeek发布V4预览版,包括V4-Pro和V4-Flash两个版本。当时的升级重点放在Agent、推理和长上下文上,没有公布视觉输入能力。8月13日,DeepSeek更新V4-Pro并开放Harness。Harness试图把模型、工具、技能、会话、沙箱、存储和Agent Loop放进一套可组合的运行框架中。

但一个非常实际的问题很快暴露出来:DeepSeek自己的模型没有视觉能力。

过去一周,在DeepSeek Harness的GitHub讨论区里,“怎么让DeepSeek看图”已经成为一个高频问题。有开发者上传图片时,Harness会直接返回一行报错:MODEL_DOES_NOT_SUPPORT_IMAGES。原因是V4 Flash和V4 Pro在模型目录里都被声明为纯文本模型,输入模态只有text。图片甚至无法进入会话。

于是社区开始自己给DeepSeek“装眼睛”。一种方案是在DeepSeek前面再接一个Qwen-VL等视觉模型,先把图片转换成文字描述,再把文字交给DeepSeek推理。另一种方案尝试修改Harness,让图片先保存到工作区,再由视觉插件读取。过去几天,GitHub上已经出现多个类似的vision bridge插件。

形成了一副略显尴尬的局面:DeepSeek刚发布了一套高度插件化的Agent Harness,Agent已经能够调用终端、文件、代码和外部工具,但面对最常见的截图、网页图片和报错界面时,仍需要借用其他公司的模型。

V4 Flash Vision Exp的出现,开始补上这块拼图。

——

能力接近Opus-4.8

从跑分数据看,视觉版本的提升是结构性的。

纯文本能力方面,V4-Flash-Vision-Exp与V4-Flash正式版持平。换句话说,增加视觉能力并没有牺牲文本处理能力。

在需要视觉理解的Agent Benchmark上,提升则相当明显。多模态Agent能力已接近Opus-4.8。具体到各项基准测试:Terminal Bench 2.1得分83.9(V4-Flash 82.7,Opus-4.8 85.0);NL2Repo得分57.7(V4-Flash 54.2,Opus-4.8 69.7);Toolathlon-Verified得分75.9(V4-Flash 70.3,Opus-4.8 76.2);DeepSWE得分59.3(V4-Flash 54.4,Opus-4.8 58.0)。

ApexBench(Pass@1)从26.2跃升至36.5。Chartography图表理解得分64.3,接近Opus-4.8的65.0。ZeroBench(Pass@5)得分35.0,超越Opus-4.8的34.0。

模型基于2840亿参数的MoE架构,采用HCA和CSA技术压缩KV缓存,可将百万Token推理算力需求降低73%。具备100万上下文窗口,最大输出长度384K。

DeepSeek正在补齐一套Agent系统最基础的感知入口。

——

不涨价的视觉

更值得注意的是定价。

视觉模型最容易被质疑的一点是:加了视觉能力,价格会不会涨?

DeepSeek的答案是:不涨。

计费价格与V4-Flash模型完全一致。图片会转换成Token后按Token计费,一张图片最多占384个Token。缓存命中情况下,空闲时段输入0.05元/百万Token,高峰时段0.10元;缓存未命中空闲时段1.5元,高峰时段3元;输出空闲时段4.5元,高峰时段9元。

“一张图最高只要0.001元”。与V4-Flash价格一致,而V4-Flash此前以“价格低至竞品1%”著称。

作为对比,Anthropic Opus 4.8的输出定价约为25美元,而DeepSeek V4 Flash的输出定价约0.28美元。差了两个数量级。

多模态API支持Chat Completions、Messages、Responses三种格式调用,支持图文混合输入,支持base64内联、外部URL、Files API三种图片传入方式。Files API同步上线,不收费,用户可先将图片上传到平台,再在请求中通过file_id引用,同一张图片在多个请求中无需重复上传。

DeepSeek正在用一贯的打法进入多模态赛道:性能接近,价格打一到两个数量级。

——

Agent时代的视觉拼图

V4 Flash Vision Exp的战略意义,不止于“能看懂图”本身。

8月19日,DeepSeek Harness发布v0.1.0-rc.8版本,带来14项更新,涵盖多模态输入、子Agent协作等能力。8月21日,视觉模型上线。一周之内,Harness先支持多模态输入,视觉模型再上线——工具链和模型在同一条时间线上完成闭环。

此前的Harness更新已经提前写好了视觉能力的接口。Release Notes明确增加了一项功能:“增强多模态支持度,DeepSeek模型适配器支持配置启用原生图片请求”。与此同时,/goal、/plan等命令开始支持图文输入。

这个变化刚出现时,很多开发者就在猜测:DeepSeek自己的视觉模型是不是要来了?

8月21日,答案揭晓。从时间线上看,DeepSeek对视觉能力的准备其实已经提前写进了Harness。

招商证券此前研报指出,DeepSeek Harness的战略意图是成为“Agent时代的安卓”。视觉模型的加入,恰恰补上了Harness多模态能力的关键一环。

当Agent能够同时处理文本和图像,能调用的工具范围就从“纯文本世界”扩展到了“包含图片、截图、文档、网页的完整数字世界”。一个能看图的Agent,意味着它可以读取软件界面截图并分析问题、理解文档页面和表格内容、识别错误信息并协助调试、根据视觉素材辅助内容生成。

AI Agent的竞争,正在从“能不能回答问题”转向“能不能真正干活”。而视觉能力,是“真正干活”的入场券。DeepSeek用一款不涨价的实验模型,拿到了这张入场券。

至于实验版之后,Pro版什么时候来——那可能是下一个悬念。

作者声明本文无利益相关,欢迎值友理性交流,和谐讨论~

展开 收起
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

相关文章推荐

更多精彩文章
更多精彩文章
最新文章 热门文章
1
扫一下,分享更方便,购买更轻松