8月21日晚上,DeepSeek低调上线了一个分量不轻的东西:DeepSeek-V4-Flash-Vision-Exp,首个可通过API调用的多模态模型。新智元说低调,是因为没有发布会,官方只是更新了API文档,模型就直接可以调用了。说分量不轻,是因为它补上了DeepSeek生态一直缺的最后一块拼图——在此之前,开发者想让DeepSeek"看图",得自己再接一个视觉模型。
这件事其实有伏笔。今年4月底,DeepSeek先以灰度测试的方式上线了识图模式,6月在网页端和App全量开放,但面向开发者的多模态API,一直等到了今天。智东西等得有多急?上线前就有开发者自己写补丁:微博上流传的codex-deepseek-vision开源项目,在Codex和DeepSeek之间插一层本地代理,再借另一个能读图的模型帮忙看图,这条帖子拿到了83次转发。微博一个生态位缺不缺,看有没有人给它写民间补丁就知道了。
V4-Flash长出了"眼睛",但先看清它的身份
先把基本事实说清楚。这个模型基于DeepSeek-V4-Flash打造,模型名deepseek-v4-flash-vision-exp,后缀"Exp"说明它是实验性质版本,定位相当于之前的预览模型,目前已经上线DeepSeek API平台,即刻可调用。

能力方面,按DeepSeek公布的基准测试:纯文本能力(Agent、推理、世界知识等)与V4-Flash正式版持平。智东西在需要视觉理解的Agent基准测试上,新模型大幅超过原版V4-Flash,多模态Agent能力已接近Opus 4.8。微博不过先把丑话说在前面:「接近Opus 4.8」是DeepSeek自己的基准数据,模型上线才几个小时,社区的深度复测还没出来,这句话先别全额相信。
最值得看的不是能力,是这笔账
这次上线真正值得停下来看的,是DeepSeek又干了它最擅长的事:把别家要单独收费的能力,打成了"赠品价"。
计费规则很简单:图片先转成token,再和文本一起计费,单张图片封顶384个token,单价与V4-Flash完全一致。智东西算下来,高峰时段理解一张图最多0.001152元,1000张图约1.15元,谷时不到6毛。

第三方平台TokenMix做过一次视觉API横评,同一张1024×1024的图,各家模型的token消耗和价格差距一目了然。新智元
模型 | 单图token消耗 | 1000张图价格 |
|---|---|---|
Claude Sonnet 4.6 | 1334 | 4美元(约29元) |
GPT-5.4 Vision | 765 | 1.9美元 |
Gemini 3.1 Pro | 258 | 0.5美元(约3.6元) |
DeepSeek V4-Flash-Vision-Exp | 封顶384 | 约1.15元(谷时不到0.6元) |
和最贵的Claude差25倍,挪到谷时差50倍;即便和名单里最便宜的Gemini 3.1 Pro比,也还有3倍的成本优势。
对这个差距,一句评价值得咂摸:1000张图30块和1000张图1块钱,是两种产品设计。前者你得认真想清楚"这一步到底要不要看图",后者可以让Agent每跑一步都截个屏。新智元当成本压到这个量级,改变的不只是账单,是Agent的架构设计。
实测表现:复刻网页、一句话出PPT
上线几个小时,已经有人上手测了。有媒体丢给它一张OpenAI官网截图,要求1:1复刻成单文件HTML——布局、色值、交互、响应式全都要还原,结论是"简直一模一样"。随后又用一句模糊需求让它做精品咖啡烘焙工坊的B端合作PPT,它交出一份11页提案,五公斤起订、三档供货方案一样不落,全篇没有行业黑话。新智元

极客公园则拿它复刻了《牛来》小游戏,把原版画面截图和AI重制的SVG/CSS版本放在一起对比,角色姿态和字幕的还原度都相当可观。极客公园微博上,AI博主梁赛晒出用它制作黏土怪物风格动态特效的前端Mini Demo,并提到在需要视觉理解的Agent基准上,这版模型相比原版V4-Flash是"大幅跃升"。微博官方给的演示则是PPT生成(能理解"野性、原始、探索感"这类抽象风格要求)和视觉编程(给Harness官网二创加上玻璃UI、ASCII原子像素元素)。
周边生态也在同步就位:8月13日DeepSeek Harness开源,8月19日大版本更新主打多模态输入和子代理协作,8月21日又跟着新模型发了0.1.1版,模型适配器直接加入V4-Flash-Vision-Exp选项,原生支持图片请求,适配代码一行不用写。8天之内,运行时、输入端、工具链全部铺好,这个节奏说明今天的上线不是临时起意。
该不该接:分情况,别一刀切
接入方式几乎没有门槛:把模型名改成deepseek-v4-flash-vision-exp,其余请求照旧。API同时兼容Chat Completions、Messages、Responses三种格式;图片传入支持base64内联、外部URL、Files API三条路,其中同步上线的Files API免费——图片上传一次,之后凭file_id引用,对反复查看同一份设计稿、报表、截图的Agent来说,省的是每一轮的重复传输开销。智东西
但要不要现在就接,得分情况:
现在就可以试的:后端已经跑在V4-Flash上、目前靠第二个视觉模型拼图片理解的开发环境,可以直接砍掉一个模型简化链路;成本敏感的截图解析、表单识别、页面理解类非核心链路;已经在用DeepSeek Harness的Agent玩家。
建议再等等的:对稳定性要求高的核心业务链路,Exp是实验版,相当于预览模型,后续API行为可能变动。知乎等开源权重做本地部署的也要再观望,这次只有API,权重是否开源还没有消息。需要视频、音频理解的同样不适用,这次只有图像。
后续值得盯的三个信号
一是Exp何时转正,实验期多长,转正后纯文本能力是否保持;二是权重是否开源,如果开源,以DeepSeek的生态影响力,本地部署会多一个狠角色;三是「接近Opus 4.8」这个基准的第三方复测——官方数据需要独立验证,复测出来之前,投入别太重。
DeepSeek的一贯路数,是把别人卖高价的能力打成地板价。对成本敏感的开发者来说,这条消息不是刷过去就完的新闻,是一笔值得重新算的账。