DeepSeek 第一个「长眼睛」的模型来了。8 月 21 日,deepseek-v4-flash-vision-exp 悄悄上线 API 平台,这是 DeepSeek 首个正式可用的视觉多模态模型。知乎

定价也还是很 DeepSeek。图片会被换算成 token 来计费,一张图最多占 384 个 token,按高峰时段的费率来算,看一张图大概就是 0.12 分钱。知乎换算下来一分钱能看大约 9 张图,对要批量处理图片的开发者来说,这个成本基本可以忽略不计。
按理说,能力逼近第一梯队、价格压到厘级别,这该是一场毫无争议的好评发布。但上线不到两天,实测视频和评论区就分成了两派。
跑分和实测:都是真的,也都极端
跑分这边,数字确实好看。在需要视觉理解的 Agent 评测上,成绩出现了比较大幅度的跃升,多模态这一层的 Agent 能力,官方说法是已经比较接近 Claude Opus-4.8。知乎媒体常用的四项多模态基准里,它和 Opus-4.8 打出了 2:2 平局,纯文本则和 V4-Flash 正式版持平。哔哩哔哩
实测这边,也有人真的用出了效果。丢给它一张 JavaScript 报错截图,模型能精准定位到未定义的变量,并给出修复方案。哔哩哔哩

但翻车的声音明显更大。有首发测评视频拿四道实际题目实测,直接以「deepseek多模态实测:4道题全错,拉完了」为标题。哔哩哔哩还有用真实项目做测试的,评价是「实验性质太明显了,效果非常一般」。哔哩哔哩
为什么割裂这么大:看懂三点再上手
一、Exp 是实验版,不是正式版。 很多人忽略了名字里的 Exp。它的模型 ID 是 deepseek-v4-flash-vision-exp,原来的 deepseek-v4-flash 仍是另一个独立入口,两者是并行关系,不是升级关系。知乎拿正式旗舰的标准去测一个实验版,结论自然容易崩。
二、你喂给它的图,已经被压缩过了。 这个机制很容易被忽略:图片会先缩到 800×800,单张封顶 384 token,再和文字合并计费、合并理解。哔哩哔哩按高峰价算,一张图约 0.0012 元,一千张也就 1 元出头。好处是成本极低,代价是细节丢失:它的强项是「大图结构」类任务,读报错截图、看网页 UI、认图表趋势;吃亏的是逐字精确类任务,合同条款、报表数字、坐标轴上的小字。如果你的活儿是后一种,别急着把它当主力。

三、官方测的和你测的,可能不是一件事。 官方给的示例,全是配着 Harness 一起干活的 Agent 式场景:生成高端定制旅行 PPT、重构网站、制作前端 Mini Demo。哔哩哔哩它考的是「看截图→定位问题→调工具→改了再验」的闭环能力。而不少翻车实测是丢一张图、问一句话就下结论——单图问答恰恰是它最吃亏的用法。
怎么用:分三档
第一档,这些场景可以直接上。 你的工作流里如果有很多截图类任务——读报错截图、对着 UI 图改前端、批量提取图表和图片信息——可以放心试。但注意避开高峰时段:高峰折算成北京时间是 09:00—12:00 和 14:00—18:00,费率翻倍,批量任务挪到非高峰能再省一半。知乎另外注意,这个模型只支持读图,不能生成图像,想要生图的别找错门。哔哩哔哩

第二档,先拿小任务试。 先丢低风险任务:日报配图、UI 截图、常规图表。干得好再扩大范围,干不好也别硬上,尤其别把「未经复核直接改生产代码」的习惯押在实验版上。
第三档,急着迁移的再等等。 想要「稳定、便宜、可大规模跑」的多模态主力,建议再观望一下:权重、参数、许可证全都还没公布,模型还有变数。哔哩哔哩官方自己的定位也很明确:实验版本,适合体验和辅助工作,不适合未经复核就把关键任务全押上去。知乎
最后两个细节
别把它和之前网页端的「识图模式」混为一谈:那套本质是 OCR,擅长把图里的字一行行读出来;这次的 Vision 模型才是真正把视觉理解接进了 DeepSeek。知乎
用 DeepSeek Harness 的朋友记得升级到最新版:模型适配器已支持原生图片请求,/goal、/plan 这些命令可以直接丢图片进去,不用再手动把截图转述成文字。微博
顺带一个福利:想免费体验多模态的,OpenRouter 上的匿名模型 Ox Alpha 免费窗口到 8 月 27 日。<#&!53#&!>知乎它到底是不是国产大厂的下一代旗舰,社区还在猜,但免费额度是真的,值得一试。
你拿它跑了什么场景?是惊喜还是翻车?评论区聊聊。