今天下午开始,微博和知乎的时间线被一句话刷屏:DeepSeek终于不是瞎子了。配的表情一半是狂欢一半是阴阳。事情本身是真的:9月17日下午,DeepSeek官方API开放了一个叫 DeepSeek-V4-Flash-Vision-Exp 的模型调用,模型名里就带着vision,官方定位写得很克制——实验性多模态视觉理解模型,能读图、认字、解析图表,不生成图。微博
但如果你打算今晚就把家里的识图管线往这边搬,有三件事值得先花五分钟:第一,"装眼睛"这事根本不是今天才发生的;第二,首日跑分表里最该看的不是"逼近Opus 4.8"那句口号,而是一个25.7;第三,接口文档今天放出来的四条限制,每一条都够让抄教程的人撞一次400报错。
「长眼」不是今天的新闻,今天多的是官方托管入口
把这半年的节奏拉直了看,你大概就明白社区那句"等了四个月"有多虚:
8月下旬,官方先上了一个视觉看图模型,当时连"1000张图1块钱"这种价格都炒过一轮。36氪
8月底到9月初,V4家族第一个多模态权重 V4-Flash-Vision-Exp 挂上Hugging Face,模型卡上明晃晃写着 MIT License、305B params,配套放了Harness工具链和含视觉编码器、稀疏注意力的PyTorch最小实现。微博
9月10日,V4.1 Flash正式发布,官宣"原生多模态视觉理解",API定价同步下调,闲时输入缓存命中从每百万token 0.05元降到0.02元,降幅60%。同一天,旧版 V4 Flash 和 V4 Flash Vision Exp 被下线,模型名暂时路由到 V4.1 Flash——网页端也不用再单独选"视觉实验版"了,发图直接给主模型就行。微博
9月17日,也就是今天,官方公告这个实验模型在 DeepSeek API 平台重新上线:纯文本能力对齐 V4-Flash 正式版,视觉 Agent 任务相比 V4-Flash 大幅提升,多模态 Agent 基准表直接摆出了和 Opus 4.8 的逐列对比,连 Harness 都同步更新了 0.1.1。知乎
所以今天真正的增量不是"从瞎到看见",而是:一个你本来只能自己下权重、自己找卡部署的开源实验模型,现在官方替你托管好了,接口规格、图片格式、detail等级、限制全都白纸黑字写出来了。这对没有富余显卡、又一直在等DeepSeek识图能力的开发者,才是实打实的变化。反过来说,权重开源那两周你都没动手,今天也不会因为一条热搜就突然必须动手。
拆开首日跑分表:和Opus 4.8逐列对过之后,"逼近"二字反而更站得住了
官方今天给的是一张对照表:左列是自家上一版V4-Flash-0731,中间是Vision-Exp,右列直接放了Claude Opus 4.8。把关键数字挑出来:
基准(官方首日表) | Vision-Exp | V4-Flash旧版 | Opus 4.8 |
|---|---|---|---|
Terminal Bench 2.1 | 83.9 | 82.7 | 85.0 |
DeepSWE | 59.3 | 54.4 | 58.0 |
Agents’ Last Exam | 27.3 | 25.2 | 25.7 |
Chartography(图表理解) | 64.3 | — | 65.0 |
ApexBench(多模态Agent) | 36.5 | 26.2 | 39.4 |
AutomationBench | 25.7 | 25.1 | 27.2 |

之前两周社区传"开源版DeepSWE 59.3%反超Opus 4.8",以为那是评测方另一张卷——今天官方表证明出处就是这一张,DeepSWE、Agents’ Last Exam、Terminal Bench三项里它确实压着或咬住了Opus。 但逐列看完,"接近Opus 4.8"这句热搜文案的准确打开方式是:它接近的是Opus的分数,同时也接近了Opus的天花板。微博
三个该冷静的点:
第一,没有任何一项真正甩开Opus。DeepSWE赢1.3分、ALEx赢1.6分,Terminal Bench和ApexBench还落后着。一张表里它最强的是"视觉+代码/终端Agent"这个组合拳,而不是泛泛的"看图说话"。
第二,Chartography停在64.3。图表专项对Opus只输0.7分,听着好听,但绝对值意味着十张财报图、监控截图、复杂坐标轴,它要错将近四张。做"报表自动摘要"可以,做"照着这张图做对账"不行。
第三,AutomationBench两边都趴在地上。Exp 25.7,Opus 4.8也才27.2。识图和"看着图把活干完"是两回事,中间隔着的是动作规划,不是视力——这条赛道目前全行业都在及格线以下,谁也没资格笑话谁。
接入前,今天文档里的四条限制每条都会咬人
从官方API文档和首批实测解读里,能拎出四个新人必踩的点:
图片只能出现在user消息里。塞进system或assistant消息,直接400。 很多从别家视觉API迁过来的封装代码默认图可以放任意消息位,今晚就会红一片。知乎
格式按文件实际内容判断,不看后缀也不看MIME声明。把PNG改名成.jpg不会变成JPEG。校验失败别先去翻扩展名。
三种传图方式,限制不一样:base64受请求体大小约束;URL方式最长8192字符、单图最大32MiB、60秒内必须下载完成(防盗链图床直接出局);Files API上传后引用file_id,单图可放宽到64MiB,同一张图反复分析走这条最划算。
detail给了四档,成本和效果是一根绳。low适合"照片里有什么"级别的需求;要读截图小字、表格数字、界面按钮布局得上original。但大图不一定无脑加token——图会被缩小,缩完小字反而更难认。图按尺寸换算成token,和文本一起计费,"图越大越好"是错觉。

名字里的Exp三个字母,比跑分更该决定你怎么用它
DeepSeek处理"实验"这个词是有前科的:上一轮V4.1 Flash内测接口开了48小时就下线;旧V4 Pro也是说路由就路由,北京时间9月14日中午12点后,官方API把旧Pro的请求自动转到新Flash、按Flash收费。 更讽刺的是,这次的主角自己也走过一遍这个流程:9月10日,旧版V4 Flash和Vision Exp双双下线,模型名被暂时路由到V4.1 Flash,一周后才被重新召回来。 你可以不签SLA用免费额度练手,但没道理让一个带Exp后缀、已经下线过一轮的端点当生产链路里的独苗。微博微博
今天比较稳的姿势是给它一个实验位而不是主力位:
新增的业务直接上双轨,vision-exp和你现有的识图API(Gemini、Qwen、GLM、豆包们)并行跑同一批图,攒一周diff率;
存量迁移别动路由主逻辑,用配置切换,Exp端点哪天改价、限流或者下线,你只需要回滚一个字符串;
批量任务先拿detail=low跑一遍计费口径,确认换算出来的token单价和你的图片尺寸分布匹配,再决定要不要开original。

谁今天值得动手,谁可以再等等
适合今晚就调的:手头有截图转代码、图表问答、终端Agent这类"视觉+干活"任务的开发者——83.9那项基准就是为这类场景准备的;以及一直想试DeepSeek识图但没卡自部署托管版的人。
建议再等一周的:做GUI自动化、复杂多步操作的,25.7放在那;把"读小字、抠表格数字"当命脉的,64.3放在那;还有对"原生多模态"有执念、想看V4.1架构正式版什么时候把视觉能力接进主线的人——今天这个Exp,更像是那次会师前的前哨站。
至于"闭源还能不能卖25倍价"的话题,这两周社区已经吵累了。对普通开发者来说真问题一直只有一个:这条便宜的眼睛,看你的那类图到底准不准。今天官方把入口和尺子都递过来了,剩下的活儿,是拿你自己的三十张图去量一遍。