DeepSeek-V4-Flash-Vision-Exp API重上线第一天:「终于不瞎」半真半假,83.9、64.3、25.7逐列对过Opus再动生产

源自156位全网作者

04:30

今天下午开始,微博和知乎的时间线被一句话刷屏:DeepSeek终于不是瞎子了。配的表情一半是狂欢一半是阴阳。事情本身是真的:9月17日下午,DeepSeek官方API开放了一个叫 DeepSeek-V4-Flash-Vision-Exp 的模型调用,模型名里就带着vision,官方定位写得很克制——实验性多模态视觉理解模型,能读图、认字、解析图表,不生成图。微博

但如果你打算今晚就把家里的识图管线往这边搬,有三件事值得先花五分钟:第一,"装眼睛"这事根本不是今天才发生的;第二,首日跑分表里最该看的不是"逼近Opus 4.8"那句口号,而是一个25.7;第三,接口文档今天放出来的四条限制,每一条都够让抄教程的人撞一次400报错。

「长眼」不是今天的新闻,今天多的是官方托管入口

把这半年的节奏拉直了看,你大概就明白社区那句"等了四个月"有多虚:

  • 8月下旬,官方先上了一个视觉看图模型,当时连"1000张图1块钱"这种价格都炒过一轮。36氪

  • 8月底到9月初,V4家族第一个多模态权重 V4-Flash-Vision-Exp 挂上Hugging Face,模型卡上明晃晃写着 MIT License、305B params,配套放了Harness工具链和含视觉编码器、稀疏注意力的PyTorch最小实现。微博

  • 9月10日,V4.1 Flash正式发布,官宣"原生多模态视觉理解",API定价同步下调,闲时输入缓存命中从每百万token 0.05元降到0.02元,降幅60%。同一天,旧版 V4 Flash 和 V4 Flash Vision Exp 被下线,模型名暂时路由到 V4.1 Flash——网页端也不用再单独选"视觉实验版"了,发图直接给主模型就行。微博

  • 9月17日,也就是今天,官方公告这个实验模型在 DeepSeek API 平台重新上线:纯文本能力对齐 V4-Flash 正式版,视觉 Agent 任务相比 V4-Flash 大幅提升,多模态 Agent 基准表直接摆出了和 Opus 4.8 的逐列对比,连 Harness 都同步更新了 0.1.1。知乎

所以今天真正的增量不是"从瞎到看见",而是:一个你本来只能自己下权重、自己找卡部署的开源实验模型,现在官方替你托管好了,接口规格、图片格式、detail等级、限制全都白纸黑字写出来了。这对没有富余显卡、又一直在等DeepSeek识图能力的开发者,才是实打实的变化。反过来说,权重开源那两周你都没动手,今天也不会因为一条热搜就突然必须动手。

拆开首日跑分表:和Opus 4.8逐列对过之后,"逼近"二字反而更站得住了

官方今天给的是一张对照表:左列是自家上一版V4-Flash-0731,中间是Vision-Exp,右列直接放了Claude Opus 4.8。把关键数字挑出来:

基准(官方首日表)

Vision-Exp

V4-Flash旧版

Opus 4.8

Terminal Bench 2.1

83.9

82.7

85.0

DeepSWE

59.3

54.4

58.0

Agents’ Last Exam

27.3

25.2

25.7

Chartography(图表理解)

64.3

65.0

ApexBench(多模态Agent)

36.5

26.2

39.4

AutomationBench

25.7

25.1

27.2

DeepSeek-V4-Flash-Vision-Exp API重上线第一天:「终于不瞎」半真半假,83.9、64.3、25.7逐列对过Opus再动生产

之前两周社区传"开源版DeepSWE 59.3%反超Opus 4.8",以为那是评测方另一张卷——今天官方表证明出处就是这一张,DeepSWE、Agents’ Last Exam、Terminal Bench三项里它确实压着或咬住了Opus。 但逐列看完,"接近Opus 4.8"这句热搜文案的准确打开方式是:它接近的是Opus的分数,同时也接近了Opus的天花板。微博

三个该冷静的点:

第一,没有任何一项真正甩开Opus。DeepSWE赢1.3分、ALEx赢1.6分,Terminal Bench和ApexBench还落后着。一张表里它最强的是"视觉+代码/终端Agent"这个组合拳,而不是泛泛的"看图说话"。

第二,Chartography停在64.3。图表专项对Opus只输0.7分,听着好听,但绝对值意味着十张财报图、监控截图、复杂坐标轴,它要错将近四张。做"报表自动摘要"可以,做"照着这张图做对账"不行。

第三,AutomationBench两边都趴在地上。Exp 25.7,Opus 4.8也才27.2。识图和"看着图把活干完"是两回事,中间隔着的是动作规划,不是视力——这条赛道目前全行业都在及格线以下,谁也没资格笑话谁。

接入前,今天文档里的四条限制每条都会咬人

从官方API文档和首批实测解读里,能拎出四个新人必踩的点:

  1. 图片只能出现在user消息里。塞进system或assistant消息,直接400。 很多从别家视觉API迁过来的封装代码默认图可以放任意消息位,今晚就会红一片。知乎

  2. 格式按文件实际内容判断,不看后缀也不看MIME声明。把PNG改名成.jpg不会变成JPEG。校验失败别先去翻扩展名。

  3. 三种传图方式,限制不一样:base64受请求体大小约束;URL方式最长8192字符、单图最大32MiB、60秒内必须下载完成(防盗链图床直接出局);Files API上传后引用file_id,单图可放宽到64MiB,同一张图反复分析走这条最划算。

  4. detail给了四档,成本和效果是一根绳。low适合"照片里有什么"级别的需求;要读截图小字、表格数字、界面按钮布局得上original。但大图不一定无脑加token——图会被缩小,缩完小字反而更难认。图按尺寸换算成token,和文本一起计费,"图越大越好"是错觉。

DeepSeek-V4-Flash-Vision-Exp API重上线第一天:「终于不瞎」半真半假,83.9、64.3、25.7逐列对过Opus再动生产

名字里的Exp三个字母,比跑分更该决定你怎么用它

DeepSeek处理"实验"这个词是有前科的:上一轮V4.1 Flash内测接口开了48小时就下线;旧V4 Pro也是说路由就路由,北京时间9月14日中午12点后,官方API把旧Pro的请求自动转到新Flash、按Flash收费。 更讽刺的是,这次的主角自己也走过一遍这个流程:9月10日,旧版V4 Flash和Vision Exp双双下线,模型名被暂时路由到V4.1 Flash,一周后才被重新召回来。 你可以不签SLA用免费额度练手,但没道理让一个带Exp后缀、已经下线过一轮的端点当生产链路里的独苗。微博微博

今天比较稳的姿势是给它一个实验位而不是主力位

  • 新增的业务直接上双轨,vision-exp和你现有的识图API(Gemini、Qwen、GLM、豆包们)并行跑同一批图,攒一周diff率;

  • 存量迁移别动路由主逻辑,用配置切换,Exp端点哪天改价、限流或者下线,你只需要回滚一个字符串;

  • 批量任务先拿detail=low跑一遍计费口径,确认换算出来的token单价和你的图片尺寸分布匹配,再决定要不要开original。

DeepSeek-V4-Flash-Vision-Exp API重上线第一天:「终于不瞎」半真半假,83.9、64.3、25.7逐列对过Opus再动生产

谁今天值得动手,谁可以再等等

适合今晚就调的:手头有截图转代码、图表问答、终端Agent这类"视觉+干活"任务的开发者——83.9那项基准就是为这类场景准备的;以及一直想试DeepSeek识图但没卡自部署托管版的人。

建议再等一周的:做GUI自动化、复杂多步操作的,25.7放在那;把"读小字、抠表格数字"当命脉的,64.3放在那;还有对"原生多模态"有执念、想看V4.1架构正式版什么时候把视觉能力接进主线的人——今天这个Exp,更像是那次会师前的前哨站。

至于"闭源还能不能卖25倍价"的话题,这两周社区已经吵累了。对普通开发者来说真问题一直只有一个:这条便宜的眼睛,看你的那类图到底准不准。今天官方把入口和尺子都递过来了,剩下的活儿,是拿你自己的三十张图去量一遍。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章