8月31日深夜,DeepSeek把V4家族第一个能看图的多模态模型开源了:DeepSeek-V4-Flash-Vision-Exp,MIT协议,放出不只是权重——Tokenizer、图文提示编码参考实现、覆盖Vision Encoder到MoE的最小PyTorch推理代码全给。仓库约168GB、48个分片,总参数约304.6B。知乎
对已经天天用V4-Flash写代码、跑Agent的人来说,真正的问题不是"DeepSeek能不能看图了",而是同一件事:官方跑分里它登顶反超Opus-4.8,社区实测里它把3个矩形数成4个。这条线到底画在哪?

跑分是真的,但"登顶"要加个注脚
先看模型卡给出的几组数字:真实世界软件工程测试DeepSWE拿了59.3%、超过Opus-4.8排第一;Toolathlon-Verified 75.9%、只差Opus 0.3个百分点;ZeroBench 35.0对比34.0、Agents’ Last Exam 27.3对比25.7,都是登顶。智东西对比自家纯文本基线V4-Flash-0731,加了视觉模块后文本项不降反升:Terminal Bench 82.7→83.9,DSBench-Hard 59.6→63.6。
但官方模型卡自己藏了一行小字:ApexBench和Agents’ Last Exam两项里,基线V4-Flash会直接忽略输入里的多模态元素——这两列的对比更像"有没有眼睛"的对照,不是同条件的强弱排名。知乎另一边,ApexBench它36.5对Opus的39.4确实落后,图表生成Chartography 64.3对65.0小幅落后,需要深厚代码库理解的NL2Repo更是57.7对69.7、差着约10个点。
一句话整理:它的强项是界面操作、读图后继续干活(Agent流程),弱项是细粒度视觉生成和高复杂度结构化任务。把"登顶"当"全面追平Opus",是这波传播里最大的误读。
384个token:它能看多清,就藏在这一个数里
开源config里最有信息量的不是参数量,是视觉链路的两个设定:ViT编码器出来的patch特征,进语言模型前由Aligner做3×3合并;单图token上限锁死384。按公开参考实现推算,384×9×196≈67.7万像素,约等于823×823——不管你喂4K截图还是缩略图,模型实际"看到"的信息量都压缩到这个量级。知乎爱可可在社区里做的折算是同一个口径:所有大图入炉前都会被压缩到800×800像素左右,单张图的token消耗锁死在384个。微博
这个瓶颈直接解释了今天所有的"精分"表现:
它看得清的:报错弹窗、UI布局、图表趋势、网页截图转代码——B站已有UP主拿它做知识库Markdown提取,界面理解类任务是它基准成绩最好的地方。每张图固定384 token,还有个隐藏福利:成本完全可预测,API价格与V4-Flash文字版一致,社区按输入侧折算一块钱约能处理两千多张图。微博做批量截图问答的Agent,预算表好算了。
它看不清的:小字OCR、密集票据、精确计数、找细节差异——实测里"认得马斯克、认不出自家老板梁文锋,3个矩形数成4个,墙上时钟读错",全是这类超出800×800有效分辨率的活。哔哩哔哩注意这些是社区样本、不是系统性评测,但方向和token瓶颈的推算完全对得上。
它压根没眼睛的:音频。名字里的Exp不是装饰,目前不支持音频输入,官网和API都吃不了视频。

今晚开源了,你要不要跟着动手?
先用API,别先下载。8月21日起deepseek-v4-flash-vision-exp就进了API默认目录,图文交错输入、支持Tool Calls和Responses API,价格不变。验证你的场景(截图转MD、图表读数、UI自动化)值不值得接,API一圈跑分就够。
168GB不是给生产用的。README写得直白:仓库提供的是readable reference implementation,不是production serving engine,生成循环是朴素自回归采样。它更适合想读MLA极压缩(num_key_value_heads=1)、YaRN拉到1M上下文、FP4专家量化这套代码的人。真要多卡部署,304B级权重对存储和显存的要求完全是另一篇文章的事。
同夜战场已经挤了。腾讯混元发布并开源Hy4preview,总参770B、激活49B、上下文1M,许可证Apache2.0,和DeepSeek前后脚发布;智谱GLM-5.3-Flash——就是OpenRouter盲测里爆火的OX-Alpha——匿名测试流量完全跑在国产AI芯片上,前端口略上被UP主认为跟V4-Vision互有胜负;Qwen3.8-Flash则在外拼定价。知乎低价多模态这个赛道,8月是按月过版本的节奏。

继续盯三个信号:Exp去掉后缀的正式版(官方一个月四轮更新的节奏,不会太远)、音频模态是否补上、以及600张/请求那个传闻数字有没有官方确认。如果你手上是票据、小字、精确比对类需求,现在先别把视觉流程焊死在任何一个模型上——拿你自己的图,跑一轮"数得对不对、小字读不读得出"的最小测试,再决定接不接。
眼睛DeepSeek是长出来了,只是这颗眼睛的度数,目前刚好够看路、不够读报纸。