被“看图识人”气笑后,我测了下DeepSeek刚出的这个“视觉模型”
最近想折腾点自动化的小工具,但一碰到处理截图、识别界面元素这种事儿就头疼。之前用的纯文本模型遇到图片只能“编”一个分析工具来应付,帮不上什么忙。正好看到DeepSeek刚开源了它的第一个多模态模型DeepSeek-V4-Flash-Vision-Exp,说是给AI装上了“眼睛”,价格还和纯文本版一样。我心想这好事儿得试试啊,用了几天,说几个真实感受——有好有坏,不吹不黑。

一、这双“眼睛”到底能干啥?
简单说,这个模型就是在原来的DeepSeek-V4-Flash纯文本模型上,加了一个“看图”的DLC扩展包,而且价格不变。
它支持在文本之外输入图片,可以让模型描述图片、识别截图中的文字、分析图表等,支持的图片格式包括JPEG、PNG、GIF、WebP。对于开发者来说,可以通过设置 model='deepseek-v4-flash-vision-exp' 来调用API,支持Chat Completions、Messages、Responses三种调用格式。
几个关键参数值得注意:
定价与V4-Flash一致:一张图片最多占384个token,按token计费,没有额外的视觉处理溢价。对比一下,GPT和Claude处理同等分辨率的图片通常要消耗800到1100个token。
1M超长上下文:最大输出长度384K,支持JSON Output、Tool Calls等。
官方明确标注为“Exp”实验版本,不建议直接用于生产环境。

二、实测:哪些场景靠谱,哪些场景翻车
场景一:图表识别——靠谱
我拿了一张折线图喂给它,让它分析趋势。结果折线图能读懂、粉丝增长正负能判断、二次计算也能做。在Chartography这项图表理解评测中,Vision-Exp拿到了64.3分,接近Opus-4.8的65.0分。日常工作中处理报表、看数据图表,这个能力完全够用。
场景二:OCR文字识别——精准
找了一张带错误的发票截图扔进去,识别结果非常精准,而且我没有告诉它要找出错误,它也顺便把问题给指出来了。截图转文字、文档图片内容提取这类活儿,Flash Vision基本能搞定。
场景三:代码/UI复刻——勉强能用
有人做了个实验:让模型用HTML复刻一个复古掌机。第一次纯文字描述,效果按钮布局明显不对劲;第二次给了实机参考图改了一版,大体结构有了,但菜单文字溢出错位;第三次对着标注图继续改,诡异的事情发生了——它读到了“删除黑×处阴影”的指令并执行了,但红圈和黄圈两处标注的目标位置,模型完全没动,只是把阴影颜色改成了标注用的颜色。
这个行为模式很有意思:如果真“看见”了标注圈,不会把“圈”理解成“换颜色”;但如果是有个人在旁边说“把这两处阴影一处改红色一处改黄色”,这个反应就完全说得通。
场景四:身份识别——大型翻车现场
我把DeepSeek创始人梁文锋的照片发给AI,结果模型思考了1分29秒后,信心满满地告诉我,照片中的人物是泡泡玛特的CEO王宁。也有其他网友试了,有识别出张雪峰的、有识别出张一鸣的、还有识别出是Kimi创始人杨植麟的,一个比一个离谱。
更有开发者给模型看一张三位长相气质相似的演员同框照,DeepSeek不仅认不出来,还把三个人都当成同一个人。同一个测试,豆包直接标出三位演员的名字和曾用名。
场景五:数数/细粒度识别——基本报废
最直接的翻车来自“数矩形”实验——图上只有3个大矩形,模型答出4个,连基本数量都数错,后面推理自然全错。这个任务靠文字描述几乎不可能完成,属于典型的“看图说话”失灵。
社区实测反馈比较实在:细粒度视觉推理还有提升空间,比如读钟表指针、辨认地标这类任务,暂时不如字节的Seed模型。
三、横向对比:和竞品比怎么样?
官方给出的基准测试数字挺唬人:
评测项目Vision-ExpV4-Flash-0731Opus-4.8Terminal Bench 2.183.982.785.0DeepSWE59.354.458.0ApexBench (Pass@1)36.526.239.4Agents' Last Exam27.325.225.7Chartography64.3-65.0
数据来源
在需要视觉理解的Agent Benchmark上,Vision-Exp相比纯文本的V4-Flash实现了大幅跃升,多模态Agent能力已接近Opus-4.8。在ApexBench等四项多模态评测中,甚至与Opus-4.8打成了2:2平手。
但跑分归跑分,实际体验是另一回事。身份识别翻车、数数都能数错,说明细粒度视觉理解还有很长的路要走。
四、总结:适合谁?不适合谁?
适合:
需要截图转文字、文档图片解析、简单图表分析的打工人
想做多模态Agent开发但预算有限的开发者
在意成本和国产化支持的团队
不适合:
需要精准人脸识别、细粒度视觉推理的场景
需要“仔细辨认图中每个细节” 的任务
生产环境直接使用(官方标注Exp实验版本)
个人结论:
如果你的需求是“看完图给个判断”,它够用;如果需要精确识别细节,可能还得等后续迭代。
价格确实是最大亮点——一张图最多384个token,按高峰期价格算,花一分钱就能请它帮忙看8张图。作为DeepSeek V4系列首款原生支持图片输入的视觉模型,它迈出了重要的一步,但“Exp”这个后缀也提醒我们——故事才刚开始。
我会继续用,但主要拿来处理图表分析和OCR这类靠谱的场景,人脸识别和精细活暂时不敢交给它。
作者声明本文无利益相关,欢迎值友理性交流,和谐讨论~
