1000张图29块和1块1:DeepSeek看图模型开源两周,这张官方跑分表故意没考“看图答题”

源自171位全网作者

04:46

一张图差 25 倍,改变了产品设计的边界

8 月底到现在,多模态圈最实在的变化不是哪家又发了新模型,而是"看图"的价格被重新定价了。

同一张 1024×1024 的图片,喂给 Claude Sonnet 4.6 要占 1334 个 token,1000 张图的输入费用约 4 美元,折人民币接近 29 块;换成 GPT-5.4 Vision 是 765 token、1.9 美元;Gemini 3.1 Pro 相对省,258 token、0.5 美元。而 8 月 21 日上线的 DeepSeek-V4-Flash-Vision-Exp,给出的是一刀切的封顶值:每张图最多 384 token,计费价格与纯文本的 V4-Flash 完全一致——输入 3 元/百万 token,低谷时段再打五折。同样 1000 张图,输入成本约 1.15 元,谷时不到 6 毛。新智元 这组横评数字来自 TokenMix,原始口径由新智元报道引用。

25 倍只是静态账,真正的分水岭在用法上。新智元那句话值得抄下来:"一千张图三十块和一千张图一块钱,是两种产品设计。"前者逼着你给 Agent 装一个"这一步到底要不要看图"的开关,后者允许你每跑一步都截个屏丢进去。新智元 价格塌方省下的不是钱,是设计空间。

十天时间线:从 API 上线到权重全放

这个模型的动作是分三步走完的。8 月 13 日,DeepSeek Harness 开源并原生支持 Responses API。8 月 21 日,V4-Flash-Vision-Exp 在 API 平台上线,名字里带 Exp,官方口径就是实验模型,接受 JPEG、PNG、GIF、WebP 四种图片格式。微博 同一天 Harness 0.1.1 跟进发布,base64 内联、外部 URL、file_id 引用三条入图路径都备好了,Files API 同步免费开放,同一张设计稿、同一份报表不用每轮重复上传。新智元

8 月 31 日,权重上到 HuggingFace:MIT License,305B 总参数、每 token 激活 13B,视觉编码器、aligner、整套推理代码,safetensors 直接下载。微博 当晚话题下热度最高的一条相关讨论有 1954 个赞、353 条评论,有做产品的人说得很直白:多模态 API 调用成本是个无底洞,这波开源对小团队太解渴了。

把时间轴拉长看,这不是孤立事件。8 月 3 日 MiniMax 发多模态模型 H3,性能强价格低,关键也开源。36氪 9 月 4 日 Z.ai 披露 GLM-5.3-Flash 的技术路线,预训练用了约 30T token 的多模态语料。知乎 还是 9 月 4 日,微信开源通用多模态嵌入模型 wemm-embedding,自述跑分超过此前领先的 8B 开源模型。知乎 多模态的价格战不是预告,是已经开赛。

跑分表有个关键细节:它故意没考"看图答题"

如果你打算看完跑分表就迁移,可能看错了考卷。

官方放出的性能表里没有 MMMU、MathVista、DocVQA、ChartQA、OCRBench——视觉模型圈的"标准五件套"一项都没有,取而代之的是一堆 Agent 味很重的科目:TerminalBench 2.1 拿到 83.9,DeepSWE 59.3,ApexBench 36.5(比"忽略多模态"的 V4-Flash-0731 高出约 10 分),外加 Chartography、Agents’LastExam 这类"看完图把事做下去"的基准。字母 AI 8 月 24 日在 36 氪的评价一针见血:没有一项是"看图答题",全是"看完图,把事做下去"。字母AI

1000张图29块和1块1:DeepSeek看图模型开源两周,这张官方跑分表故意没考“看图答题”

这和梁文锋此前的表态对得上:多模态"对智能的上限是一个组件,不是主线本身",V4 后续版本会支持原生多模态。字母AI 所以这个模型从第一天就不是拿来跟图片聊天的,它是给 Agent 装的眼睛。跑分表考什么,就是厂商想让你用什么姿势用它。

两句提醒:表里同时列了 Opus-4.8 作对照,TerminalBench 83.9 对 85.0、ApexBench 36.5 对 39.4,B 站流传的"多模态 Agent 部分基准超过 Opus 4.8"这类说法,出自自媒体解读,逼近是真的,全面反超在官方表里并不存在。哔哩哔哩 且发布初期没有技术报告,8 月 24 日连权重都还没放,8 月 31 日的开源是后补的惊喜——引用它的结论时,请把信源等级分清。

它能干什么,暂时干不好什么

9 月 5 日知乎上的最新实测:丢一张微服务架构图,模型能准确识别出服务注册中心、网关、数据库等组件,并描述各模块之间的调用关系,几十秒给出结构化说明。知乎 但给一张 UI 设计稿要求 1:1 还原成 HTML/CSS,同一篇实测的结论是"整体结构八九不离十,还需要微调"。小红书一位建筑师 9 月 4 日的吐槽也印证了这类任务的真实体感:AI 用一分钟生成的页面,为什么最后还要修改十几轮。小红书

1000张图29块和1块1:DeepSeek看图模型开源两周,这张官方跑分表故意没考“看图答题”

1000张图29块和1块1:DeepSeek看图模型开源两周,这张官方跑分表故意没考“看图答题”

首批接入用户的另一条反馈是关于延迟的:识图没有想象中快,还是要反应一会儿,但比接别的 OCR 模型快多了。小红书 也就是说,它比"外挂第二个模型"的方案顺滑,但别按 App 端零延迟的预期去排产品设计。名字里的 Exp 更要记住:实验版本,随时可能被正式版替换或调整接口。

三类人,三个迁移答案

重度调用的 Agent 开发者:现在就切。 成本模型已经变了——每步截屏做视觉检查、每个报错丢截图调试、整本报表逐页过,这些以前"太贵所以砍掉"的场景现在都划算。Harness 0.1.1 开箱即用,适配代码一行不用写。

传统视觉任务用户(做题、精细 OCR、密集文档 VQA):别急着全迁。 官方没放五件套基准,“看懂图"的实测上限是"八九不离十还要微调”。需要 MMMU、DocVQA 榜上的硬成绩,Gemini 3.1 和 Qwen3-VL 仍有存在的理由。把 DeepSeek 视觉当赠品用很爽,当主力还得再验一轮。

自部署玩家:已经跑 V4-Flash 的等于免费升级。 B 站评论区有用户实测,Vision-Exp 的权重只比 V4-Flash-0731 大了 1GB 左右,部署方案疑似可以直接沿用。哔哩哔哩 但对没跑过 305B 总参数模型的人是另一回事,先按 FP8 权重加 KV Cache 算清楚显存账。MIT 协议商用随便改,合规自查自己做。

下一步盯什么

三个信号点:一是梁文锋承诺的"V4 后续版本原生多模态"正式版发布时,补不补标准视觉五件套——补了才谈得上全面迁移;二是 384 token 封顶和谷时五折在正式版里保不保;三是 9 月 2 日李飞飞 WorldLabs 发布的 Atlas,官方定义它是面向空间智能的世界模型,可以原生处理文本、图像、视频、相机位姿与 3D 深度信息。爱范儿 只要丢进去 1 到 6 张普通照片,定好运镜轨迹,就能生成最长 1 分钟、1440p 分辨率的画面——聊天式多模态在卷价格,空间式多模态刚开赛,把多模态的想象力只放在"识图"上就晚了。

1000张图29块和1块1:DeepSeek看图模型开源两周,这张官方跑分表故意没考“看图答题”

一句话收束:DeepSeek 这次没有做出"最强看图模型",它做出的是"看图不再单独收钱"。能力商品化之后,门槛消失,判断才刚刚开始。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章