DeepSeek开源了给Agent的第一双眼睛:拆完305B权重和单图384token,这份"现在接还是再等等"清单给做Agent的你

源自139位全网作者

07:33

今年4月,DeepSeek多模态团队的人在X上发过一张"盲鲸长出眼睛"的图,评论区一片"到底什么时候能用上"。8月初,有人受不了了——写了一个桥接项目,让你在Codex里用V4-Flash时外挂一个读图模型,曲线实现"差不多多模态"的体验,微博上一百多人点赞收藏。微博

DeepSeek开源了给Agent的第一双眼睛:拆完305B权重和单图384token,这份

现在不用桥了。8月21日,DeepSeek-V4-Flash-Vision-Exp直接上线API;8月31日深夜,权重挂上HuggingFace,MIT License。知乎 三天过去,开发者社区的实测、拆解和争议一起涌出来。先说结论:这不是"又多一个看图模型"的新闻,而是开源Agent栈里最后一块拼图落位;但它是Exp,眼睛能看清路,还画不好像素。

这篇不堆参数,就回答三件事:它到底是什么、你的Agent现在该不该接、接了哪里会踩坑。

一、先把时间线和规格钉死

  • 8月21日:API平台先开放调用。36氪当天报道的标题很直白——“1000张图只要1块钱”。36氪

  • 8月31日:HuggingFace放出权重、Tokenizer、Prompt Encoding参考实现和一份最小化PyTorch推理代码,覆盖视觉编码器、Aligner、DFlash Attention、MoE、Hyper-Connections、DSpark等核心模块,MIT协议,商用不收费。先API后开源的十天间隔,定位很清楚:它首先是DeepSeek自己的服务能力,开源是生态策略。

  • 规格:稀疏MoE,总参数约305B、每token激活约13B,上下文1M、最大输出384K,与V4-Flash同档。

关键的不是这些数字,而是架构描述:它不是重新训练的独立视觉模型,而是在V4-Flash-0731文本底座上接入视觉编码器和Aligner持续训练出来的。官方明确说加视觉后纯文本能力没有缩水,Agent、推理、世界知识任务与V4-Flash正式版持平。评测口径上,官方措辞也很克制——“多模态Agent能力接近Claude Opus 4.8”,不是超越。知乎 第三方汇总里ApexBench冲到36.5分,在Chartography这类图表基准上提升明显。知乎

DeepSeek开源了给Agent的第一双眼睛:拆完305B权重和单图384token,这份

二、拆代码你会发现:这双眼睛真是给Agent装的

知乎上有团队把开源代码的视觉链路完整拆了一遍,几个细节值得所有Agent开发者看:

  1. 图片在主干里不装成人。视觉token被放在词表(129280)范围之外,模型靠`input_ids >= vocab_size`一眼识别"这是图"。MoE路由还给了视觉token一套专用的`bias_vl`——256个专家、每token激活6个,但图片和文字选专家时的排序影响因子不一样。知乎

  2. 单图384 token是真预算,不是营销。32层ViT先按14×14切patch、用二维RoPE建空间关系(这个设计对GUI很关键:按钮位置、表头对应、弹窗覆盖,全靠二维结构),然后Aligner把相邻3×3特征合并压缩,横竖各缩3倍,进入语言主干时单图预算`vision_max_n_token=384`。密度留给"看",成本砍在"进脑"这一刀。

  3. 计费跟着设计走。请求前图片等比缩到约800×800等效像素,所以2000×2000和5000×5000的图token消耗一样;detail参数low档再缩到512×512。图片按V4-Flash文本价计费,不单独收"图片服务费"。

  4. Files API暴露了真实使用场景。为什么要传一次文件、复用ID?因为官方想清楚了:Agent在任务闭环里会反复看同一张截图——先看、再推理、再执行、再看结果。base64每轮重传整张图是浪费。知乎

DeepSeek开源了给Agent的第一双眼睛:拆完305B权重和单图384token,这份

还有个容易被忽略的配套动作:DeepSeek自家Agent运行框架Harness 0.1.1在同一天原生支持了这个模型。知乎 而Harness这个月刚把Claude Code、Codex收编成子代理当"调度层"用——模型、执行框架、开源协议三条线拧在一起,意图不难读。

三、成本要算两笔,第二笔才咬人

第一笔便宜得反常:单图折算384输入token、按文本价,看1000张图约一块钱(API上线时36氪报道口径)。"视觉=价格翻倍"的行业惯性,这次没成立。

第二笔是频率。视觉Agent每轮观察都要重跑一遍缩放、patch化、32层ViT和Aligner,再进主干prefill。一个50步的浏览器Agent,每步看一张新截图,光图像侧就是约2万输入token——钱还是小头,大头是重复计算:相邻两张截图往往只变了一个按钮、一个弹窗,现在的链路还是整张重进ViT。知乎 拆解文章里点破了这一点:视觉缓存、帧差分发、DOM+视觉混合表示,都是留着的坑,也是留着的优化空间。

顺带一个同周被讨论的账单细节:推理类模型的思维链按输出token计费,跑Agent时这段"内心戏"容易被忽略。视觉+推理双开之后,账单结构比多数人想象的复杂,上线前务必用真实轨迹测一轮端到端成本,而不是拿单次问答价格外推。

四、社区实测地图:强在哪、虚在哪、本地能不能跑

把B站、微博和公众号这几天的实测横着拼起来,边界其实很清楚:

  • 稳的:错误日志、验证码、页面内容理解这类"看懂"任务基本没问题;图表/报表解析在Chartography等榜单提升有社区复现;"截图→可运行网页"的演示在多个评测里出现。

  • 虚的:像素级前端还原还不行。8月30日起就有B站UP主实测直言"内容理解没问题,前端还原还不行"——想拿它替代设计师走查还原度的,再等等。哔哩哔哩

  • 对手路线:8月27日智谱开源GLM-5.3-Flash,此前刷屏的匿名模型OX-Alpha就是它,主打原生多模态、匿名测试流量跑在国产芯片上。有UP主拿它和V4-Flash-Vision做过前端视觉对比测试——两家Flash路线的多模态各有胜负,手里有国产算力或已接智谱的,不必急着单押。哔哩哔哩

  • 本地部署:HuggingFace上已经出现面向llama.cpp、LM Studio、Ollama的量化版本,门槛在降。知乎但305B总参数摆着,13B激活只省推理算力、不省显存放权重——"免费跑"是API和高校集群的事,消费级显卡看个热闹就行,别对着B站"本地部署"标题冲动下单。

DeepSeek开源了给Agent的第一双眼睛:拆完305B权重和单图384token,这份

五、决策清单:现在接、再等等、以及三条保险

建议现在就试三类场景:GUI/浏览器Agent(视觉是为反复观察设计的,Files API+detail参数就是为你准备的);图表、报表、票据解析(384 token压缩链路就是为高密度信息页设计的);截图问答类的图文混合知识库。

两类建议再等等:像素级前端还原和多模态生成向的任务——实测短板明确;对错误零容忍的强监管业务流程——记住名字里的Exp,它是个能力很强的预览版。

三条保险现在就做:接入时钉死具体模型名,别写latest类别名;保留纯文本V4-Flash回退路径,视觉链路故障时Agent能降级;用自己业务里的真实截图和小号prompt跑一轮影子评测再切主链路——官方自己都说"跑分是参考,真正要接生产,拿自己的业务截图跑一遍"。知乎

六、接下来盯什么

四个信号值得放进观察列表:正式版(去掉Exp)的发布日期,那才是生产环境的开关;视觉KV cache或帧差输入的落地,那是成本模型的第二笔账被官方解决的时刻;量化生态的成熟度,GGUF/MLX版本能不能稳定跑决定本地路线真假;计费口径会不会变——"单图384 token、按文本价"是这次设计里最有诚意的部分,也是最值得盯着别退的一步。

四月那只被画上眼睛的盲鲸,现在真的睁开了眼。从今天起,文本+视觉+工具调用的开源Agent栈已经齐了——这比"DeepSeek能看图了"本身,更值得每个做大模型开发的人重新排一遍自己的技术栈。


本文事实均来自公开信源:DeepSeek HuggingFace开源权重与官方模型介绍、知乎技术拆解、微博开发者实测、36氪与B站评测报道;基准分数以官方与第三方口径为准,生产接入前请以自建评测为准。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章