8月31日深夜,DeepSeek把DeepSeek-V4-Flash-Vision-Exp直接挂上了HuggingFace,MIT协议,没有预热海报,没有发布会。权重、Tokenizer、图文提示编码参考实现、一份最小PyTorch推理代码,一次全放出来。微博话题#DeepSeekV4多模态模型正式开源#当晚刷屏,被反复引用的一句话是,你我可以把它下载到本地,用自己的数据微调,接进自己的产品里,不用看API脸色,也不用操心调用额度。微博
听起来是微调圈的大日子。但我把官方模型卡、几个逐文件精读的拆解帖、B站和微博的评论区翻了一遍之后,先给结论:对绝大多数微调玩家来说,这次开源从第一步起就不该是"去微调它"——但有三笔比训练脚本实在得多的账,今晚就能算。
一、先看清开源了什么:权重给了,训练的东西没给
这是最容易传歪的一环。开源清单其实很有讲究:模型卡拆解写得清楚,这次开放的不只是权重,还有tokenizer、图文提示编码的参考实现,以及覆盖Vision Encoder、Aligner、MoE等模块的最小PyTorch推理代码,协议为MIT。知乎
体量上,据公开媒体报道,模型总参数约304.6B,权重分48个Safetensors分片,仓库体积约168GB;官方模型卡没有直接标注参数量,引用时要以仓库实际文件为准。知乎
推理代码的边界,官方README写得比谁都直白:这是readable reference implementation,不是production serving engine,生成循环还是朴素自回归采样;模型名带Exp后缀,属实验版本。知乎而这个Exp版本并非凭空出现——它曾在8月21日以API形态亮相过一轮,这次是V4系列首个实验性多模态模型直接放出权重。知乎
换句话说:DeepSeek开放的是"怎么跑起来、怎么把图喂对"的完整链路,没有开放"怎么接着训"的链路。没有训练脚本,也没有官方微调指南,仓库把提示编码和推理分成两个目录,让你先不下168GB权重、在无GPU环境下就能验证消息编码——从目录结构看,这都是奔着部署者设计的,不是奔着炼丹者的。
二、显存这关,大多数人今天就没资格过
168GB只是推理的门票。量化权重常驻、KV缓存、激活值,多模态还会再加一路视觉token;真要微调,梯度、优化器和激活显存都得往上叠。LoRA号称只训1%参数,显存却从来不会按比例省——这件事社区已经反复验证过。
304.6B的MoE模型做单机LoRA微调,对消费级设备就是不存在的路径。有意思的是,社区的反应也很诚实:B站上"V4多模态本地部署+插件"的视频拿到5500多播放,AI日报单期冲到6.7万播放,评论区聊的全是DSH怎么装、API账单怎么省,几乎没有人在讨论"我怎么微调它"。B站一句高赞回复把心态说透了:大家惦记的是用得起,不是训得起。
DeepSeek自己的定位其实也不是让你训它。知乎热帖回答里讲得明白:它要的是把V4-Flash升级成能读取截图、图表和视觉反馈的多模态Agent底座,而不是做一个视觉问答模型。知乎"没人动手"不代表这个开源没价值,只代表轮不到微调这一步。那什么轮得到?往下看。
三、第一笔能抢的账:一个商用无限制的"老师"
评论区有个很懂行的讨论值得展开。有人调侃这次是"原汁原味的MIT",楼里跟的解释是:很多所谓开放权重模型用的是自定义协议,商用超过一定限额就要向厂家付费;MIT对商用和个人使用没有显著限制,是最宽松的一档。B站
配合API涨价的背景(V4-Flash公开价每百万输入0.14美元、输出0.28美元,此前刚经历过一轮调价),微调人群真正该记住的用法是:把它当免费的训练数据生成器。实测口碑很实在:有人拿它和Kimi K3做了一轮视觉对比(物品识别、OCR、古籍识别、UI还原、工业缺陷检测),结论是便宜、快、Token消耗低,但复杂视觉理解和高精度任务上与T1多模态还有差距。B站也就是说,它当"老师"批量打标够用,当"冠军选手"上岗还差一口气——而微调要买的恰恰是前者。
方向已经有人趟了:B站就有个人微调作者公开转型,标题写得直白——“个人微调失败,重整上路用DeepSeek API生成数据”。B站你要做垂类小模型(质检、图表解析、短剧分镜、UI代理),底座还是Qwen3-VL这些能落地的尺寸,数据交给V4-Vision批量生成,MIT协议意味着这批数据干干净净能商用。权重开源的最大红利,往往先兑现在蒸馏链路上,而不是训练链路上。
四、第二笔能抢的账:单图384 token,多模态Agent的成本尺子终于有了
这是整个发布里对自建团队最有工程价值的一个数字:V4-Vision的Aligner对视觉特征做3×3合并,单张图进入语言模型的token消耗上限固定为384;按config里的合并逻辑推算等效输入约823×823像素,图再大也压进这个量级(推算值,非官方标注;另有报道称单请求最多600张图,未见于官方config,仅供参考)。知乎
对做多模态Agent的人,这个上限直接决定截图流、读图流的token账单是不是可控。再看模型卡的两组对比,含金量就清楚了。对内:相比纯文本基线V4-Flash-0731,文本能力不降反升——Terminal Bench 82.7→83.9、DeepSWE 54.4→59.3、Toolathlon-Verified 70.3→75.9、DSBench-Hard 59.6→63.6,仅Cybergym略降。知乎对外:和Opus 4.8互有胜负——Agents’ Last Exam 27.3比25.7、ZeroBench 35.0比34.0领先,ApexBench 36.5比39.4、Chartography 64.3比65.0小负,NL2Repo 57.7比69.7差距明显。
但官方脚注里埋着一个坑:ApexBench和Agents’ Last Exam两项,基线模型会直接忽略输入里的多模态元素,这两列更接近"有没有视觉"的对照,不是同条件的排名。读开源模型卡,先读脚注再读分数,这是被割过的人才会有的习惯。
这组数据翻译给微调人群就一句话:"文本底座持续训练加视觉模块、不掉文本分"这条路被验证走通了。你自己想给行业小模型补视觉,配方思路有了,成本基准有了,剩下的问题是生态。
五、第三笔账:真要在今天开工多模态微调,答案还是Qwen3-VL
热度是生态最诚实的指标。B站头部教程"Qwen3-VL部署与微调实战"4500多播放、300多赞,从数据集清洗、LoRA超参到微调前后效果评估的全流程都有人踩过坑。B站小红书更直接:有人放出Qwen3-VL-8B的多模态微调脚本,训练加推理两个文件拿来就能跑,200多个收藏。小红书
再看DeepSeek这边:304.6B的体量、Exp实验版、训练代码缺位、LLaMA-Factory和ms-swift的支持还没见影。同样是"开源",一个是可以今晚clone开训的底座,一个是只能先部署先蒸馏的参考实现。这不是谁好谁坏,是时间差。
六、盯这三个信号,再决定要不要动训练卡
去掉Exp的正式多模态版本,以及随版本发布的训练或微调指南——评论区已经在等这一发了:“还以为要等去掉Exp的版本”。B站
小尺寸V4-Vision出现,或ms-swift、LLaMA-Factory、Unsloth任一主流工具官宣支持——工具链落地那天,才是这套权重在微调圈真正生效那天;
API侧是否把384 token/图的口径写进价目表——按公开价目,V4-Flash每百万输入token0.14美元、输出0.28美元,视觉token口径直接决定截图类Agent的真实单价。知乎
这三个信号任何一个落地,我会建议深度玩家认真排一次训练预算。在那之前,这篇的三个动作够用了:拿它生成数据、拿它校准成本、拿它的评测脚注练读模型卡的手感。
一句话收束:这次MIT开源是给生态的,不是给你家那张24GB显卡的。先当老师用,先当尺子用,微调的账,等工具链替你算完再签。