DeepSeek V4 首个多模态模型,MIT 开源了

8 月 21 日刚上线 API,10 天后的 8 月 31 日,DeepSeek 就把 V4-Flash-Vision-Exp 完整权重甩上了 Hugging Face——官方组织直发,连开源公告都没发,仓库比消息先到👇
👀 这是什么
V4 系列首个实验性多模态模型。基于 V4-Flash 架构加视觉模块,总参数 305B(MoE,每 token 只激活 13B),看图、读图表、看网页界面都能干,纯文本 Agent 能力没掉队。
🎁 开源了什么
完整权重:约 168GB、48 个 Safetensors 分片(FP8 权重 + FP4 专家存储)
Tokenizer、图文 Prompt 编码、权重转换工具
最小 PyTorch 推理实现:覆盖视觉编码器、Aligner、DFlash、MoE、Hyper-Connections、DSpark 全链路
MIT 协议:可商用、可私有化部署、可微调,延续 R1 以来的开源路线
官方支持 vLLM、SGLang 部署,社区已出 6 个量化变种(Ollama/LM Studio 可跑)
📊 官方自测成绩
多模态 Agent 能力官方口径「已接近 Opus-4.8」:ZeroBench 35.0 反超 Opus-4.8 的 34.0,ApexBench 36.5 比纯文本版 26.2 大幅跃升,图表理解 Chartography 64.3。
⚠️ 门槛也摆在这
305B 权重不是闹着玩的:FP8 精度约需 305GB 显存(约 4×A100-80G),BF16 更要 610GB+。普通个人电脑别想了,本地跑基本是「研究机构 + 多卡玩家」专属,大多数人还是走 API(视觉不加价,和文本 Flash 同价)。
💡 为什么值得记一笔
「无公告、直接放权重」本身就是态度:V4 系列开源拼图最后一块——多模态——补齐了。开发者拿到的不只是模型,而是可以脱离官方 API 自己研究、部署、二次开发的完整技术栈。
DeepSeek 又用一次「低调甩仓库」把开源水位拉高了一截,下一个跟上的会是谁?
评论区聊聊:168GB 的多模态权重,你会拿去做什么?👇
作者声明本文无利益相关,欢迎值友理性交流,和谐讨论~
