DeepSeek V4 首个多模态模型,MIT 开源了

2026-09-01 16:12:03 0点赞 0收藏 0评论
DeepSeek V4 首个多模态模型,MIT 开源了

8 月 21 日刚上线 API,10 天后的 8 月 31 日,DeepSeek 就把 V4-Flash-Vision-Exp 完整权重甩上了 Hugging Face——官方组织直发,连开源公告都没发,仓库比消息先到👇

👀 这是什么
V4 系列首个实验性多模态模型。基于 V4-Flash 架构加视觉模块,总参数 305B(MoE,每 token 只激活 13B),看图、读图表、看网页界面都能干,纯文本 Agent 能力没掉队。

🎁 开源了什么

  • 完整权重:约 168GB、48 个 Safetensors 分片(FP8 权重 + FP4 专家存储)

  • Tokenizer、图文 Prompt 编码、权重转换工具

  • 最小 PyTorch 推理实现:覆盖视觉编码器、Aligner、DFlash、MoE、Hyper-Connections、DSpark 全链路

  • MIT 协议:可商用、可私有化部署、可微调,延续 R1 以来的开源路线

  • 官方支持 vLLM、SGLang 部署,社区已出 6 个量化变种(Ollama/LM Studio 可跑)

📊 官方自测成绩
多模态 Agent 能力官方口径「已接近 Opus-4.8」:ZeroBench 35.0 反超 Opus-4.8 的 34.0,ApexBench 36.5 比纯文本版 26.2 大幅跃升,图表理解 Chartography 64.3。

⚠️ 门槛也摆在这
305B 权重不是闹着玩的:FP8 精度约需 305GB 显存(约 4×A100-80G),BF16 更要 610GB+。普通个人电脑别想了,本地跑基本是「研究机构 + 多卡玩家」专属,大多数人还是走 API(视觉不加价,和文本 Flash 同价)。

💡 为什么值得记一笔
「无公告、直接放权重」本身就是态度:V4 系列开源拼图最后一块——多模态——补齐了。开发者拿到的不只是模型,而是可以脱离官方 API 自己研究、部署、二次开发的完整技术栈。

DeepSeek 又用一次「低调甩仓库」把开源水位拉高了一截,下一个跟上的会是谁?


评论区聊聊:168GB 的多模态权重,你会拿去做什么?👇

作者声明本文无利益相关,欢迎值友理性交流,和谐讨论~

展开 收起
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

相关文章推荐

更多精彩文章
更多精彩文章
最新文章 热门文章
目录
0
扫一下,分享更方便,购买更轻松