DeepSeek V4首个视觉模型全量开源:先别急着吹"接近Opus",本地党该看的是168GB和384token

源自276位全网作者

03:12

今晚8点前后,#DeepSeekV4多模态模型正式开源#的话题在微博开聊:V4家族首款多模态实验模型DeepSeek-V4-Flash-Vision-Exp上传HuggingFace,采用MIT协议,开发者可以直接拿来本地部署、二次开发。微博它不是重新训练一套独立的视觉模型,而是在DeepSeek-V4-Flash架构上加入视觉编码器和视觉对齐模块,并通过持续训练,让原本擅长代码、推理和工具调用的V4获得原生图像理解能力。哔哩哔哩而且这次放出东西的不只是权重:tokenizer、图文提示编码的参考实现,以及覆盖Vision Encoder、Aligner、DFlash Attention、MoE、Hyper-Connections、DSpark的最小PyTorch推理代码,全甩出来了。知乎

围绕这双"新眼睛"的讨论其实分两拨:一拨人发现这模型8月21日就上线过DeepSeek API平台,等于已经替大家看过十天图了;另一拨人看完仓库就一个反应——等第三方量化。知乎B站AI日报当晚播放冲过5.7万,一条本地向快讯干脆把标题写成"期待第三方部署"。哔哩哔哩哔哩哔哩

都在传的"接近Opus",官方卡片里写着小字

官方模型卡的定位表述是:在需要视觉理解的Agent基准测试中较V4-Flash大幅提升,多模态Agent能力已接近Opus-4.8,而纯文本任务与V4-Flash正式版持平、原有优势完整保留。知乎但有两处小字必须拎出来:其一,ApexBench与Agents’ Last Exam两项里,文本版基线会直接忽略输入里的多模态元素,这两列更接近"有无视觉能力"的对照,不是同条件下的模型排名。知乎其二,媒体整理的对比里反超点和短板都很具体:DeepSWE以59.3%的成绩反超Opus-4.8登顶,工具调用测试Toolathlon-Verified得分75.9%、仅落后0.3%,但在自然语言转代码仓库测试NL2Repo上,它与Opus-4.8仍有10%左右的差距——界面操作、图表读取是长板,高度结构化的代码库理解是短板。智东西

"Exp"后缀也不是白带的。官方inference/README.md开头注明,仓库提供的是readable reference implementation,不是production serving engine,生成循环为朴素自回归采样。知乎换句话说,就算你现在把它架在机器上,跑出来的速度也只是地板价,不是终态。

灰测期的实测,提前给这波开源降了温。B站UP主实测:这模型认得马斯克,认不出自家老板梁文锋,3个矩形数成4个,墙上时钟读成5:10。哔哩哔哩另一篇拿真实运维截图做的实测更扎心:左下角地址栏那行内网地址,字号小到人眼都得凑近看,它完整读出来了,连端口都对;但图里的IP是10.1.20.158,它写成10.1.201.58,数字一个没错、分组错了,三个环境里另外两个明明写着26.1.3,它统一汇报"版本均为26.1.4"。知乎能力边界其实被这两组测试画清楚了:问它"这图说了什么",可以信;让它"把数字誊下来",必须核。

三个对本地党真正有用的数字

第一个数字:168GB。据公开媒体报道,模型总参数约304.6B,权重分48个Safetensors分片,仓库体积约168GB;官方模型卡并未直接标注参数量,引用请以仓库实际文件为准。原生权重已经是专家FP4、其余FP8压过的,按config折算BF16要609GB,官方先替你砍到约1/3.6。知乎但今天挂出来的还是官方分片,社区量化版本没交卷,第一批尝鲜者面对的就是168GB的磁盘和带宽账。哔哩哔哩

第二个数字:单图384token。视觉部分是一个标准ViT,图片进语言模型前由Aligner做3×3合并——无论输入原图多大,进入语言模型时都会被压缩到固定量级,token消耗上限固定为384,约等于一张823×823的图(这是按config推算,非官方标注)。知乎这才是这次开源最值得本地党记笔记的设计:截图流Agent——让它看屏幕操作电脑、看图报错修bug——每轮的图片成本线性且有封顶,不用赌参数;另有报道说单请求最多可输入600张图,该数字未见于官方config,仅供参考。

第三个数字:KV头数等于1。num_key_value_heads设为1、head_dim 512,Q和O走低秩压缩,MLA思路的极端版,KV缓存被压到极低;稀疏索引器从全序列挑512个位置做全局注意力,滑窗128管局部,YaRN把上下文从64K扩到1M。知乎翻译成人话:长上下文多模态场景里,真正卡脖子的是那168GB权重本身,而不是激活侧的显存——对内存卸载玩家,架构是友好的,前提是你得先给权重找个家。

对号入座:谁能玩,谁该等

8-16G显存、主力跑Qwen3.8-27B的:今晚这条新闻暂时进不了你的机器,别硬凑。但需要"看图"的活儿社区已有更便宜解法——有人在单张4090上部署AI魔镜,用MiniCPM-V4.6这颗1.3B端侧多模态模型专职当"眼睛",大脑另有分工。哔哩哔哩"小眼睛+大脑袋"的分工管线,仍是16G档最经济的方案。

24G显存+64G内存档:诱惑真实存在,但账算不过来。这套配置跑125B的Qwen3.8-Flash-Next,开MTP投机采样、调优上下文后稳态吞吐20.1~22.8Token/秒,已经算这档机器的天花板;32G内存去扛93GB的IQ4模型,实测只有4.8tokens/s。哔哩哔哩哔哩哔哩V4-Vision的168GB权重还要再大一截,而内存这一年的门票价涨了快5倍、96G套条从不到2000元爬到7500元(本号早前算过这笔账)。等量化落地,再回来算内存账不迟。

48G多卡、工作站档:目前唯一真能开玩的人群——四张170HX跑文本版DeepSeek-V4-Flash的部署视频8月29日已经挂出来了,视觉版同量级权重加视觉模块,这档机器装得下。哔哩哔哩但拿到的仍是朴素自回归的参考实现,现阶段的正确姿势是拿它验证你自己的业务用例,不是日常使用。

192G级统一内存(Mac Studio档):能整体装下原生权重的单机,可以下载开玩。官方教程里最实用的一句在最后:把提示编码与推理分成两个目录,前者不依赖PyTorch,可以在没有GPU的机器上先验证消息编码是否正确——先跑通编码,再决定下不下那168GB。知乎

MIT真正的含金量,和你接下来该盯的信号

MIT+tokenizer+编码参考实现一起放出来,基本等于不设门槛:下载本地、用自己的数据微调、接进自己的产品,不用看API脸色、不用操心调用额度——拿它做垂直视觉Agent微调(界面报错修复、票据识别、设计稿理解),从数据到部署的链路完全闭环。微博8月底三家前后脚上桌:GLM-5.3-Flash是320B总参数、18B激活的MIT开源,Qwen3.8-Flash-Next是125B总参数、每token激活6B——本地视觉管线接下来几个月会很热闹,不用盯着一家。知乎

值得存下来继续盯的信号有四个:其一,GGUF/IQ第三方量化什么时候出——Unsloth、mudler这些仓库此前都给Qwen3.8-27B交过量化版GGUF,这次如果持续沉默,本身就是行情信息;其二,llama.cpp、vLLM、SGLang的多模态支持进度,官方参考实现是速度地板,社区引擎才是天花板;其三,正式版何时替换Exp版本;其四,拿你自己工作里的3张真图做验收——先测它抄不抄错数字,再测它懂不懂场景,跑分表保证不了你的工况,社区最擅长的恰恰就是拿实验版开刀。知乎

DeepSeek今晚给了开源世界一个"图片成本封顶"的视觉模型,但没有给本地低配用户一张免费门票。168GB和384token合起来回答的其实是同一个问题:你的机器装得下什么、你的活儿需要什么——等量化不丢人,冲才是花钱。

内容由AI生成

精选参考来源

1. #DeepSeekV4多模态模型正式开源# DeepSeek V4家族首款多模态实验模型正式开源

2. DeepSeekV4终于能看图了!首个多模态模型V4-Flash-Vision开源:视觉Agent升级,部分基准超过Opus4.8

3. DeepSeek-V4-Flash-Vision开源:V4 多模态模型,单图 384 token 上限,MIT 协议

4. 实验性多模态模型开源 DeepSeek-V4-Flash-Vision-Exp

5. DeepSeek-V4-Flash-Vision-Exp正式开源;Claude200美元天价套餐被曝“虚标欺诈”|AI日报0831

6. [狼狼快报]V4-Flash-Vision实验版开源-期待第三方部署

7. 刚刚,DeepSeek-V4多模态模型开源

8. DeepSeek开眼了,但没看清:V4-Flash-Vision-Exp跑分vs实测全拆|费曼学AIEP.59

9. DeepSeekV4视觉实测:小字全读对了,IP却抄错了位

10. 一张4090本地部署「AI魔镜」:方圆一米内最帅的男人是谁?

11. 24G显卡+64G内存畅跑125B巨无霸!Qwen3.8-Flash-Next(MoE)极简开箱部署实战教程

12. Qwen3.8-Flash-Next本地部署,用硬盘跑AI大模型?是黑科技还是纯折磨?

13. 【AI】四卡170HX个人本地部署DeepSeek-V4-Flash

14. #DeepSeekV4多模态模型正式开源# 意味着你我可以把它下载到本地,用自己的数据微调

15. GLM-5.3-Flash登顶全球:中国大模型调用量连续十八周领跑,“牛来“到底牛在哪?

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章