今晚8点前后,#DeepSeekV4多模态模型正式开源#的话题在微博开聊:V4家族首款多模态实验模型DeepSeek-V4-Flash-Vision-Exp上传HuggingFace,采用MIT协议,开发者可以直接拿来本地部署、二次开发。微博它不是重新训练一套独立的视觉模型,而是在DeepSeek-V4-Flash架构上加入视觉编码器和视觉对齐模块,并通过持续训练,让原本擅长代码、推理和工具调用的V4获得原生图像理解能力。哔哩哔哩而且这次放出东西的不只是权重:tokenizer、图文提示编码的参考实现,以及覆盖Vision Encoder、Aligner、DFlash Attention、MoE、Hyper-Connections、DSpark的最小PyTorch推理代码,全甩出来了。知乎
围绕这双"新眼睛"的讨论其实分两拨:一拨人发现这模型8月21日就上线过DeepSeek API平台,等于已经替大家看过十天图了;另一拨人看完仓库就一个反应——等第三方量化。知乎B站AI日报当晚播放冲过5.7万,一条本地向快讯干脆把标题写成"期待第三方部署"。哔哩哔哩哔哩哔哩
都在传的"接近Opus",官方卡片里写着小字
官方模型卡的定位表述是:在需要视觉理解的Agent基准测试中较V4-Flash大幅提升,多模态Agent能力已接近Opus-4.8,而纯文本任务与V4-Flash正式版持平、原有优势完整保留。知乎但有两处小字必须拎出来:其一,ApexBench与Agents’ Last Exam两项里,文本版基线会直接忽略输入里的多模态元素,这两列更接近"有无视觉能力"的对照,不是同条件下的模型排名。知乎其二,媒体整理的对比里反超点和短板都很具体:DeepSWE以59.3%的成绩反超Opus-4.8登顶,工具调用测试Toolathlon-Verified得分75.9%、仅落后0.3%,但在自然语言转代码仓库测试NL2Repo上,它与Opus-4.8仍有10%左右的差距——界面操作、图表读取是长板,高度结构化的代码库理解是短板。智东西
"Exp"后缀也不是白带的。官方inference/README.md开头注明,仓库提供的是readable reference implementation,不是production serving engine,生成循环为朴素自回归采样。知乎换句话说,就算你现在把它架在机器上,跑出来的速度也只是地板价,不是终态。
灰测期的实测,提前给这波开源降了温。B站UP主实测:这模型认得马斯克,认不出自家老板梁文锋,3个矩形数成4个,墙上时钟读成5:10。哔哩哔哩另一篇拿真实运维截图做的实测更扎心:左下角地址栏那行内网地址,字号小到人眼都得凑近看,它完整读出来了,连端口都对;但图里的IP是10.1.20.158,它写成10.1.201.58,数字一个没错、分组错了,三个环境里另外两个明明写着26.1.3,它统一汇报"版本均为26.1.4"。知乎能力边界其实被这两组测试画清楚了:问它"这图说了什么",可以信;让它"把数字誊下来",必须核。
三个对本地党真正有用的数字
第一个数字:168GB。据公开媒体报道,模型总参数约304.6B,权重分48个Safetensors分片,仓库体积约168GB;官方模型卡并未直接标注参数量,引用请以仓库实际文件为准。原生权重已经是专家FP4、其余FP8压过的,按config折算BF16要609GB,官方先替你砍到约1/3.6。知乎但今天挂出来的还是官方分片,社区量化版本没交卷,第一批尝鲜者面对的就是168GB的磁盘和带宽账。哔哩哔哩
第二个数字:单图384token。视觉部分是一个标准ViT,图片进语言模型前由Aligner做3×3合并——无论输入原图多大,进入语言模型时都会被压缩到固定量级,token消耗上限固定为384,约等于一张823×823的图(这是按config推算,非官方标注)。知乎这才是这次开源最值得本地党记笔记的设计:截图流Agent——让它看屏幕操作电脑、看图报错修bug——每轮的图片成本线性且有封顶,不用赌参数;另有报道说单请求最多可输入600张图,该数字未见于官方config,仅供参考。
第三个数字:KV头数等于1。num_key_value_heads设为1、head_dim 512,Q和O走低秩压缩,MLA思路的极端版,KV缓存被压到极低;稀疏索引器从全序列挑512个位置做全局注意力,滑窗128管局部,YaRN把上下文从64K扩到1M。知乎翻译成人话:长上下文多模态场景里,真正卡脖子的是那168GB权重本身,而不是激活侧的显存——对内存卸载玩家,架构是友好的,前提是你得先给权重找个家。
对号入座:谁能玩,谁该等
8-16G显存、主力跑Qwen3.8-27B的:今晚这条新闻暂时进不了你的机器,别硬凑。但需要"看图"的活儿社区已有更便宜解法——有人在单张4090上部署AI魔镜,用MiniCPM-V4.6这颗1.3B端侧多模态模型专职当"眼睛",大脑另有分工。哔哩哔哩"小眼睛+大脑袋"的分工管线,仍是16G档最经济的方案。
24G显存+64G内存档:诱惑真实存在,但账算不过来。这套配置跑125B的Qwen3.8-Flash-Next,开MTP投机采样、调优上下文后稳态吞吐20.1~22.8Token/秒,已经算这档机器的天花板;32G内存去扛93GB的IQ4模型,实测只有4.8tokens/s。哔哩哔哩哔哩哔哩V4-Vision的168GB权重还要再大一截,而内存这一年的门票价涨了快5倍、96G套条从不到2000元爬到7500元(本号早前算过这笔账)。等量化落地,再回来算内存账不迟。
48G多卡、工作站档:目前唯一真能开玩的人群——四张170HX跑文本版DeepSeek-V4-Flash的部署视频8月29日已经挂出来了,视觉版同量级权重加视觉模块,这档机器装得下。哔哩哔哩但拿到的仍是朴素自回归的参考实现,现阶段的正确姿势是拿它验证你自己的业务用例,不是日常使用。
192G级统一内存(Mac Studio档):能整体装下原生权重的单机,可以下载开玩。官方教程里最实用的一句在最后:把提示编码与推理分成两个目录,前者不依赖PyTorch,可以在没有GPU的机器上先验证消息编码是否正确——先跑通编码,再决定下不下那168GB。知乎
MIT真正的含金量,和你接下来该盯的信号
MIT+tokenizer+编码参考实现一起放出来,基本等于不设门槛:下载本地、用自己的数据微调、接进自己的产品,不用看API脸色、不用操心调用额度——拿它做垂直视觉Agent微调(界面报错修复、票据识别、设计稿理解),从数据到部署的链路完全闭环。微博8月底三家前后脚上桌:GLM-5.3-Flash是320B总参数、18B激活的MIT开源,Qwen3.8-Flash-Next是125B总参数、每token激活6B——本地视觉管线接下来几个月会很热闹,不用盯着一家。知乎
值得存下来继续盯的信号有四个:其一,GGUF/IQ第三方量化什么时候出——Unsloth、mudler这些仓库此前都给Qwen3.8-27B交过量化版GGUF,这次如果持续沉默,本身就是行情信息;其二,llama.cpp、vLLM、SGLang的多模态支持进度,官方参考实现是速度地板,社区引擎才是天花板;其三,正式版何时替换Exp版本;其四,拿你自己工作里的3张真图做验收——先测它抄不抄错数字,再测它懂不懂场景,跑分表保证不了你的工况,社区最擅长的恰恰就是拿实验版开刀。知乎
DeepSeek今晚给了开源世界一个"图片成本封顶"的视觉模型,但没有给本地低配用户一张免费门票。168GB和384token合起来回答的其实是同一个问题:你的机器装得下什么、你的活儿需要什么——等量化不丢人,冲才是花钱。