过去10天,魔搭社区的开源列表密得像排班表:8月12日微软 Mage-VL,8月13日 Qwen3.8-2.4T-A95B,8月14日 Qwen3.8-27B,8月20日蚂蚁百灵 Ling-3.0 Base,8月21日商汤 SenseNova-U1.5-8B-MoT 和腾讯 CoinVE-200K,8月22日 Ornith-1.5,七个项目全部可以在魔搭直接下载。热闹归热闹,真正值得现在动手的其实没几个。这篇把七个项目分成三类:值得现在下的、值得等生态的、看看就行的,最后按显卡配置给一份行动参考。
本周阵容一览
时间 | 项目 | 尺寸/类型 | 一句话点评 |
|---|---|---|---|
8/12 | Mage-VL(微软) | 4B 流式视频理解 | 思路新,单卡可玩 |
8/13 | Qwen3.8-2.4T-A95B | 2.4T MoE | 旗舰权重首开,看的多下的少 |
8/14 | Qwen3.8-27B | 27B 稠密 | 消费级显卡主角 |
8/20 | Ling-3.0 tiny/flash Base | 轻量 Base 模型 | 连训练节点都开放 |
8/21 | SenseNova-U1.5-8B-MoT | 8B 生图编辑统一 | 等 ComfyUI 接上再说 |
8/21 | CoinVE-200K(腾讯) | 20万条视频编辑数据 | 数据集也是硬菜 |
8/22 | Ornith-1.5 系列 | 397B/35B/9B | 自建题库,评价两极 |
值得现在下
Qwen3.8-27B:消费级显卡的本周主角
27B 一直被认为是本地部署的黄金尺寸,这次千问没有让人等。现在,它以 Apache 2.0 协议开放权重,下载、部署、商用都没有附加条件。微博 模型是原生多模态稠密架构,图文视频全理解,量化后消费级显卡即可流畅运行,原生 262K 上下文用 YaRN 能扩到 1M,官方口径其编程和办公表现甚至超过 Qwen3.7-Plus。它的量化方案和显存占用站内此前已有详细实测,这里不重复,只补一句判断:如果你手上是 12-16G 显卡,本周优先折腾的就是它。
Mage-VL:4B 就能做实时视频理解
微软这个 4B 模型走的是另一条路:不追全能,专攻流式视频理解,把视频编解码器直接塞进了 VLM。它会把视频流拆成 I 帧和 P 帧,只保留真实运动和新细节区域,官方口径能砍掉 75% 以上的无用 Token,推理速度最高提升 3.5 倍。小红书 同一套 4B 主干下,它在视频理解和时序定位基准上大幅超过 Qwen3-VL-4B,模型已在魔搭开源,一套权重同时支持图像、视频理解和主动流式门控。如果你关心监控、直播这类实时画面分析,这是本周最值得读论文加跑 demo 的项目。

值得等生态
SenseNova-U1.5-8B-MoT:生图编辑统一,先等 ComfyUI
商汤这个 8B 图像模型把生图和编辑收进同一个模型,原生 4K 输出、中英文字渲染、多参考编辑都是卖点,开源前就攒了一波关注。社区里最热的一条评价很直白:模型效果不错,但不知道 ComfyUI 什么时候支持。微博 所以对大多数人,我的建议是先收藏模型页,等 ComfyUI 节点跟上再动手,那时的工作流价值比现在裸跑权重高得多。

顺带一提,同一天腾讯也把 CoinVE-200K 数据集放上了魔搭:超过 20 万组视频编辑样本,每条样本带 2-5 个原子编辑操作,让模型一段视频里同时理解并执行多个编辑要求。小红书 做视频编辑方向的人,这份数据比多数新模型权重更值得先收进收藏夹。
Ling-3.0 Base:连训练过程都开源了
蚂蚁百灵这次开源了 Ling-3.0-tiny 和 Ling-3.0-flash 的 Base 模型,并开放训练过程中的关键节点,六个 checkpoint 横跨三个训练阶段。IT之家 对想研究小模型训练动态的人,这是难得的公开材料。但注意两点:目前是 Base 版不是 Instruct 版,直接对话效果有限;tiny/flash 定位轻量,别拿旗舰预期要求它。等 Instruct 版本和社区微调出现后再评估更稳妥。

看看就行
Qwen3.8-2.4T-A95B:真旗舰,看个明白就好
本周真正的重量级是它:2.4 万亿总参数、每 Token 激活 950 亿,原生 262144 上下文可扩展到 101 万,是阿里千问首次把 Max 级旗舰开放权重。基准成绩有亮点也有短板:在论文复现基准 PaperBench 中,Qwen3.8-Max 取得 93.0 分,高于 GPT-5.6 Sol、Fable 5 和 Claude Opus 4.8。36氪 但 TerminalBench 2.1 以 86.6 分略低于对手的 88.8 分,SWE-bench Pro 也落后于 Fable 5,长程智能体能力还没到全面碾压的程度。

对本地部署党,Unsloth 用动态 1-bit 量化把 4.9TB 权重压到 397GB,但运行所需内存加显存总量仍在 410GB 以上,和消费级硬件基本无缘。API 倒是人人可用:国内输入每百万 Token 12 元、输出 36 元。这个模型的正确打开方式是跑不动没关系,先用 API 验证需求,等后续更小杯的版本。
Ornith-1.5:自建题库的激进路线
Ornith AI 开源了 1.5 系列,包括 397B MoE、35B MoE 和 9B Dense 三个尺寸,MIT 许可证,最大特点是让模型自己生成训练任务、自建评测环境的强化学习闭环。小红书 社区反馈目前两极:有人认可它在本地 Agent 工作流里的速度和长上下文表现,也有人认为编码能力没有明显超过更新的稠密模型。结论:路线值得持续观察,权重先别急着下。
三个信号
把七个项目放在一起看,能读出三个信号。第一,可跑尺寸成了开源主角:本周真正能落到个人显卡上的是 27B、8B、4B 这几档,2.4T 负责立标杆,397B 负责讲路线,开源竞争的焦点正从参数军备赛转向谁能被更多人跑起来。第二,统一模型开始接棒:生图与编辑统一、理解与流式门控统一、多条编辑指令统一,单一能力模型的讨论热度明显在下降。
第三,魔搭正在变成开源首发地。七个项目全部在魔搭可下载不说,连海外推理框架都开始主动适配:AMD NPU 推理框架 FastFlowLM 发布 v0.9.46,正式接入魔搭社区,加一个参数就能把下载源切到魔搭。知乎 模型家族的体量也在滚雪球:截至目前,Qwen 已累计开源 460 余个模型,全球下载总量超 30 亿次,衍生模型数超 30 万个。微博 对国内用户,这意味着以后找模型、下权重,第一站越来越不会是别处。
行动参考
12-16G 显卡:主攻 Qwen3.8-27B 量化版,同时盯 SenseNova 的 ComfyUI 节点;
24G 及以上:27B 满血版加 Mage-VL 一起收,试试流式视频理解;
没有显卡:用 Qwen3.8 API(12/36 元每百万 Token)验证需求,或在魔搭在线体验 demo;
继续观察的信号:Ling-3.0 的 Instruct 版本、ComfyUI 对 U1.5 的支持、Ornith 社区评测是否收敛,这三个动了再回来补课。
这一周的魔搭,把开源大模型的节奏摆得很清楚:旗舰立标杆,小杯抢装机量。想清楚自己是哪一档,再决定下哪个。