这周 MLX 圈最值得聊的事,不是又出了哪个新模型。8 月 10 日,Hao AI Lab 的 FastVideo 团队在官方博客发了 FastMetal-QAD——之前只在显卡上跑的视频生成模型家族,被原生搬上了 Mac,跑在他们新写的 MLX 运行时上。这波真正在中文互联网炸开是 8 月 20 日那个周末,到今天小红书和 B 站还在刷屏,标题一个比一个猛,什么「30 秒出视频」。我把官方基准、社区实测、还有评论区吵架的内容都翻了一遍,今天一次说清楚:你的 Mac 能不能跑、真实速度多少、值不值得现在下。
先说这东西是什么。FastMetal-QAD 不是新模型,它是团队今年 6 月发布的 FastWan-QAD 系列往 Apple Silicon 上的移植。原版基于阿里的 Wan 视频模型,用量化感知蒸馏(QAD)把推理压到 3 步,再做低比特量化,在 RTX 5090 上 1.8 秒就能出一条 5 秒视频。Hao AI Lab 官方博客FastMetal 版延续了这套思路,但把 CUDA 换成了新写的 MLX 运行时,DiT、采样器、解码器全走 Metal,也就是 Mac 的 GPU。整套代码 Apache-2.0 开源,GitHub 上 FastVideo 仓库的 star 这几天已经涨到接近 4000。B站

它分三档,按内存选:
1.3B:出 480P、5 秒视频,峰值内存 3.87GiB。官方基准机(M4 Max 36GB)上 baseline 110 秒,Fast+Refine 模式 39.4 秒;
5B:720P 主力,峰值 9.34GiB,baseline 151 秒,Fast 模式 47.2 秒;
14B:画质档,480P baseline 602 秒、Fast 也要 211 秒,峰值内存 21.68GiB,官方给的目标配置是 36GB 以上内存的 Mac。

下面是内存账,对照你自己的 Mac 看就行。本地视频生成的命门是统一内存,这里有个坑:苹果按十进制标称,24GB 的 Mac 实际可用统一内存是 22.35GiB,macOS 系统本身还要再吃掉几个 GiB。所以 14B 峰值 21.68GiB 对 24GB 机型来说太贴着天花板了——这就是官方把它划给 36GB+ 的原因。反过来,5B 所有模式下峰值都不超过 11GiB,720p 在 16GB 机器上跑起来是从容的。小红书加上系统开销也稳。无风扇的 13 寸 M5 MacBook Air(24GB)官方也实测了:1.3B 和 5B 都能跑,1.3B Fast 58.2 秒、5B Fast 90.7 秒,画质和 Mac Studio 一致,就是慢 1.3 到 2 倍。

有两个预期要先校准。第一,外面传的「30 秒出视频」是 1.3B 小模型 Fast 档的数字,已经有人提醒看到「30 秒出片」先别急着激动。小红书官方基准里 5B 出 720P 冷启动是 151 秒,别拿错数字建立预期。第二,有帖子说它「用 Mac 的神经网络引擎加速」。微博这是传错了——整条流水线跑在 Metal GPU 上,跟 ANE 没关系。
那 Fast 模式的快是哪儿来的?不是硬件挤出来的,是算法换的:开 --fast 后模型只生成隔一帧的画面,空出来的帧用 rife-mlx 补帧,官方说各档去噪工作量大概省 2.4 到 2.9 倍。Hao AI Lab 官方博客还有个隐藏加速点:umT5 文本编码器很慢,1.3B/14B 上编一次 prompt 约 18 秒,5B 上要 47 秒——这正是 5B 冷启动 151 秒、纯去噪却只有 98 秒的原因。但它做了内容寻址的 prompt 缓存,同一句提示词第二次跑直接跳过去噪开始,体感会快一大截。

为什么能这么轻?因为它是拿东西换的。1.3B 能塞进 4GB 内存不是魔法,是三招:一是 DMD2 蒸馏,把去噪步数压到 3 步;二是 INT8 量化感知训练,模型在训练阶段就学会补偿量化误差——团队专门解释了为什么不上更低比特:同等内存开销下 INT8 的权重重构误差最小,MXFP4/NVFP4 的误差要大一个数量级以上,而现有 W8A8 融合 kernel 在 DiT 这种形状下还没跑赢 fp16;三是内存编排,umT5 文本编码器以 bf16 加载、编码完立刻释放再装 DiT,解码默认换用小型解码器 TAEHV,峰值才压得下来。代价也很直白:画质上限不如全精度大模型,功能上目前只有文生视频,连图生视频都还得等下一步。
别急着吹,社区的真实声音也得看。我扒了一圈评论,差评不少:有人直言画质也就跟 LTX 一个水平;有人说它比 T-go 的 Vpipe「慢好多好多」。小红书还有人直接问跟 MiniMax-H3 比效果怎么样、支持不支持参考视频生成。说实话,如果你期待它出商用级素材,会失望——它的定位是「本地、免费、速度够用」,跟即梦、可灵这类云端旗舰不在同一条评价轴上。
那到底谁现在能玩、谁该等?

值得现在就下的:16GB 用户想体验「本地出视频」这件事本身,1.3B 就是性价比最高的入口,一条 480P 视频 45 到 110 秒,Fast+Refine 能到 39 秒;24 到 36GB 用户,5B 的 720P 才是真正的「最低可用线」,一条视频按模式 47 到 151 秒,大致等于早期云端排队的水准;MLX 生态关注者则应该看一眼它的 Metal 实现——从 mlx-lm 的文本、mlx-vlm 的多模态,到现在能跑完整视频生成流水线,MLX 的边界又往外推了一格。
建议再等等的:需求是商用出片,或者要图生视频、参考视频生成、更高画质上限的。图生视频在官方路线图上但还没影。Hao AI Lab 官方博客追求一键成片或稳定人物一致性的人,成熟云端工具仍更省心。小红书两个可以持续观察的信号:图生视频什么时候能用,以及 W8A8 融合 kernel 什么时候在 DiT 上跑赢 fp16——这两件事直接决定它是从玩具变工具,还是停在玩具。
一句话总结:FastMetal-QAD 的意义不是「Mac 视频生成追平云端」,而是第一次把本地视频生成的入场成本压到「任何一台 Apple Silicon Mac 都玩得起」。如果你之前为了每月出几条视频在订云端会员,这个免费选项值得花半小时试试。