最近关注 OWC 的群里,被问得最多的一个问题是:Stack AI 四季度就要发售了,这个"拿 SSD 当显存"的新物种,到底要不要等?
也难怪大家上心。OWC 这个牌子,Mac 用户太熟了,内存、硬盘盒、扩展坞,基本都是闭眼买的稳妥之选。但 Stack AI 是 OWC 这些年做得最激进的一款产品——不卖容量,改卖"显存自由"了。今年 5 月它官宣的时候,官方口径是全球首款采用雷电 5 技术的 AI 加速器兼存储扩展坞。知乎而 IT之家的总结更直白:这就是一个外置式的群联 aiDAPTIV 内存化闪存方案。微博

名字很绕,但解决的问题很痛。我先把结论放前面:这事原理上是真的,但它服务的人群和大多数 OWC 用户(Mac 党)重合度不高。下面把账算给你看。
为什么 27B 的"小模型",反而卡死了所有人
8 月底本地部署又火了一波,阿里 Qwen3.8-27B 这类 270 亿参数级别的模型,被很多人当成"笔记本也能跑的甜点模型"。但 27B 听着小,胃口一点不小:FP16 精度加载要 54GB 上下显存,就算用 4-bit 量化压到 14GB 左右,主流笔记本 8GB、16GB 的显存还是装不下——这还没算推理时不断膨胀的缓存。知乎

于是有了"换页"(offload)这个钻空子的思路。大模型推理是逐层计算的,任何一瞬间,GPU 真正用到的只有当前这一层的权重。那就只把正在算的一层放显存,其余权重丢到内存甚至硬盘里,算到哪层搬哪层。llama.cpp、Ollama 的 CPU offload 干的就是这件事。
思路没毛病,但带宽的账算不平:拿量化后约 14GB 的 27B 模型来说,想跑到每秒 20 个 token 的流畅线,需要大约 280GB/s 的持续带宽;而 NVMe 硬盘到显存这条搬运通道,通常只有 3.5GB/s 到 7GB/s,差着几十倍。结果就是能跑,但首 token 等十几秒,出字像挤牙膏,基本告别日常使用。
Stack AI 做的,是把这条路的坑填平
OWC 的思路还是"权重放闪存、边算边搬",但在三个环节动了刀。第一,硬盘本身不一样。普通 SSD 的固件是按混合负载调校的,持续高强度读取会掉速、延迟抖动;aiDAPTIV 平台专门为"反复、大批量搬运权重"这个场景做了调校,追求稳定可预测的持续吞吐。第二,调度变聪明了。推理逐层执行,下一步算哪一层完全可预知,Stack AI 的软件层会提前把第 N+1 层的权重搬进显存——GPU 算完第 N 层时,下一层已经在位,等待时间被藏进了计算时间里。第三,通道用了雷电 5 的 64Gbps,比雷电 4 翻倍,相当于一条 PCIe 4.0 x4,而且是独立通道,不跟系统盘抢带宽。
官方在 COMPUTEX 2026 现场演示过:同一台笔记本跑 gpt-oss-20b,接上 Stack AI 后,首 token 延迟从约 6.5 秒降到约 0.6 秒。知乎注意,是首字延迟这个指标,持续生成速度的官方数据目前还没有。

再补一个背景,方便理解这东西为什么现在才出现。此前 aiDAPTIV 只能做成内置 PCIe 卡,塞进台式机机箱;雷电 5 的带宽恰好够格,才把它"平移"到了机箱外,让显存最紧张、又最没扩展空间的笔记本和 mini 主机也能用上。从今年年中开始,“AI SSD"整个赛道都在升温:群联、江波龙拉着英特尔、AMD、英伟达站台,B站相关科普视频播放量破万,36氪专门写了《别只看 tokens/s》,讨论的核心就是这句——从 Token PU、TPU、LPU 到 AI SSD,芯片的定价权正在从峰值算力,转向它能装下多大的模型。36氪根子还是内存太贵——这年头内存和固态一路涨成"电子黑金”,HBM 又告急,用便宜的闪存给昂贵的显存打补丁,就成了全行业都在打的主意。
社区比官方冷静,三个质疑都问到点子上
我翻了 B 站那期 aiDAPTIV 视频的评论区,争议相当真实,挑三个最硬的。
质疑一:寿命。最高赞评论就一句:"多长时间坏块固态?"有人算过,普通 SSD 在这种高强度反复读写下,一两个月就可能磨损殆尽。哔哩哔哩所以这类方案基本都得配高耐久颗粒的专用盘——视频里厂商方面的人回复说,他们配套的 AI 100E 专用盘目前只是小范围对外销售。专用盘什么价、寿命多久、坏了换盘的成本,官方至今没给数据。
质疑二:性能到底提升在哪。有技术党直接泼冷水,大意是连内存都追不上显存,拿 SSD 做推理基本不可用。还有位拿着 5090 的用户写了长评,指出这类调度会把 CPU 占用拉满,结论是中低端电脑 CPU 先扛不住,高端机用不着,定位尴尬。哔哩哔哩
厂商方面也有人出来对线,给的数据是:8G 显存的 5060 笔记本,加 AI SSD 能跑 Qwen3.6-35B-A3B 这种 MoE 模型,还能开 128K 上下文;prefill 阶段"以存代算"能有几十上百倍的加速,但 decode 速度提升不大,并发瓶颈依然在显卡。哔哩哔哩两边的话都先记着,目前没有第三方独立评测。
质疑三:价格。这是最现实的一条——官方至今没公布售价。在一个 1TB 固态价格都能翻倍的年份,一个"显存外挂"卖多少钱,直接决定它是性价比神器还是信仰税。
回到你最关心的:Mac 用户要不要等
先说硬事实:Stack AI 首发支持 Windows 和 Linux,没有 Mac。知乎
再说透一点:Mac 大概率也用不上它。Apple Silicon 的统一内存架构,本身就是"把内存当显存用"的方案——Mac Studio M5 Ultra 的统一内存可以到 512GB,带宽 1.2TB/s,跑 Ollama、MLX 时权重就待在统一内存里,这个带宽比外接 SSD 高出不止一个数量级。哔哩哔哩Mac 上跑本地大模型,卡脖子的从来不是"显存不够",而是"买机器时统一内存买小了"。所以对 Mac 党,我的建议很干脆:别等它。有本地大模型需求,预算花在购机时的内存档位上,比等一个不支持的外设实在得多;尤其在内存涨价的周期里,早买大内存本身就是省钱。
真正该把 Stack AI 放进观察清单的,是这一类人:Windows 或 Linux 笔记本,显卡 8GB 到 16GB 显存,想本地跑 20B 到 30B 级别的模型,又有数据敏感、不方便上云的需求。这台机器理论上就是冲你们做的。
接下来四个信号,我会持续盯着,也建议你们等这四个答案落地再掏钱:四季度具体的发售时间和定价;Mac 支持有没有路线图;配套专用 SSD 的寿命和价格;以及第三方实测——特别是 prefill、decode 和并发分开报的那种。
最后说句我的判断:Stack AI 是 OWC 这些年最值得盯的一款产品,因为它标志着这家老牌 Mac 外设厂,第一次从"升级件供应商"跨进"AI 算力外设"的赛道。成不成另说,但方向本身说明它看懂了本地 AI 的焦虑。对我们来说,现在最优策略就是四个字:等等再看。反正它还没发售,而钱包在涨价潮里,本来就该捂紧一点。