WAIC 2026观察:一个4MB视频背后为何留存509MB数据?
如果你尝试让AI生成一段8秒钟的视频,
最终你可能会收到一个容量在几MB大小的视频文件。
但可能你不知道的是,当你发出生成视频的指令之后,AI已经在后台存储栈悄悄完成了几十GB的读写,留下了约数百MB的数据。

西部数据开发工程高级副总裁 Tim Rausch
在WAIC 2026西部数据AI存储论坛上,西部数据开发工程高级副总裁 Tim Rausch分享了一个真实案例:
他让AI生成了一段咖啡店主题的短视频。
最终呈现在我们面前的视频也很简单:720P、8秒、大约3.97MB。

为了完成这个任务,AI在GPU显存中共计占用了大概44GB数据,
其中约40GB是模型权重,约2-4GB是计算过程中产生的张量数据(Tensor)。
用大白话来说,模型权重是AI的“长期记忆”,张量数据是AI思考过程中产生的“临时计算结果”。

所以如果我们非常严格的去看AI生成结束之后,AI系统实际留下的数据的话:
就包括编码后的MP4视频506MB、推理日志、请求记录、合规信息、API日志、元数据等等,一共大概509MB。
虽然我们下载的只是不到4MB的视频内容,但留存的数据量是最终视频文件容量的约130倍。
这也是为什么 Tim Rausch一直在强调:AI并不是一个关于计算的故事,而是一场关于数据的故事。
数据正在发生“二次爆炸”
第一次数据爆炸来自互联网让每个人成为内容生产者;
第二次数据爆炸,则来自AI让机器本身成为内容生产者。
毕竟AI不只是消费数据,同时它自己也在不断地生成数据。
过去的存储遵循单一线性原则:用户产生内容,然后将其存储起来。

现在的存储逻辑则成了一个循环:
首先是数据训练出来的模型,训练出来的模型再完成推理,推理出来的结果生成新的内容,新的内容变成新的数据,新的数据再次训练出下一个模型。

Tim在现场用图示来展示了这个闭环:训练数据➡模型➡推理➡新内容➡再回流训练,
简单来说的话,在如今这个AI时代,数据已经不是一次性的消耗品了,而是在每一次生成中,变成下一轮数据生产的种子。
数据不再是终点,而是起点。
存储不再是“仓库"
这个结论我认为是整场论坛里最值得思考的一个观点。
我们对于存储的惯性思维理解都是:计算负责生产、存储负责保管。
存储更像是一个“仓库”,我们生产完了往“仓库”一扔就完事了。

但就像我们之前说的那样,AI时代存储几乎参与到了每一个环节。
数据以网页、视频、图片、文档等形式采集进来、接着做数据清洗。
什么是数据清洗呢?Tim举了个比较极端的例子:
如果一万张训练图片里九千五百张都是猫,那AI最后可能只学会了认猫;
所以数据清洗这一步非常重要,直接决定了AI训练数据的质量和多样性。
清洗完数据就要送去训练;训练完再拿去推理生成新的内容;
新的内容又会回流成为下一轮的训练素材。
这几个环节中,每一步都会产生海量的数据,必须要依靠存储在背后承接数据、搬运数据。
所以现在主流的AI基础设施,早就不是只有一堆GPU服务器就完事了,
而是GPU、CPU、存储共同组成的一整套数据生产系统。
所以存储已经从”后台仓库“,变成了真正参与生产的重要一环。
SSD管效率,HDD管规模
SSD现在性能越来越快,以后是不是就不需要机械硬盘了呢?
Tim给出的答案是:不会。
当然我相信这个答案中有一部分原因是因为西部数据目前主要的产品就是机械硬盘,
但我们从客观的角度来看,目前AI产生和需要处理的数据量实在是太大了。

就拿我们开篇举的例子来看,一个小小的4M视频内容背后就会产生数百MB的数据,
那如果是生成一个10GB容量的视频内容呢?AI系统所产生的数据量简直令人咋舌。
目前从AI相关的数据显示,大约80%的数据依旧存储在HDD上,只有20%的数据存在SSD上,
我认为在AI的系统中,不存在谁淘汰谁,因为AI促使整个产业的“蛋糕”变的越来越大,
最大的问题在于如何去分这块硕大的”蛋糕”,
SSD解决的是效率问题,HDD解决的是规模和成本的问题。


我们将整个存储体系从上到下捋一遍,大概是这样一个顺序:
GPU旁边是HBM(高带宽内存),负责最快但最贵、容量也是最小的那部分数据;
往下是DRAM,做短期的工作记忆;
再往下是SSD,扮演缓存和向量数据库的角色;
最后是HDD,承担海量的、长期的数据存放,其中包括训练数据、日志、备份等。
从逻辑上来看,越靠近GPU的存储要求性能越快,越接近地基则要求容量越大、成本越低。
HDD和SSD在AI系统中显然是互相补位、相辅相成的关系。
为什么AI时代反而需要更大的硬盘
我一直认为在AI领域,存储只需要做两件事:
提升磁密度以及降低成本就好了。

为了满足海量数据,容量就必须持续往上涨,Tim直接将西部数据自己的技术路线图拿了出来,
包括HAMR(热辅助磁记录)、ePMR(能量辅助垂直磁记录)、High Bandwidth Drive Technology(高带宽硬盘技术)、Dual Pivot Technology(双枢轴技术)等。
这些专为满足规模化AI基础设施而打造。





其中容量不断提升的核心技术是一项叫HAMR(热辅助磁记录)的新技术,
通过激光辅助加热磁盘介质,在单盘面上把数据写的更密。
技术图显示2026年,采用UltraSMR ePMR技术的40TB级硬盘已进入客户认证阶段;
2028年将容量提升到60TB,到2029年目标是实现100TB容量的HAMR硬盘。

实现该技术路径实际就两条路,首先把单张盘片的容量做大,目前在HAMR技术的加持下做到了4TB一张盘片,未来要做到7TB甚至10TB;
其次就是在一块硬盘里塞进更多的盘片,现在一块3.5英寸规格的硬盘里可以塞进11张盘片,未来要做到14张。

这两条路同步进行,7TB乘以14张盘片,容量就能达到100TB,这是可以预见到的结果。
SMR:被误解的老技术
在谈到成本的时候,Tim突然蹦出一句SMR,这让我有点意外。
SMR(叠瓦式磁记录)技术诞生于2010年前后,并在2013年开始商业化应用,难道不是一项被淘汰的老技术吗?

Tim表示在数据中心的角度来看,企业关心的是TCO(总拥有成本),
企业要考虑的不仅是买硬盘的钱,还有未来几年的电费、运维的钱。

Tim在现场算了一笔账:假设一套普通硬盘方案,总容量40PB(40960TB),5年总成本100万美元。
折算下来每TB的成本是25美元。
换成SMR方案后,硬盘本身会贵一些,总成本会被迫涨到110万美元,但容量也涨到了48PB(49152TB),
折算下来每TB的成本降到22.9美元,整体TCO反而下降了8.4%。

在这里普及一下,由于SMR通过磁道部分重叠方式下写入数据,减少了磁道之间的间隙,所以会大幅提高单盘面密度。
整体TCO的下降主要在于因为单块硬盘整体容量提升了,导致在实现相同总容量的情况下,所需硬盘和机架的数量就变少了,电费和运维成本也就跟着下降了。
再回到开头那个例子:一个4MB的视频背后是大约500MB的数据留存。
这只是如今生成式AI应用的一个缩影,未来每个人每天都会生成几十甚至上百万个AI内容时,
当企业跑着海量的AI Agent的时候,真正需要扩容的就不只是GPU集群了,而是整个数据基础设施。


这届WAIC让我意识到,未来AI的竞争并不在于谁拥有更多的算力,而是谁能更高效的管理和利用数据。
存储,不再是这场AI竞赛里的配角,它已经从后台的仓库走到了牌桌的中央。
作者声明本文无利益相关,欢迎值友理性交流,和谐讨论~
