7. 结论:完全不是只有电费。硬件是一次性花钱,但每年都要摊巨额折旧,而且持续支出里折旧通常比电费更高,再叠加一堆固定运营开销。
一、硬件采购是一次性投入,但折旧是每年刚性成本(最大持续开销)
1. GPU迭代极快,行业普遍按3年折旧,高端H100整机几十万,平摊到每个月、每一天都是固定成本,只要机器开机提供推理,折旧就要算进单条对话成本。
举例:一台8卡H100服务器320万,3年折旧,每年折旧≈107万,每月接近9万。
2. 就算机器没满负荷、深夜闲置,折旧照样计提;新一代显卡一出,旧卡算力性价比暴跌,实际有效折旧甚至缩短到2年,年均摊销更高。
3. 配套设备也要折旧:高速交换机、液冷机柜、分布式存储、UPS供电,折旧周期3~5年,持续分摊成本。
行业实测:推理综合成本里,硬件折旧占50%~60%,电费只占25%~30%,折旧才是大头。
二、除电费外,常年持续花钱的固定支出
1. 电力之外的制冷配套电费
AI高密度机房不能只用风冷,必须液冷,冷却系统本身耗电巨大;行业PUE约1.4~1.5,等于每花1元算力电费,还要多花0.4~0.5元给制冷设备,制冷电费是额外大头。
2. 机房、机柜、带宽成本
• 自建:土地、机房建筑折旧、物业、消防、水处理(液冷耗水);
• 托管IDC:机柜月租、高密度电力机位溢价;
• 公网带宽:用户问答、图片、文件上传下载流量费,高并发C端产品带宽成本接近电费水平。
3. 人力运维成本(全年固定支出)
需要长期配备团队:
• 机房运维、硬件故障维修;
• 推理集群调度工程师、vLLM/分布式优化开发;
• 安全审核、监控、日志运维;
一万张GPU集群,配套几十名全职技术人员,年薪总开销千万级别,按月摊销进推理成本。
4. 硬件维保、备件、耗材
GPU、主板、高速网卡故障率远高于普通服务器,每年要签高价原厂维保;电源、散热液冷耗材定期更换,备件库存持续占用资金。
5. 存储、软件授权隐性成本
• 用户对话日志、知识库向量库、模型检查点持续扩容高速存储,按月产生存储费;
• 分布式推理框架、监控、风控安全系统大多商业授权,年费持续支出。
三、两种模式直观对比
模式1:自己买机器自建机房
月度推理总成本 = 硬件月折旧 + 算力+制冷电费 + 机房租金/建筑折旧 + 带宽费 + 运维人力摊销 + 维保存储杂费
折旧 > 电费 > 人力 > 带宽/维保
模式2:直接租用云GPU(不用一次性买硬件)
看似没有一次性投入,但云租金已经把硬件折旧、电费、机房、运维全部打包进时租单价,每一秒都在同时承担上面所有成本,只是不用前期大额付款。
极简比喻
买一台车(一次性硬件投入):
• 折旧=每年车辆贬值(最大固定开销,不管开不开都亏);
• 电费=油费;
• 额外持续成本=停车费、保养、保险、司机工资、高速费。
只觉得后期只有油费,会严重低估整体运营成本。
补充一个关键误区
很多人以为“硬件买完就完事,只剩电费”,这是传统服务器逻辑;
AI高端GPU单价极高、贬值速度极快,折旧摊销是贯穿整个使用周期的核心刚性成本,这也是大厂推理业务常年亏损、API定价下不去的根本原因。