当前位置:
AIGC文章详情

557万vs50亿美元,AI训练成本凭什么差100倍?

源自33位全网作者

07-24 12:31

内容由AI生成

精选参考来源

1. 万亿参数模型到底多烧钱?国产AI芯片能不能跑?算力国产替代的大棋局

2. 四大模态大模型训练体系全解析(架构+范式+分布式+算力成本·)

3. 【训练与微调篇10】训练成本优化

4. 拆解Kimi K3:1/12成本追平GPT-5,月之暗面到底做了什么?

5. 一文说透AI推理经济学三件套:从推理成本到缓存命中

6. 怎么查询模型训练价格和模型部署价格

7. 训练2万亿参数大模型的实现

8. GPU采购策略:2025年租赁、购买与预留容量对比分析

9. 平头哥真武 M890 亮相: AI 算力三倍性能跨越

10. xAI前世界模型负责人曝光单月百万美元网费账单

11. Kimi刷榜!中国AI大模型正式进入"2万亿参数时代"。

12. 大模型微调成本分析:LoRA、QLoRA与全参数微调的经济性对比与企业落地策略

13. 2万亿参数砸向开源,Kimi K3 能把 Anthropic 的护城河填平吗?

14. K3绝对不是便宜的模型,从订阅的情况看,K3就绝对不便宜。K3模型的训练成本绝对不会低于10亿美元,这还是仅仅是训练成本,正因为训练极为昂贵,K3上来就卖的不是低价。国内的大模型从来没有像K3那样,定价那样昂贵,但是依然供不应求。 以前有个观点就是,国内大模型的付费场景非常弱,大家能用免费的就不用付费的。但是从K3供不应求的情况来看,只要模型够好,用户付费的意愿是非常强烈的。而K3的这种表现会完全打开国内资本对大模型领域的投资的热情,因为用户极强的付费意愿意味着巨大的市场需求——不是中国人不愿意花钱购买订阅,是因为中国的大模型确实没有强到能够让用户强烈付费。 而且,最关键的是,K3激活的是最难商业化的C端用户的订阅热情,以前国内的大模型走的都是B端客户的API订阅,B端的优点是大客户付费意愿强,付费能力强。但是B端客户也有缺点,就是客户依赖性很强,只要利益足够大,B端客户流失的风险极大。而C端客户的稳定性非常好,一旦形成粘性,持续订阅会打开资本市场的想象空间。 下一代大模型的参数量预计会有5万亿参数,模型的训练成本预计在20亿美元到30亿美元之间。如果是训练10万亿参数的大模型,模型训练的成本预计在70亿美元到100多亿美元。模型参数量越大,意味着能够参与下一代大模型竞争的门槛越高,全球同时有资金实力和数据飞轮,能够训练10万亿参数大模型的公司,不会超过10家公司。而真正能够参与10万亿参数大模型竞争的公司,中美都不超过3家公司。 同时,K3的成功说明了一件事,端侧AI的叙事有可能会被证伪,端侧AI可能能够做一些简单的事情:譬如订机票,拍图生成文档、修图、语音识别,但是真实遇到需要解决的复杂问题,端侧AI的能力完全不够用,必须使用云端的超大参数大模型。 另外,超大参数开源模型的权重太大了,如果不能通过多用户并发,多agent并发降低单位token的成本,那么对大量使用token的公司而言,自部署超大参数的开源大模型的成本不见得比使用大模型厂商云服务推理的成本更低,向大模型厂商租用专用的服务器机柜保障数据安全,但是由大模型厂商负责输入上下文优化,输出agent调优,或者共享硬件的设计提高算力硬件的生产效率,降低客户租用成本,必然成为更多商业公司的现实选择。 还有人说K3成功,说明大模型没有护城河。其实这是对超大规模大模型的完全误解。超大规模大模型和普通几千亿级参数大模型是完全不同的概念:超大规模大模型如果没有搞清楚数据分布规律,前后传播规律,超大规模大模型是极容易训练失败的,或者勉强训练出来以后,完全不具备商业价值,大模型厂商卖一份亏一份。所以,训练超大规模大模型的这种能力必然是一种稀缺能力,不是随便一个大模型厂商招聘一些高端大模型算法开发人才就能够完成的任务。 当大模型的参数量越来越大,算力成本也会越来越贵,token的单价不仅不会下降,反而会继续上涨,只是为了保障用户的体验,token的单价上涨幅度不会像参数上涨那样,会涨那么多,未来token单价上涨的幅度会放缓。 随着K3的爆火,国内的算力基建资本开支明年有望突破1万亿,2028年有望突破2万亿,2029年突破4万亿,2030年有望突破8万亿。美国的算力热潮才出现增速放缓迹象,中国的算力基建即将进入快速腾飞阶段。

15. 预训练——让模型”识字”的超级工程

16. 35B参数不等于每次都烧35B:老板看模型成本最容易看错什么?

17. Kimi K3发布:2.8万亿参数,开源大模型进入万亿时代意味着什么?

18. 2.8万亿参数AI大模型,到底有多吃算力?一边是技术突破,一边是算力缺口

19. 8192卡上限对阵十万卡满载,这场竞赛暂时没有悬念 大型AI集群最终都要面对一张很现实的账单:买了多少卡不重要,每张卡一年真正干了多少活才重要。 华为Atlas 950通过高速互联、统一内存和低精度计算,提高单个大型AI任务的训练及推理效率。曙光8000则从另一侧压缩系统损耗:scaleFabric

20. 英伟达:从“一次性训练”的大模型到“后训练改进”的Agent,算力需求正在变化

21. 阿里开源2.4万亿参数巨兽 Qwen3.8:仅次于 Claude Fable 5

22. “每天500美金,多少初创公司负担得起?” 词元消耗千倍级增长 上海用“超大集群 最便宜智算” 化解中小企业“用算焦虑”︱一探

23. 算力成生死线,巨头疯抢“超节点”

24. 从POC到坟墓:生成式AI项目为何批量夭折——2026年AI落地困局与突围路径

25. 2026大模型推理算力基础设施平台选型

26. 租用GPU算力怎么选择显卡?从LLM到AIGC的全场景选型与避坑指南

27. 大模型分布式训练并行策略详解,租赁多机集群训练提速实操

28. 2026年GPU算力平台选型避坑指南:4个维度帮你省下30%隐性成本

29. BAT集体掉队AI大模型赛场:手握流量、资金、数据王牌,为何跑不过初创公司?

30. 算力即生产力,模型即员工。未来“算力成本”会取代一部分的“人力成本”。CFO们会像排班表一样,把不同的任务分配给不同水平的模型,追求整个公司的“人-机”投入产出比最大化。如果能精准定义“什么岗位级别的活,该花多少钱去雇哪个模型”,就会成为这家公司里最值钱的“算力人事总监”。未来的大模型市场,不是“高端通吃”,而是“百舸争流”。 那些在特定垂直领域把成本做到极致、把响应速度做到极致的“小模型”和“专用模型”,它们的商业价值,未必比那些万亿参数的“超级大脑”低。这种分层,反而给了应用层和中间层巨大的创业机会。现在的hbm,高端芯片焦虑,只是技术爆发初期的短暂现象。等到CFO们开始真正把模型当作“员工”来评估时,这个市场才算是真正成熟了。而新主线应该会在:机柜内部密度提升,互通带宽持续扩容。存量算力提带宽、提利用率、降低单To­k­en成本。这正是我国押注的:AI的核心价值在于“广泛应用和成本优化”,而不是“单点技术突破后的垄断”——让尽可能多的国家、企业、开发者用上成本最低的模型,从而在全球范围内摊薄研发成本,同时形成以中国技术为核心的生态圈。

31. 大模型的单位经济:收入涨了,账还没算平

32. 企业内部搞大模型私有化部署,算力成本和真实ROI究竟怎么算?

33. 模型公司要上市,先把算力账摊开

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章