OpenAI首席执行官萨姆·奥特曼(Sam Altman)提出的一个大胆预测——“6年后人均月耗5000亿token”——引发了业界对未来AI发展的广泛讨论。这一数字的背后,不仅是对技术进步的极致想象,也触及了资源、经济与商业模式的现实边界。这一预测究竟是可行的未来图景,还是一个难以企及的梦想?
预测的基石:AI的无处不在与成本的持续下降

支持这一预测的观点认为,未来的AI将不再局限于一问一答的聊天机器人,而是会像电力和互联网一样,成为无处不在的公共基础设施。AI将深度融入我们工作和生活的方方面面,例如在编写文档和处理表格时,AI会作为“人机共写”的伙伴随时响应;个人设备上将运行数十甚至上百个持续工作的AI智能体(Agent),自主处理邮件、安排日程、执行复杂任务。在这种“全天候在线”的模式下,Token的消耗量将从单次交互的“点状”消耗,转变为持续运行的“流式”消耗,其增长将是指数级的。
这一愿景的实现,离不开“杰文斯悖论”的经济学逻辑:当一种资源的使用效率提高、成本下降时,其总消耗量反而会大幅增加。近年来,AI模型的单价确实在急剧下降,部分主流模型的推理成本在短短几年内下降了超过90%。成本的降低使得过去因价格高昂而无法尝试的应用场景变得触手可及,从而释放了被抑制的巨大需求。正如更便宜的电力催生了电气化时代,更廉价的Token也将引爆AI应用的全面爆发。一些分析已经指出,企业内部的Token支出正在成为新的生产资料,有观点认为,未来知识型员工薪资的两到三成将转化为Token预算,以换取数倍于人力成本的生产力提升。
现实的挑战:失控的成本与物理世界的瓶颈
然而,理想的增长曲线正与残酷的商业现实发生碰撞。即便单价降低,海量的消耗依然带来了惊人的总成本。有分析指出,若以当前价格估算,人均5000亿Token的消耗所对应的经济规模极其庞大,这在商业上几乎难以承受。
事实上,一场“Token节流”的浪潮已在科技巨头中上演。由于AI工具尤其是智能体(Agent)的使用导致成本失控,优步(Uber)、亚马逊(Amazon)、Meta等公司已从早期的鼓励员工“极限消耗”(tokenmaxxing),转向设置支出上限和限制使用。优步甚至在短短几个月内就耗尽了全年的AI预算,其高管也坦言,高昂的支出与实际的业务创新成果之间,尚难划上清晰的等号。这种从“踩油门”到“踩刹车”的转变,揭示了当前AI商业化面临的普遍困境:生产力提升的承诺很美好,但失控的账单让企业不得不回归理性。
除了经济账,技术和资源上的瓶颈或许是更根本的制约因素。奥特曼本人也对全球“巨大的计算资源短缺”表示焦虑。随着模型越来越强、需求永无上限,硬件的扩张速度很可能持续跑输需求的增长速度,算力短缺或将长期存在。更底层的是能源问题,AI的每一次思考,最终都需要消耗实实在在的电力。在需求尚未充分商业化的阶段,存在大量的“无效Token燃烧”,这不仅是经济浪费,更是对社会稀缺资源的指数级消耗。电力供给的稳定性和成本,将成为制约AI无限制扩张的终极物理瓶颈。
未来路径:从模型竞赛到效率比拼

在这场关于可行性的辩论中,一个共识正在形成:AI产业的竞争重点,正从训练出更强大的模型,转向如何以更低的成本、更大规模地分配和交付智能。这催生了“Token经济学”这一新视角,它将AI推理视为一个受约束的资源分配问题,旨在平衡输出质量与经济成本。
为了应对挑战,技术路径也在不断演进。业界正在探索多种方案以降低成本、提升效率:

1. 软硬件协同优化:通过算法优化、FP4等低精度推理以及专用硬件(如LPU语言处理单元)的结合,大幅提升单GPU的吞吐量,从而降低单位Token成本。
2. 系统级效率提升:通过“超节点”等Scale-up架构,将成千上万张芯片高效协同,把单卡算力转化为系统级的有效算力,突破单卡性能瓶颈。
3. 大小模型结合:在实际应用中,采用多个廉价小模型组成工作流,分别处理细分任务,其综合成本和效率可能优于使用一个昂贵的旗舰模型。
4. 端侧(本地)计算:随着个人设备算力增强,未来大量Token消耗可能在手机、PC等本地设备上完成,这不仅能降低对云端服务器的依赖和成本,也更好地保护了用户隐私。
奥特曼“人均月耗5000亿Token”的预测,描绘了一个AI与人类社会深度融合的极致未来。尽管这一具体数字在当前的经济和资源条件下显得极为激进,甚至面临着成本失控和物理瓶颈等严峻挑战,但它准确地指出了AI应用需求呈指数级增长的宏观趋势。未来能否接近这一目标,不仅取决于模型能力的提升,更依赖于整个产业链在降低成本、优化系统和解决能源供给等基础问题上的突破。这场从“模型为王”到“效率至上”的转变,将是决定AI能否真正成为普惠性“公共事业”的关键。