近期大模型Token调用量呈现井喷式增长,国产模型首次在调用量上超越美国模型。这一现象并非偶然,其背后揭示了AI行业正从简单的“快思考”工具,向能够执行复杂任务的“慢思考”智能体演进。本文通过数据与模型分析,阐明了这一结构性变化,为理解AI行业的新趋势与未来机遇提供了核心视角。
智能速览
中国大模型周调用量首超美国,三周大涨127%。
MiniMax M2.5登顶调用量榜首,表现远超其他模型。
AI智能体场景落地是Token消耗激增的核心驱动力。
模型能力转向编程与自动化,从“工具”变为“劳动力”。
机构预测智能体将使Token消耗提升十倍,算力需求增百倍。
精华内容
Token调用量井喷并非偶然,其背后是AI行业正经历一场从“快思考”到“慢思考”的深刻变革。智能体的崛起,正重新定义着AI的应用边界与商业价值。
国产模型崛起
根据全球最大API聚合平台OpenRouter的数据,AI模型的Token调用量自1月下旬开始显著跃升。在2月9日至15日这一周,中国模型的周调用量达到4.12万亿,首次超过美国模型的2.94万亿。到2月16日至22日,中国模型调用量进一步攀升至5.16万亿,三周内涨幅高达127%。
在该平台调用量排名前五的模型中,有四款来自中国厂商,分别是MiniMax的M2.5、月之暗面的Kimi K2.5、智谱的GLM-5以及DeepSeek的V3.2,这四款模型合计贡献了Top5总调用量的85.7%。其中,MiniMax M2.5表现尤为突出,其周调用量暴涨至3.07T tokens,超过其他三款国产模型的总和。
智能体驱动增长
本轮Token消耗量爆发的核心驱动力,指向了AI智能体(Agent)场景的广泛落地。与普通对话不同,AI智能体在执行复杂任务时,需要进行需求拆解、设计架构、编写代码、检查优化等一系列“慢思考”过程。这个推演过程会消耗大量Token,使得单次任务的Token消耗远超普通聊天。
数据显示,OpenRouter平台超过70%的Token消耗量来自企业及专业开发者的生产环境调用,这证实了专业场景对Token消耗的拉动作用。春节带来的AI应用渗透率提高是催化剂,而智能体场景的成熟则是根本原因。
新秀模型剖析
排名靠前的几款国产模型,其共同点在于聚焦于智能体场景的核心能力。MiniMax于2月13日发布的M2.5,定位为全球首个为智能体场景原生设计的生产级旗舰模型,凭借在编程和工作流中的卓越性能与低成本成为开发者首选。
月之暗面发布的Kimi K2.5,能调度多达100个“Agent分身”并行工作,将复杂任务效率提升数倍。智谱发布的GLM-5,则专为复杂系统工程与长程Agent任务设计,并提供了免费的200K上下文窗口。这些模型精准地切入了市场对高阶自动化能力的需求。
慢思考与算力
从“快思考”到“慢思考”,意味着AI正从“工具”向“劳动力”转变。当AI面对“写一个电商网站”这类复杂任务时,它不再直接给出答案,而是在内部进行反复推演。这种“推理密度”的增加,导致Token消耗的增长速度远超用户数量的增长。
中信证券认为,Token的爆发式增长本质上是AI推理需求的指数级扩容。华泰证券预测,与Chatbot相比,智能体可能使整体Token消耗提升十倍以上,而对应的算力需求将增长百倍以上。这预示着,围绕智能体的算力竞争将成为下一个行业高地。
Token量的爆发是AI从娱乐工具走向核心生产力的关键信号。智能体带来的“慢思考”范式,不仅催生了新的技术高地,也为算力产业描绘了巨大的增长蓝图。在这场变革中,谁能率先构建起面向智能体的技术护城河,谁就将掌握未来的话语权。