Token定名“词元”:它不仅是AI的计价器,更是万亿产业的晴雨表
近期,在人工智能领域备受关注的术语“Token”迎来了它的官方中文名:“词元”。在不久前举行的中国发展高层论坛年会上,国家数据局局长刘烈宏明确将Token称为“词元”,并指出它不仅是智能时代的价值锚点,更是连接技术供给与商业需求的“结算单位”,为AI商业模式的落地提供了可量化的基础。这一官方定调,结束了此前关于“令牌”、“标记”、“模元”、“智元”等多种译法的讨论,为这一关键概念的普及和标准化奠定了基础。
那么,究竟什么是“词元”?简单来说,词元是人工智能大模型在处理信息时所能理解和运算的最小单元。当AI模型接收到一段文字、一张图片或一段语音时,它并不能像人类一样直接理解整体内容,而是需要先将这些信息“打碎”成一个个它能够处理的片段,这个过程就是“Token化”,而这些碎片就是“词元”。例如,一句中文“今天天气很好”,可能会被拆分为“今天”、“天气”、“很”、“好”等多个词元;一个英文单词“unbelievable”也可能被拆分成“un”、“believe”、“able”三个词元。

词元的概念之所以重要,不仅在于其技术层面的基础性,更在于它已经成为衡量和驱动AI产业经济价值的核心单位。

词元是AI服务的“计价器”。目前,绝大多数商业大模型都采用按词元数量收费的模式。用户每一次与AI的交互,无论是输入问题还是接收答案,背后都在消耗词元,这些消耗直接与算力、电力等成本挂钩。因此,词元成为了AI产业的核心计量与计价标准,催生了以其为基础的“词元经济”。企业和开发者购买和使用AI服务,就像为电力支付电费、为上网支付流量费一样,有了明确的成本核算依据。

词元是衡量AI产业活跃度的“晴雨表”。一个国家或地区的日均词元调用量,直接反映了其AI技术的应用广度和深度。根据国家数据局披露的数据,我国日均词元调用量实现了惊人的增长,从2024年初的1000亿,到今年3月已突破140万亿。这一数据的千倍级增长,充分表明我国人工智能产业已进入高速发展和规模化应用的阶段,应用场景正从简单的对话向更复杂的决策执行智能体演进。

为Token确立“词元”这一中文名,本身也具有深远意义。一个统一、易懂的中文名称,有助于降低AI知识的普及门槛,让更多非专业人士能够理解并参与到这场技术变革中,这对于推动AI成为国家战略性的普惠技术至关重要。同时,在全球AI竞争中,用自己的语言来定义和度量核心单位,也体现了技术实力和话语权的提升。

当然,“词元”这一译法也并非没有讨论。有观点认为,“词”字可能局限于文本领域,未来在多模态AI时代,图像、视频的单元或许难以用“词”来概括。但更多人认为,“词元”的译法兼顾了历史渊源与大众认知。它不仅在自然语言处理(NLP)学术圈早有使用基础,而且“词”直观地关联到语言,“元”则准确地表达了“基础单元”的含义,对于向公众解释这一概念非常友好。
“词元”的正式定名,不仅是一次术语的规范,更是一个标志性事件。它意味着AI技术正从专业圈层走向大众,其经济价值和社会影响也开始被清晰地量化和认知。看懂“词元”,就是理解AI时代运行逻辑和价值创造方式的一把关键钥匙。
