top of page

《人民日报》支持为 Token 取中文名,但谁胜出仍将由使用情况决定

8月6日
讀畢需時 13 分鐘

尽管开发者早已形成一套稳定的词汇体系,《人民日报》仍将一项已有四个月历史的 Token 翻译决定,重新引向关于技术影响力的争论。

最新进展是一篇发表于 8 月 6 日的评论文章,文中称,为 Token 选择中文术语会影响谁来定义人工智能的话语体系。该文章登上了澎湃新闻热榜,但其聚合页面未提供经核实的发布时间。

这项术语决定本身并不新鲜。中国国家科学技术名词审定机构已于 2026 年 3 月公布了中文名称。当前争议在于,这一官方术语能否在政府文件和国内媒体之外获得实际影响力。

这种区别很重要。技术语言只有在研究人员、开发者、供应商、教育者和客户持续使用时,才会形成影响力。官方决定可以加速采用,但无法让存在争议的定义自动变得技术上精确。

因此,这场竞争并不只是英语与中文的对立,而是制度化术语与工作语言之间的较量;工程师和市场将决定二者最终是否趋于一致。

Token 的决定发生在 3 月,而非 8 月

热榜文章重提的是既有术语推广行动,而不是发布一项新的技术标准。

3 月 25 日,全国科学技术名词审定委员会发布了一则试用术语通知。该通知为 AI 领域的 token 选定了一个大致意为“词元”的中文表达。

该委员会获授权审定并公布规范化科学术语。它于 1985 年经国务院批准成立,并在由中国科学机构共同支持的体系下开展工作。

“试用”一词至关重要。按照该委员会公布的流程,新发布术语可在正式审定前收集反馈。因此,3 月的通知只是制度化的起点,并不能证明其已被普遍采用。

两天前,国家数据局局长刘烈宏在中国发展高层论坛上使用了同一表达。他将 token 描述为一种可计量单位,也是连接技术供给与商业需求的纽带。

随后,3 月 25 日的一份政府摘要将这一中文名称表述为既定结论,并将该术语与国内 AI 活动规模的相关说法联系起来。

据该部门称,中国日均 Token 调用量从 2024 年初的 1000 亿增长至 2025 年底的 100 万亿,并在 2026 年 3 月超过 140 万亿。

这些数字意味着,在约两年内增长超过一千倍。它们也解释了为何官员认为,这一单位不只是专业计算机科学词汇。

不过,对这一指标需要谨慎解读。“Token 调用量”并不是拥有统一公开审计方法的国际标准指标。不同机构可能会以不同方式统计模型输入、生成输出、缓存内容、内部推理或智能体活动。

这些数据展现的是中国主管部门如何界定 AI 消费规模。它们并不能独立证明模型质量、经济价值或相对国际市场份额。

8 月的评论为 3 月的决定增添了政治与文化层面的论点。其核心主张是,命名会影响技术话语、公众理解,并最终影响规则制定权。

这使该评论具有新闻价值,但并未改变模型切分文本的方式。不会因为一篇社论支持新术语,分词器就发生变化。

实际发生的是,一项协调行动正试图将中文技术表达从正式文件带入主流公共语言。当这一努力遇上既有的开发者习惯时,张力便开始显现。

为什么 Token 成了战略性词汇

Token 如今处在语言、计算成本、产品限制和 AI 基础设施的交汇点。

Token 是模型在分词器将文本或其他输入转换为数值片段后处理的单位。它可以代表一个单词、部分单词、标点符号、代码或其他经学习得到的单位。

这一界定有意比“单词”更宽泛。例如,英语单词 “unbelievable” 在一种分词器下可能被拆成多个片段,而在另一种分词器下则可能更少。

中文文本带来了另一层复杂性。一个 Token 可以代表一个字符、多个字符、标点符号、字节序列,或较少见表达的一部分。

Tokenization 是执行这种转换的机制。现代系统通常根据高频重复出现的字节或字符模式构建词表,而不是依赖词典中的单词。

支撑字节对编码的那项颇具影响力的子词研究表明,这类片段为何能帮助语言系统处理罕见和此前未见过的词语。后来的模型家族以大得多的规模采用了相关方法。

这一机制赋予 Token 精确的技术角色。同时,这一单位也获得了若干商业角色,而在分词主要吸引语言处理研究者关注时,这些角色尚不存在。

模型提供商使用 Token 描述上下文限制,也用它们计量 API 消费。开发者则跟踪 Token,以控制延迟、容量和支出。

AI 智能体进一步提升了其重要性,因为一次可见请求可能触发许多隐藏操作。智能体可以检索文档、调用工具、修订计划,并产生多轮中间模型响应。

每一步都可能消耗输入和输出 Token。最终答案可能只有几段文字,而支撑该答案的过程处理的内容量却大得多。

这也确实给政策制定者寻求易懂术语提供了理由。如果基本单位仍不透明,人们就难以评估 AI 套餐或基础设施相关说法。

中国的官方推广也恰逢 AI 从模型展示转向运营应用。国家数据局将 Token 描述为连接技术能力与商业需求的结算单位。

这一表述包含一个有益洞见。Token 可以在模型服务中充当类似计量单位的角色,尽管它既不是货币,也不是衡量智能的通用尺度。

这种区别至关重要。一个模型中的一个 Token,在信息内容、处理工作量或输出质量上,未必等同于另一模型中的一个 Token。

Token 数量取决于分词器。成本则取决于模型架构、硬件、缓存、批处理规模、服务设计,以及输入与输出之间的比例。

小型分类模型处理的一百万 Token,无法与大型推理系统处理的一百万 Token 直接比较。可见数量相近,但实际工作不同。

这正是官方语言能够影响政策的地方。一旦政府在采购、统计、教育和基础设施规划中使用某一术语,该术语就会塑造机构衡量什么。

风险在于,语言上的清晰可能制造虚假的经济精确性。标准化名称并不会让底层分词器、工作负载或核算方法实现标准化。

《人民日报》的论点在提出谁应让技术概念变得易懂时最有说服力;如果将术语本身视为技术领先地位的证据,其论证便会变弱。

官方语言遇上开发者语言

首要竞争发生在制度化采用与开发者日常使用的既有词汇之间。

大多数中国 AI 开发者都认识英文词 token。它出现在 API 文档、软件库、研究论文、仪表盘、错误信息和国际技术讨论中。

这种既有基础赋予英文术语相当强的持久力。开发者选择词汇并不只是出于文化原因,他们也会为互操作性和可检索性进行优化。

一名正在排查上下文限制问题的程序员,往往会搜索 API 显示的准确措辞。如果界面写的是 “input tokens”,将查询翻译成中文可能降低可获得结果的质量。

研究同样造成类似压力。英文论文在自然语言处理、计算机视觉、语音系统和多模态模型中都使用 token。

这个词还会与 tokenizer、token embedding、token budget、token probability 和 special token 等相关术语一同出现。替换其中一个元素,并不会自动形成一套连贯的技术术语体系。

然而,全部保留英文会形成另一种障碍。政策制定者、企业采购方、学生和普通用户可能将 token 误解为加密货币资产或身份验证凭据。

计算机安全领域早已用 token 指代凭据和访问机制。区块链市场也用同一词指代数字资产。AI 则将其用于模型输入和输出单位。

清晰的中文术语可以减少特定语境下的歧义,也能让教学和公共政策不那么依赖未经解释的英文词汇。

官方表达遵循了一种常见的中文构词方式。第一个元素指向语言单位,第二个元素则暗示基本组成部分。

这使该术语易于理解,但并不完全周全。AI 系统切分的不只是单词,现代多模态系统还会在处理文本的同时处理图像、音频和视频表征。

即使在文本中,Token 也并不总与词汇单位对应。字节级系统可能将陌生字符或符号拆成不具备独立词汇意义的片段。

这种技术上的不匹配解释了为何一些专家提出替代方案。分歧并不必然意味着反对中文术语,也可能反映了对于这一单位究竟代表什么的不同理解。

一种思路强调语言,另一种强调符号或模型层面的单位,第三种则干脆保留英文词,因为它在不同技术领域中的含义会发生变化。

官方机构面临一个艰难的设计问题:术语必须足够准确以满足专家需求,足够易懂以面向公众,并足够灵活以适应技术变化。

开发者则面临更直接的考验。所选词汇必须帮助他们沟通,且不应在中文文档与全球系统之间制造额外的翻译工作。

双方都有合理需求。制度化语言有利于一致性和广泛可及性,工作语言则有利于兼容性、速度,以及既有技术网络中的精确性。

最可能的结果并非彻底替代。中文出版物可以将本地术语与 token 并列使用,而代码、参数和国际研究仍保留英文标识符。

这种模式已出现在官方报道中。国家数据局及其他国家媒体通常会同时展示两种表达,而不是删除英文术语。

双语使用削弱了这是一场赢家通吃竞争的说法,也为中文表达获得认可提供了务实路径,同时不会让国内开发者与外部隔绝。

Token 命名不会创造技术实力

一个国家只有当其术语描述的是他人使用、衡量并据以构建的系统时,才能获得技术影响力。

《人民日报》的评论将命名与话语权联系起来。历史在一定程度上支持这一论点,但也为它设定了严格标准。

术语塑造公众认知。它们决定了哪些内容会出现在教科书、法规、采购文件、媒体报道和高管讨论中。

一个国家若能尽早参与技术命名,就能避免重要概念以不一致的译法进入公共讨论。它也可以减少对他方所创造解释体系的依赖。

然而,词汇往往是跟随技术机构传播,而不是引领它们。术语之所以能在国际上传播,通常是因为它们伴随着被广泛使用的产品、有影响力的论文、标准和开源项目。

因此,中国对 AI 影响力最有力的论据,来自模型、研究、应用、芯片、数据基础设施和开发者社区。翻译可以梳理这些活动,但不能替代它们。

以开发者接触 tokenization 的方式为例。他们通过模型行为、上下文限制、API 计量、多语言性能和意外截断来体验它。

如果中国模型能以更少的单位处理中文文本,同时保持输出质量,开发者就会在意。相关术语随后便可能获得具体的技术含义。

如果中国标准机构发布衡量规则,使不同供应商的 token 统计数据可供比较,企业采购方就会在意。这将赋予相关词汇实际的运营功能。

如果中国研究人员影响多语言 tokenizer 的设计,中国便可以影响全球模型如何表征语言。这类工作比单纯选择一个本地名称更具技术分量。

语言表征并非中立。围绕某些语言训练的 tokenizer,可能会将其他语言拆分成更长的序列,从而增加上下文占用和处理需求。

具体影响因模型和词表而异。应在可比较的任务中进行衡量,而不应仅根据一种语言的书写系统作出断言。

这为术语争议背后提供了可信的政策议程。中国机构可以资助多语言基准测试,要求更清晰的 token 核算,并支持高效表征方面的研究。

它们也可以推动供应商披露所使用的 tokenizer、哪些内容计入用量,以及缓存 token 或内部 token 如何在报告中呈现。

这些行动会使官方术语成为可衡量的治理框架的一部分。缺少这些行动,这场运动就有沦为围绕不稳定单位进行品牌宣传的风险。

据报道的每日 140 万亿次调用说明了这一问题。这个数字听起来很精确,但如果没有范围和方法论,读者无法有把握地进行比较。

它是否包括面向消费者的聊天产品、企业 API、内部批处理以及合成数据生成?它统计重复的智能体步骤,还是只统计外部调用?

所有报告数据的公司是否以相同方式定义输入 token?是否包括缓存 token?多模态单位又如何换算为汇总数据?

本文审阅的公开文档并未回答这些问题。这一缺口并不意味着该统计数字是虚假的,但它限制了分析人士能够得出的结论。

一个站得住脚的说法是,根据中国政府数据,国内模型活动显著增长。至于全球领先地位的更强论断,则需要可比较的定义和独立证据。

同样的标准也应适用于术语。将一个单位称为战略性单位,并不会让所有基于它的衡量都具有战略意义。

Token 争论仍然忽视的问题

围绕命名的争论,将若干尚未解决的技术和经济问题压缩成了一个在情感上颇具吸引力的象征。

第一个问题是定义范围。文本模型中的 token 并不总是类似单词的单位,而图像模型中的 token 则可能代表一个图像块或学习得到的视觉元素。

语音和视频模型带来了更多变化。多模态架构可以将多种输入类型转换为内部序列,而其中的单位并不共享一个直观、统一的公共含义。

以词语为核心的译法,在向新用户解释聊天机器人时效果很好。但当它被应用于整个 AI 领域时,准确性就会下降。

第二个问题是可比性。token 数量会因 tokenizer 不同而不同,供应商也可能展示推理过程中的不同部分。

推理模型使情况更复杂。供应商可以单独计费或报告内部推理单位,将其纳入输出,或将部分过程隐藏在产品抽象之后。

智能体系统还会加入工具描述、检索段落、对话历史和中间结果。因此,一个简短的用户请求可能反复产生大量上下文。

这对企业采购方很重要。他们需要比较完成的任务、准确率、延迟和总资源消耗,而不只是原始 token 数量。

使用更少 token、但产出不可靠工作的模型,并不必然更高效。另一种模型可能消耗更多单位,只是因为其 tokenizer 对相同内容采用了不同的切分方式。

第三个问题是政治层面的过度延伸。批评者完全可以接受中国技术术语,同时拒绝“一种译法会实质性改变国际影响力”的说法。

8 月的讨论引发了一些持怀疑态度的网络反应,部分人认为这场运动与开发者的实际工作实践脱节。社交媒体并非具有代表性的证据,但它揭示了采用上的挑战。

用户反复将 token 与 CPU、USB 等熟悉的缩写相比较。这些例子表明,本地语言的解释与英文技术标签可以长期并存。

第四个问题,是将使用量误视为经济产出。token 是计算的输入和输出,而不是收入、生产率或经验证的客户价值。

自动化系统可通过测试、合成数据、重复的智能体循环或低效提示词生成巨大 token 量。高使用量可能意味着采用、浪费,或两者兼而有之。

一个有用的指标应将 token 数量与完成的工作联系起来。例如,已解决的服务请求、被接受的代码修改、已审核的文件,或无需人工纠正即可完成的任务。

知识工作者也会间接体验 token。漫长的个人知识工作流可通过检索和反复分析消耗上下文,却不暴露其底层单位。

清晰的词汇有助于这些用户就限制和数据处理提出更好的问题。不过,他们不应为了判断 AI 产品是否有效,就不得不成为 token 会计师。

第五个问题是持久性。模型架构可能会降低当今 token 边界的重要性,或将更多处理转移到连续的内部表征中。

token 仍是当前语言模型的核心,但这一公共术语必须经受架构变化的考验。过于狭窄的定义可能很快过时。

委员会的试行流程为解决这一担忧提供了空间。语言学家、AI 研究人员、教育工作者、开发者和供应商的反馈,可以检验所选表达在不同领域中的适用性。

判断这一决定的标准,应是它是否在不掩盖技术差异的前提下改善沟通。文化象征意义固然相关,但精确性仍是更难满足的要求。

三个信号将显示新术语是否重要

采用情况、衡量标准和国际技术产出,将揭示这场命名运动是否能产生持久影响。

第一个信号是产品采用的一致性。关注中国模型供应商、云服务商、电信公司、大学和开发者平台。

当独立组织无需官方推动便开始使用某个术语时,它就已经超越了政策层面。文档比仪式性演讲更重要,因为开发者会在实际工作中查阅文档。

界面提供了更强的检验。如果仪表板、账单记录、用量提醒和采购合同采用中文术语,它就会成为运营 AI 的一部分。

双语标签同样可视为采用。它们既能保持国际兼容性,也能让更广泛的国内受众理解这一单位。

如果主要供应商在面向开发者的系统中继续只使用英文,官方表达将在政府和媒体语言中最为强势。这会削弱其拥有广泛技术权威的主张。

第二个信号是共享核算标准。中国需要发布规则,说明各组织如何计算汇总 token 活动。

这些规则应区分输入、输出、缓存内容、内部推理、智能体循环和多模态单位。它们还应解释如何汇总使用不同 tokenizer 的供应商统计数据。

可比的衡量方式将强化 3 月的使用量主张。它将帮助企业采购方评估效率,也将帮助政策制定者区分有价值的采用与自动化产生的量。

没有这类规则,更大的数字可能只是反映了不同的计数方法。国家指标将吸引关注,却只能提供有限的分析价值。

第三个信号是中国技术工作在国际上的采用情况。关注 tokenizer 研究、多语言基准、模型文档、标准提案和开源库。

一个中文名称无需在英文中取代 token,仍可在国际上产生意义。它可以支持国内教育,同时中国研究人员影响底层机制。

最有力的证据将是,中国开发的方法在多语言 token 效率、模型计量或跨供应商报告方面获得外部采用。

这将把语言与技术贡献联系起来。它也会将话语权从一种编辑性主张转变为可观察的结果。

未来三个月,术语委员会的反馈流程值得密切关注。任何对范围的澄清,都将表明官员是否认识到多模态和核算问题。

供应商文档应当随之跟进。彼此无关的公司若能一致使用该术语,将强化这一论点:它已摆脱政策驱动的媒体周期。

计量披露是最终检验。如果相关机构公布 140 万亿这一数字的方法论,分析人士便可评估这种增长实际代表什么。

《人民日报》说得没错:技术语言会带来后果。名称会影响谁能参与讨论,以及机构如何组织一个新市场。

但词汇的权威来自使用。当 token 的中文名称改善教育、文档、计量和模型设计时,它才会变得重要。

因此,开发者和企业采购方应关注行为,而非修辞。这个术语是否能让账单、上下文限制或采购要求更清晰?

它是否有助于比较竞争系统?它是否支持更好的多语言模型?这些结果将决定这场运动是扩大技术影响力,还是仅仅为一个进口单位重新命名。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)和M-Chip Mac 。

你的 AI 工作伙伴

和 remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page