BACK TO ARCHIVE SIGNAL RECEIVED

"词元"是智能时代的计量单位,但它不是"数据要素"

"词元"是智能时代的计量单位,但它不是"数据要素"
FIGURE / 001BAI JOURNAL · ORIGINAL SIGNAL

8 月 28 日开幕的 2026 数博会,把主题定为"词元——数据要素价值释放新路径"。这是国家数据局第一次把一个技术名词放到国家级博览会的主题位上;随后求是网刊文,把词元称为"新型数据要素""智能经济的引擎"。

我对此的判断略有些不合时宜:词元(Token)在技术上是"模型处理信息的最小单元",本质是算力消耗、智能服务的计量单位,而不是传统意义上的"数据要素"。把两者等同,会在政策落地时撞上三堵墙。但在展开之前,得先承认这个提法的来路是合理的。

词元是"流量",不是"资产"

数据要素的特点是"可确权、可复用、可交易、边际成本趋近于零"——一份数据可以被反复使用而不消耗。但词元是"用多少、付多少"的一次性消耗品,像水电一样,烧掉就没有了。把词元叫"数据要素",实际上是把两件不同的事混在了一起:一边是作为存量资产的数据,一边是作为流量消耗的智能服务。前者要解决的是确权和流通,后者要解决的是计量和结算。

这个混同不是偶然的。词元调用量的增长曲线非常陡:央广网的报道给出了一组数——2024 年初全国日均约 1000 亿次,2025 年底涨到 100 万亿次,2026 年 3 月达到 140 万亿次;中新社则提到截至 2026 年 6 月已突破 500 万亿次。当一个指标一年涨几个数量级,政策制定者自然会想把它"升格"为可统计、可引导、可交易的对象。它也给"从卖算力到卖智能服务"的价值链升级提供了一个抓手,贵州、内蒙古等地确实在抢抓"词元经济"来盘活自己的算力家底。

三堵墙:计量、确权、价值锚点

但把词元当"数据要素"去交易,落地时会撞上三堵墙。

第一是计量墙。词元是异构的:一个文本 token 和一个视频 token,成本差几个数量级;同一个 token 在不同模型里,"价值"也完全不同。没有一个统一的计量标准,就没有真正的交易市场。求是网文章自己都承认,要"加快建立统一的词元计量标准和交易规则"——这句话反过来证明,这个标准今天还不存在。

第二是确权墙。数据要素要确权、要登记、要流转,但词元是消耗品,不存在一份"属于谁的词元资产"。所谓"词元交易",交易的其实是算力服务和模型调用能力,这属于算力市场、模型服务市场,跟"数据要素市场"是两回事。

第三是价值锚点墙。说词元是"智能时代的价值锚点",前提是模型能力可以被标准化度量。但今天没有一个公认的模型智能水平度量标准,同一个词元在不同模型里产出的价值天差地别,"锚点"就锚不住。

这个提法有价值的部分

要说清楚,这个提法并非没有价值。它的积极意义在于:把"模型调用量"这个原本只有工程师关心的指标,上升为一个可以进入国家统计、引导地方产业的政策抓手。求是网文章建议把"单位词元消耗对 GDP 的拉动效应""重点行业人工智能渗透率"纳入国家统计体系,这个方向是对的——它承认了智能经济的价值需要被度量。

问题的关键不是"要不要重视词元",而是"把词元安放在哪个位置"。

先补计量,再谈交易

真正该做的,是把词元定位为"智能服务的计量与结算单位",而不是"可确权交易的数据资产"。这两者的区别,决定了政策着力点的先后:如果把它当数据要素,政策会急着去建"词元交易市场";如果把它当计量单位,政策应该先解决计量标准这个前提——按什么模型、什么模态、什么质量来折算一个标准词元,谁来定折算口径,怎么防止各厂商各说各话。

落到操作层面,谁主导?这个标准应该由国家数据局牵头,但不能只靠行政发文,而要拉着主流模型厂商、云厂商、算力平台一起定,因为计量口径只有厂商愿意认账才有意义。先解决什么?先统一计费口径和统计口径,让"日均词元调用量"从一个宣传数字,变成可审计、可比较的统计指标,再谈交易。如何衡量效果?不看"词元交易额"这个数字有多大,而看"单位词元消耗对 GDP 的拉动"能否真正进得了统计、经得起审计。

对地方来说,抢抓"词元经济"不如先把两件更实在的事做好:高质量数据集建设(这是词元价值的真正来源),和全国一体化算力网的集约利用(这是词元成本的决定因素)。这两点,恰恰是今年 5 月国家数据局词元经济座谈会自己明确的"核心着力点"。

一个概念跑得比它的计量标准还快,是政策话语的常态;但要让"词元经济"不落空,得先让"词元"这个词元自己,先有一笔能被算清楚的账。

/ DISCUSSION CHANNEL

评论

留下你的判断、补充或不同意见。

频道暂时安静,成为第一个发言的人。