Token 消耗量,能否成为预测经济活跃度的新指数?
Token消耗量能否成为预测经济活跃度的新指数?要回答这个问题,不妨先看一个已经被验证的先例——克强指数。
克强指数是《经济学人》在2010年推出的用于评估中国GDP增长量的指标,源于2007年时任辽宁省委书记的李克强告诉美国驻华大使,他更喜欢通过三个指标来判断经济状况:工业用电量、铁路货运量和银行中长期贷款。花旗银行据此编制了克强指数,权重分别为40%、25%和35%——这个权重来自三个指标增速对GDP增速的回归拟合。
克强指数之所以有效,有三个原因。
第一,耦合紧密。用电量与工业产出有热力学耦合:炼一吨钢要多少度电,由物理定律决定,短期内不会变;铁路货运量与实物交易有物理耦合:货物搬了就是搬了,不可能"假装运了";银行贷款与经济信心有制度耦合:放贷要过风控,坏账会追责,银行不会"假装放贷"。三个指标跟实体经济之间都有不可绕过的绑定。
第二,造假成本极高。三项数据来自电网、铁路和银行的实际业绩核算,项项关乎真金白银,既不可能、也没有必要弄虚作假。这恰恰是它比官方GDP更可信的原因:GDP统计有地方注水的空间,而电表转了就是转了。
第三,先行指标属性。用电量、货运量、贷款量是经济运行的实时信号,比GDP统计更早反映经济拐点。在它设计的时代(2007-2013年),克强指数对经济走势的反映比GDP更真实、更灵敏。
但克强指数也有局限。它最擅长反映的是工业经济,对IT、金融、服务业,三个指标基本失灵。程序员写代码不怎么耗电,也不走铁路货运。随着中国经济从工业主导向服务业主导转型,克强指数的代表性在衰减,2015年以后不少分析认为它需要修正。这也说明了一件事:指标的有效性取决于它与经济结构的匹配度,匹配度变了,指标就要重新校准。
回到Token消耗量。它和克强指数的三个指标有一个表面相似:都是"原生数据",都不经过人为统计加工。但相似到此为止。
Token消耗量目前不能成为经济指标,核心原因是耦合太松——它跟经济产出之间隔了两层不确定性。
第一层:Token到AI输出,效率剧烈波动。同一个任务,大模型要1000个Token,蒸馏后的小模型只要200个。模型迭代一次,Token效率可能翻倍。克强指数的用电量不存在这个问题——热力学定律不会因为技术迭代而改变,但Token效率会因为一次架构升级而剧变。所以Token消耗下降,你分不清是"用得少了"还是"用得更精了"。这个歧义在用电量上基本不存在。
为什么会有这种歧义?根源在于:用电量背后的行为主体是工厂主,工厂主在乎电费,所以不会空转机器——每一次用电都携带了价值判断。Token消耗量背后的行为主体是AI,AI不在乎它生成了什么——每一次Token消耗都不携带价值判断。耦合松紧的差异,归根到底取决于行为主体是否"在乎"。
第二层:AI输出到经济价值,判断在外部。电表转了,钢就出了,物理上锁死。铁路运了货,货就在那里,搬不走的。银行放了贷,钱出去了,合同签了。但Token消耗了,输出可能是关键决策的依据,也可能是没人看的废话——价值锚点不在AI这一侧,在用AI的人那一侧。克强指数的三个指标都不需要过这关,因为它们的产出跟消耗是物理或制度绑死的。
还有第三层:造假成本极低。克强指数的三个指标"项项关乎真金白银",造假几乎不可能。但刷Token消耗几乎没有物理约束——一个脚本就能让Token消耗量翻十倍,而没有任何实际产出。用电量造假要真开机器,铁路货运造假要真搬东西,银行贷款造假要真签合同。Token造假只需要一行代码。
所以Token消耗量的逻辑链是:Token→AI生成→人的判断→价值。克强指数的逻辑链是:电→物理生产→价值。一个松耦合,中间断了两截;一个紧耦合,物理定律担保。
但这不代表Token永远不能当指标。克强指数也不是天然就是经济指标——它是在几十年数据校准中被验证有效的,而且它的有效性随经济结构变化而衰减,需要修正。Token消耗要成为经济信号,需要同样的校准过程。具体来说需要五件事:与业务指标的耦合验证(Token消耗和实际收入、留存、转化率做回归)、区分效率提升与规模扩张(Token消耗下降到底是好事还是坏事)、分层分析质量与数量(哪些Token在干正事,哪些在浪费)、识别人为注水(刷量与真实使用的区分)、区分行业分布(不同行业Token使用的经济含义完全不同)。这五个条件本质上就是在做克强指数当年被自然完成的那件事——补上断裂的耦合。
更根本的是,经济活跃度的核心是人的欲望在市场上被表达、被满足、被延迟、被转移的过程。GDP度量的是无数人基于各自立场做出的价值判断,我愿意花多少钱买这个东西、这个服务值不值得我付费、这个工作值不值得我做。每一次交易背后都有一个在做选择的人。AI的行为不携带任何内在价值判断,它没有在做选择,只是在采样;没有在创造价值,只是在生成Token。Token本身不携带价值判断,价值判断来自使用它的人。
经济活动本身正在被Token化,当越来越多的工作流被AI辅助,Token消耗确实与经济活跃度发生了耦合。但这种耦合是影子关系:Token消耗是经济活动的影子,不是经济活动本身。它可以度量影子的长度,但不能度量投下影子的那个人的重量。
结论:Token消耗量是AI使用热度的温度计,不是经济活跃度的晴雨表。克强指数能当晴雨表,不是因为它的指标比Token更"本质",而是因为它的耦合更紧、造假更难、校准更成熟。Token要走同样的路,但面前还有三道坎:效率波动、外部价值锚定、低造假成本。把它们当作经济指标,就是把热度和活力混为一谈。这两个东西有时候是正相关的,但一个是因为有人想做事,一个是因为有人按了按钮跑起来的。原因就不是一回事。
AI的技术规模可以用Token消耗来度量。但AI对人类社会的实际影响——它创造了什么价值、替代了什么劳动、改变了什么行为,需要人的价值判断来锚定。Token不会告诉你答案。因为Token从来不在乎答案。