我这两年一直在帮一些创业团队做AI算力方案,最大感受就是:算力的计量单位正在肉眼可见地发生变化。早几年谈算力,大家问的是“你有几张A100”“机柜租金多少”;现在越来越多的人开口就是“你这模型跑一个请求要消耗多少Token”。同样的业务,以前按月租GPU实例,现在按Token用量结算。这个变化背后,不只是计费方式变了,而是整个算力产业的生意逻辑在换底盘。
硬蛋创新(00400.HK)近期对外提出向“Token算力运营商”进化,公开信息里这句判断分量很重。要知道这家公司以前的主业是芯片供应链和智能硬件生态,现在把战略方向锚定在Token与AI推理上,说明算力账本被改写的速度,比很多人想象中要快。这篇文章我想从商业模式、技术逻辑和实际操作三个维度,把“Token算力运营商”这个新物种拆开讲清楚:它到底做什么生意、成本怎么算、谁会受益、谁会被动,以及一个普通AI应用团队该怎么用Token算清自己的账。想入局AI创业、在传统ICT行业找转型方向,或者单纯想弄明白“Token为什么突然这么值钱”的朋友,这篇应该能给你一个比较完整的坐标系。
1. 算力账本为什么会被改写
1.1 训练与推理:两种完全不同的算力逻辑
AI时代聊算力,以前主要指训练算力。大模型要先把海量数据“读进去”,通过反向传播把权重调到可用状态,这个过程计算量巨大,一次训练往往要跑几千张GPU卡,一跑就是几个星期。圈内有个很糙但准确的说法:训练是盖楼,推理是住楼。盖楼阶段工程量集中,周期短、强度高;住楼阶段看起来不起眼,但每天都有无数人在里面开灯、用水、上下楼,积少成多,总量反而惊人。
推理(Inference)恰恰就是“住楼”这个阶段。用户把一句话发给模型,模型在前向传播里生成回答,这个过程每次只用一张卡甚至半张卡,但调用次数可以做到每秒成千上万次。当AI应用从尝鲜走向生产力工具,单次推理的价格乘以海量调用次数,就会变成一个非常可怕的流水。很多机构在行业里统计过,成熟期的AI业务,推理算力占比会逐步超过训练算力,甚至达到六成、七成以上。这不是谁拍脑袋得出的结论,而是“训练一次、推理亿万次”的产业规律决定的。
训练和推理在工程上也是两套打法。训练追求吞吐,batch size尽量拉满,让GPU一直在高负荷下跑矩阵乘法;推理追求延迟,用户发完消息不可能等你三分钟,首Token延迟、生成速度、并发能力都是命门。训练可以用分布式框架慢慢磨,推理要面对的是极度碎片化、随机到达的用户请求,必须靠调度、排队、动态批处理来把算力一点点抠出来。所以当一个公司说要往AI推理转型,本质上就是从一个“搞基建”的模式切到一个“搞运营”的模式,技术栈、成本结构、团队基因全部要换。
1.2 算力计费:从按小时到按Token
正因为训练和推理的形态完全不同,产业链的计费逻辑也在分裂。训练算力到今天仍然以“卡月”“实例小时”为单位,客户租一张卡,按小时付钱,用多用少自己扛。这种模式对需求稳定的大客户没问题,但对中小AI应用方来说就很尴尬:我可能一天只有几百个用户,但为了应付晚高峰,不得不租一台8卡机器,大部分时候算力闲置,账面上却一直在烧钱。
推理算力按Token计费,解决的就是这个错配。Token是模型处理文本、图片的基本计量单元,用户调用一次模型,消耗多少Token就付多少钱,不用关心背后跑的是几台服务器、电费多少钱。用我们熟悉的话说,以前是买车,现在是打车;以前是包月健身房,现在是按次付费的私教课。对应用方来说,算力从固定成本变成了可变成本,用多少付多少;对供应方来说,只要能把资源池的总量做到足够大、调度足够聪明,就能在碎片化的需求里攒出可观的利润。
顺带说一句,我在给团队做方案时经常被问到“Token到底怎么来的这么个计费单位”。严格讲,Token不是模型世界里的字或词,而是BPE这类分词算法切出来的最小片段。英文里一个常见单词可能是一个Token,生僻词可能被切成两三个;中文情况更复杂一些,常用字可能一个Token,复杂词组可能切出好几个。模型之所以按Token收费,是因为它的计算量、显存占用,都和Token数量高度正相关。Token等于把非常抽象的计算资源,变成了一把能精确到千分之一的尺子。
1.3 硬蛋创新为什么此时提出转型
回到硬蛋创新。从公开资料看,这家公司在芯片供应链和智能硬件领域深耕了很多年,旗下硬蛋平台服务过大量中小硬件开发者。这类业务的逻辑是“卖水人”:别人要造东西,你提供芯片选型、供应链对接、上下游撮合,赚的是服务费和差价。这个模式本身没什么问题,但在AI浪潮下有一个绕不开的趋势——硬件的价值正在从“实体设备”往“设备里的智能”迁移。以前卖一个智能音箱,利润来自硬件BOM;现在大家买音箱,买的是里面那个能聊天、能控制家居的模型。硬件厂商的注意力,开始从“怎么把零件组装起来”转移到“怎么把智能能力做进产品里”。
一旦看懂了这一点,就明白硬蛋创新提出的“Token算力运营商”不是空穴来风。这家公司手里有大量中小硬件创业者的客户关系,这些人现在恰恰是AI应用最积极的一批尝鲜者:做AI玩具的、做智能客服的、做行业助手的,都在急着接大模型能力。而接模型能力绕不开算力。与其让每个客户各自去云厂商那里买GPU、搞推理部署,不如由硬蛋创新在中间做一层“算力批发转零售”:上游对接各家算力资源,下游把模型推理能力封装成Token化的API卖给这些硬件创业者。这个角色,本质上就是智能时代的“水电燃气公司”——用户不关心电从哪里来,只关心插上插头能不能亮。
2. Token是怎么变成算力“通用语”的
2.1 从自然语言到计量单位
很多人第一次接触Token,是因为OpenAI、DeepSeek这类模型厂商按Token计费,甚至因为“输出Token上限被截断”这种报错而认识它。但在算力运营的语境下,Token的意义远不止计费单位,它是让算力变成可交易标的物的核心抽象层。
为什么这么说?因为算力本身是一个特别难以标准化的商品。一张H100在不同区域、不同电力成本下,价格可能差出好几倍;不同推理引擎对同一句请求的资源消耗也不同;甚至同一个模型在早高峰和凌晨,实际算力成本都不一样。如果直接按“算力”买卖,买卖双方根本没法对账。Token提供了一个稳定的中间锚点:模型确定的情况下,一段输入输出消耗的Token数量基本确定,资源消耗也随之确定。Token就和石油交易里的“桶”、电力交易里的“度”一样,把复杂、异质的资源变成了一个统一、可计量的商品单位。
这里要特别注意:Token作为计量单位,和模型强绑定。同一个问题,换一个分词器不同的模型,Token消耗可能差30%。所以Token算力运营商的报价单上,一定会写着“基于某某模型、某某版本”,Token价格不是普适的,而是合约式的。这也是这个行业早期最容易踩坑的地方——拿一个模型的价格去套另一个模型的账单,对账时一头雾水。
2.2 四种算力购买方式对比
现在市面上从底层到应用,算力购买方式大概能分成四类,我把它们的逻辑和适用场景放在一起,方便对照着看。
| 购买方式 | 计量单位 | 优点 | 缺点 | 典型场景 |
|---|---|---|---|---|
| 自购服务器/显卡 | 一次性固定资产投入 | 完全掌控、长期摊薄成本低 | 维护成本高、利用率难保证 | 算力富余的头部公司 |
| 云主机/GPU实例包时 | 小时/卡时 | 弹性扩容、部署快 | 空闲时段也在扣钱 | 训练任务、稳定流量业务 |
| 模型API调用 | Token | 按量付费、零运维 | 单位价格通常较高、数据要过第三方 | 创业团队快速原型验证 |
| Token算力运营平台 | Token/混合 | 兼顾可控性与弹性、可私有化 | 市场刚起步、服务商良莠不齐 | 有数据安全要求的中型客户 |
从这张表能看出来,前两种方式本质上是“按资源时间付费”,后两种是“按结果消耗付费”。资源时间付费的问题是:时间是不可压缩的,机器没跑满你就亏了。结果消耗付费的好处是:每一个Token都对应一次真实的智能生成动作,钱花在了刀刃上。当然代价也有,按Token算下来,单位计算成本大概率比自建贵,因为你买的不只是算力,还有人家做好的推理优化、工程运维和容错方案。
2.3 Token成本的影响变量
既然Token是计费锚点,那就有必要搞清楚,一个请求到底会被多少个Token“吃掉”。我基于常见实践补充一下,影响Token消耗的主要有这么几个变量。
第一,模型规格。同一条指令,用70B模型和7B模型,虽然输出Token数可能一样,但背后消耗的算力完全不同,所以报价会拉开好几个档次。第二,上下文长度。很多AI应用为了“记忆”,会把历史对话一次次拼进去,结果每次请求的输入Token越滚越大。我见过一个客服机器人项目,单次请求上下文堆到五千Token,其中八成是重复的历史记录——这在计费上就是白花花的银子。第三,输出长度。模型是逐Token生成答案的,输出长度直接决定算力消耗和时间,也因此大部分API会把输出Token的价格定得比输入Token贵。第四,缓存命中率。现在主流推理平台都支持Prompt缓存,系统提示词和公共知识如果命中缓存,输入成本能砍掉一大截。
前阵子我帮一个做垂直搜索的团队调过成本,他们用的是某家大模型API,月初账单出来比预期翻了一倍。我让研发拉了一下请求日志,发现90%的请求都在重复发送同样一份两千多字的系统提示词,而且都没开缓存。改完之后,把系统提示词抽到缓存里,成本直接降了40%。Token成本这件事,很多时候不是模型贵,而是你不会花。
3. Token算力运营商这门生意怎么算账
3.1 运营商到底卖什么
理论上讲,任何有GPU资源、装了开源推理引擎的公司都可以对外提供Token计费服务。但“Token算力运营商”这个定位,我认为关键在于它做的不是一次性资源租赁,而是一个持续运营的智能生产能力租赁服务。运营商的货架上有模型(开源模型定制、第三方商用模型代理)、有工具(推理服务、KV Cache优化、模型路由)、有服务(负载均衡、多活容灾、监控报表),最后统一用Token来标价。
把它拆成三层来看:最底层是异构算力池,自有算力、云上弹性算力、合作用户的闲散算力,只要能接入调度系统,全部汇成资源池;中间层是推理引擎层,vLLM、TensorRT-LLM、SGLang这些框架负责把裸算力变成高效的模型服务能力;最上层是运营层,包括计量计费、客户控制台、配额管理、账单系统。前两层决定成本,第三层决定毛利和客户粘性。
房地产行业有一句话叫“地段,地段,地段”,算力运营行业可以套用成“调度,调度,调度”。同样一张GPU卡,调度得好,利用率能到70%以上;调度得稀烂,可能30%都不到。运营商之间的毛利差异,一半靠资源采购价,另一半就靠这套运营能力。谁能把一个请求塞进最合适的GPU、在低峰期接更多离线任务、通过KV Cache复用挤出更多并发,谁就能把单Token成本压到同行的六成。
3.2 收入与成本结构拆解
从财务模型看,Token算力运营商的收入公式很简洁:收入 = Token用量 × 单价。但毛利率的推导就复杂得多,成本端至少包括:算力资产折旧或上游租金、电力、网络带宽、推理集群工程人员薪资、平台研发摊销、销售与客服成本。这里面算力成本和电力是大头,占70%到80%很正常。
用一个简化的例子跑一遍:假设平台接入了一批GPU,单卡每小时总成本(含折旧+电费+机房)折算下来是30块钱。一张卡跑主流开源模型,通过动态批处理,一小时实际能产出的Token量大概在300万到600万之间,具体看模型大小和请求长度。按单Token售价约0.1元每万Token来算,一小时产出收入就是30到60元。这么一看毛利不算高,要想活得舒服,必须把Token单价卖出溢价,或者在资源利用率上做得比别人聪明得多。这也是为什么很多做算力运营的团队,都会强调“帮你省Token”和“帮你提并发”是同一件事——把客户的单请求成本降下来,客户才会放大用量,总量利润才能做上去。
这里还有一个经常被忽略的点:Token算力运营商的经营杠杆。自建GPU的折旧是固定成本,如果客户不用量,成本也摆在那里;如果客户突然爆发,又得临时高价加机器。成熟运营商的解法是“自有算力保底+公共云弹性扩容”,把固定成本和可变成本的比例控制在三比七或者四比六,这样无论在需求淡季还是旺季,账本都能稳得住。
3.3 为什么是硬蛋创新
聊完通用模型,再回到标题里这家公司。我个人的理解是,硬蛋创新提出向“Token算力运营商”进化,其实是在做一次顺理成章的产业链延伸,而不是跨行。它过去在芯片供应链里积累的东西,大概有三块可以直接迁移过来。
第一块是上游资源连接能力。芯片供应链生意常年和原厂、代理商、下游整机厂打交道,对芯片生态的理解和对硬件厂商触达是目前少数具备“算力+硬件”双重基因的企业。第二块是硬件开发者生态。硬蛋平台沉淀了大量做智能硬件的团队,这些人做AI玩具、AI眼镜、AI边缘设备,个个都需要模型推理能力且对成本敏感,按Token计费的低门槛接入对他们非常友好。第三块是服务中小客户的经验。给大客户做服务可以一对一定制,给中小客户做服务必须产品化、标准化。Token计费本身就是标准化的最好载体,不需要销售去解释什么是并行计算,只需要告诉客户“充100块可以跑XX万Token”。
当然,从芯片供应链到算力运营商,中间还隔着推理优化、运维体系、计费系统这几道坎。能不能跨过去,取决于硬蛋创新接下来在技术和团队上的投入力度。但从大方向看,这个转型路径比很多“纯故事型”蹭AI的行为扎实得多——它至少是在原有客户基本盘之上做增量生意。
4. 实操:中小团队如何用Token算清自己的算力账
4.1 五步评估法:从业务量到Token成本
前阵子有个做AI心理咨询的团队找我看成本,他们拿到的模型API账单已经连续三个月超预算,但业务量没怎么涨。我让他们按下面这套逻辑重新过了一遍需求,效果很明显。这套评估法,适用于任何一个准备接入Token计费模型的团队。
第一步,摸清调用画像。不要只盯总账单,要拉出每天多少个请求、每个请求平均输入Token多少、输出Token多少、有没有明显的波峰波谷。一般云控制台都有这类统计,没有的话自己埋点统计,方式见4.2。第二步,选定模型规格。同样一个任务,7B小模型未必不行,70B大模型未必有必要。优先做小模型验证,不满足效果再升级。第三步,小流量实测单位成本。用一个固定测试集,覆盖你的典型请求,算一次推广后每个人工会话的Token成本。第四步,折算业务成本。把Token成本除以这个AI功能带来的有效收入或节省的人力成本,算出来就是“单次智能调用”的真实ROI。第五步,预留增长系数。业务上线后调用量一定会涨,按1.5到2倍做预算余量,避免账单爆掉时手忙脚乱。
拿那个心理咨询项目举例,他们平均每次会话要跑大概30轮对话,每轮输入1200 Token、输出400 Token。按某模型API价格折算,单次会话的模型成本大约是六毛钱。如果这个产品做一单付费咨询收费几十块钱,模型成本占比不超过3%,这个生意完全成立;如果模型成本长期超过收入的10%,那就要么砍对话轮数,要么换更便宜的模型。这套账算明白之后,团队再也没拍脑袋定功能了。
4.2 自己服务上怎么统计Token
如果你用各家商业API,Token统计一般控制台都会给;但如果你自建推理服务或者走了多模型网关,就需要自己在日志里埋Token计量。我在这里给一个最直接的办法:使用模型的tokenizer对输入的prompt和输出内容分别计算token数量,落地到日志。
如果你用的是OpenAI系的模型,可以用tiktoken这个库来统计:
import tiktoken enc = tiktoken.get_encoding("cl100k_base") prompt = "这是一段系统提示词" completion = "模型生成的结果" prompt_tokens = len(enc.encode(prompt)) completion_tokens = len(enc.encode(completion)) print(f"input tokens: {prompt_tokens}, output tokens: {completion_tokens}")如果你用的是vLLM这类自部署框架,更简单。它的请求日志里会直接打出来prompt_tokens和completion_tokens两个字段,在启动参数里加上日志相关配置,再把这些字段采集到监控系统里就行。有了Token级别的日志,你才能回答“哪个用户把我吃穷了”“哪个场景用量异常”这类问题。否则账单来了,你连是哪条业务线烧的钱都说不清。
4.3 成本优化三板斧
Token成本的优化空间,很多人低估了。我实测下来最有效的三板斧,按见效速度排序如下。
第一板斧,Prompt缓存。很多模型服务商支持自动缓存,开启后,重复命中的系统提示词和公共上下文按极低价格甚至免费计算。把固定不变的System Prompt、企业知识库、常用工具说明抽出来,缓存命中率能做到百分之七八十,输入成本直接掉一个量级。第二板斧,output长度锁死。很多业务场景根本不需要模型长篇大论,给max_tokens设置上限、用结构化输出约束格式,输出Token能砍掉一半。客服机器人只要回复“订单号+当前状态+下一步操作”就够了,让它自由发挥写三百字小作文,那都是钱。第三板斧,模型路由。简单意图识别用小模型,复杂推理才上大模型,中间加一层路由。现在很多开源模型专做意图分类,性能和准确率已经很能打,把八成普通请求分流到小模型,整体成本能降一半还不止。
这三板斧在同一个项目里可以叠加。我见过最夸张的案例,优化前单次请求平均消耗18000 Token,优化后压到3000 Token,成本降幅接近80%,而且响应速度还更快了。
5. 影响范围:谁在这轮商业模式迁移中受益,谁难受
5.1 云厂商与IDC:从资源贩子到服务贩子
Token计费从API厂商蔓延到整个算力市场,最先感受到压力的是传统云厂商和IDC。以前它们的生意是把服务器、带宽、电费打包成产品卖出去,利润来源是资源差价。但当客户开始按Token付费,客户就不再关心你机器背后是什么——只关心一个Token多少钱、服务稳不稳。这迫使云厂商必须从“资源贩子”往“服务贩子”迁移,要么自建推理平台,要么和运营商深度绑定。
这件事对中小IDC来说尤其残忍。大云厂商好歹有自研推理引擎和庞大的SRE团队,中小IDC如果还停留在“租机柜、卖带宽”的层面,在Token商业模式里基本没有存在感。反过来看,那些能快速部署推理服务、对外开放Token计费接口的IDC,反而能把闲置算力变现。我认识一个做机房托管的朋友,前两年愁机房空置率,后来接入了一个算力运营平台,把自己的一批二手卡租给平台跑推理,机房反而热闹起来了。算力这台机器,容不下旁观者。
5.2 AI应用开发者:可变成本的双刃剑
对AI应用开发者来说,Token计费是双刃剑。好的一面是启动门槛大幅降低。以前做个AI产品,要么先花几十万买卡,要么跑通云厂商复杂的申请流程;现在充五百块钱就能做一轮功能验证,成本试错极其便宜。坏的一面是成本变得“无感”——它每次只扣几分钱,一个不小心就上万,但钱是怎么花的,用户比资本更清楚。很多团队做了两个月才发现模型成本能吃掉整个毛利,功能却已经上线了。
我经常提醒团队,Token计费模式下,你必须有“成本可视化”这个习惯。不只是看账单总额,还要看每个功能、每个用户、每个会话的成本分布。没有这层数据,你根本不知道什么功能该上、什么功能该下。换算成通俗的话:以前你租机房,房租多少是月初就定好的;现在按Token计费,相当于每月都在裸考,你的产品能不能赚回Token钱,每天都有答案。
5.3 Token口径不统一带来的工程坑
Token成为通用计量单位之后,新的坑也随之出现:不同模型的Token口径不统一。同一个问题,在模型A里可能算了150个Token,在模型B里只有110个,因为分词器算法不同。如果业务里同时接了好几个模型,这份账单就更难算清。
怎么解决?我的建议是“以模型为单位记账”。每个模型的Token消耗分开记录、分开对比,不要强行折算成一个统一数字。要对比模型成本,可以用“每千字符成本”做辅助指标,把Token数除以字符数,得到一个可横向比较的密度值。此外,对外给客户报价时,尽量锁定模型版本和Token口径,把“按Token计费”会带来的歧义在合同里写清楚。这个细节看似小,实际运营中能免掉九成的对账纠纷。
顺带提一个容易搞混的点:工程上常见的401认证报错“token_exchange_failed”,这里的Token指的是OAuth访问令牌,和AI推理计费的Token完全是两个概念。不少朋友刚开始对接开放平台时被这两个Token绕晕,其实只要记住一点——计费Token标记的是“智能生成量”,访问令牌标记的是“你是谁、有没有权限”,两者只在名字上撞了车。
6. 常见问题速查与避坑实录
6.1 高频问题速查表
我把在实际项目里反复遇到、以及各个社区高频讨论的问题整理成了一个速查表,希望能帮你少走一些弯路。
| 问题 | 可能原因 | 处理建议 |
|---|---|---|
| Token账单突然翻倍 | 输出未设上限、上下文重复堆叠、缓存未命中 | 检查单请求Token日志,逐轮对比消耗 |
| 输出Token上限被截断 | 模型max_tokens设置过小 | 调大max_tokens,或分批生成再拼接 |
| 同一个问题不同平台价格差异大 | Tokenizer不同、模型版本不同、是否含缓存 | 以字符数折算对比,锁定同等条件再比价 |
| 并发稍高就报错 | 推理端prefill/decode瓶颈、KV Cache不够 | 升级推理引擎、调大max_concurrency、加副本 |
| 多模型路由后成本对不上 | 各模型Token口径不一致 | 按模型拆分账单,用单位字符成本横向比较 |
| 中小团队要不要自建集群 | 月Token量低时自建成本远高于API | 月消耗不足亿级Token时,优先用API或运营平台 |
这里多说一句自建集群的判断标准。我一般建议,如果每个月的Token消耗量在两亿以下,自建推理集群大概率比买API贵;超过两亿,且业务持续增长、对延迟和数据有更高要求,再认真评估自建。很多人被“自建省钱”这句话忽悠,结果一算折旧、电费、运维人力,才发现月账单比API还贵。
6.2 怎么挑一个靠谱的算力运营平台
如果你所在的团队决定不自己折腾,选择接入第三方Token算力运营平台,那么选型时至少有四个细节值得认真看。
第一,看计费透明度。平台能不能提供Token级别的明细日志?还是只给一个汇总账单?能做到第一手的计费日志,基本说明它内部计量系统是自研的;拿不出日志的,很可能只是倒腾API的二道贩子。第二,看模型生态和调度能力。平台是只能接一家模型,还是能帮你做多模型路由?遇到单模型故障能不能自动切换?这些功能平时用不上,一用就是救命的。第三,看延迟SLA。Token计费不只影响账本,还影响体验。务必用真实业务场景做压力测试,盯着首Token延迟和平均生成速度两个数。第四,看私有化和合规选项。如果你的业务涉及敏感数据,平台是否提供私有化部署或不落盘方案,这个一定要在合同阶段确认清楚,别等到业务上线才发现不让过审。
还有一个小经验:一开始不要一次性充大额套餐。先用小额充值跑一个完整的上线周期,把账单结构和稳定性验证清楚了,再谈长期合约。算力运营商还在群雄逐鹿阶段,跑路的、缩水的不是没有,小额测试是对自己的保护。
写在最后的个人体会
我自己的判断是,算力账本从“卡数”到“Token数”的转变,本质上是AI价值计量方式的一次升级。以前我们为“拥有计算设备”付费,现在开始为“完成智能任务”付费,这是一个产业走向成熟的标志。Token算力运营商能不能普遍成立,最终看三件事:单位Token成本能不能持续下降,客户的Token用量能不能持续增长,平台能不能在这两者之间做出足够大的剪刀差。硬蛋创新走这条路的胜算有多大,现在下结论还太早,但它至少选了一个值得下注的方向。
如果你也是做应用、做平台的,我现在最实在的建议是:早点在自己的业务里建立Token计量能力,不管你是用商业API还是自建推理,都先把每一笔智能调用的成本看清楚。成本透明之后,很多决策会变得简单很多。算力账本正在被改写,别等账单把你打醒。