深度 | 推理引擎的「Red Hat 时刻」:英伟达AMD破天荒同投一家,开源免费午餐终结
这是一篇深度研究,不是新闻简报。基于 45+ 个来源的交叉验证。
证据等级:[A] 官方/一手 [B] 2+可靠来源 [C] 单一来源 [D] 个人判断
核心观点:2026 年上半年,两个核心开源推理引擎 vLLM、SGLang 各立山头——Inferact $1.5 亿种子轮、RadixArk $1 亿种子轮,英伟达、AMD、英特尔 CEO 罕见同投一家。这不是 License 闭源,是治理与人才的收编:开源没有被杀死,它被聘用了。
一、英伟达、AMD、英特尔 CEO,同框一张期权池
2026 年 5 月 5 日,一个几乎不可能的阵容出现:英伟达(NVentures)、AMD、联发科、Databricks 同投 SGLang 商业化公司 RadixArk 的 $1 亿种子轮,英特尔 CEO 陈立武与博通 CEO Hock Tan 以个人天使加入。[A]
四个互为对手的芯片巨头,把钱投进同一家"中立"软件公司。原因只有一个:推理引擎成了硬件之上的收费站,谁都不想被排除在外。这轮估值 $4 亿;加上 1 月官宣的 vLLM 商业实体 Inferact($1.5 亿种子、$8 亿估值),半年内两个最核心的开源推理引擎各立山头。[A]
8 月初中文媒体把两件事合写成一期「双子星」,很多人以为是"8 月 2 日同日官宣"——真实节奏是 1 月和 5 月,叙事被媒体统一收编了。[C]
这不是孤立事件。llama.cpp 作者 2 月全职加入 Hugging Face,英伟达 3 月开源推理编排层 Dynamo 1.0,Together/Fireworks/Modal 5-7 月合计融资 $26.5 亿。[B]推理引擎这个过去三年被当"免费公共品"的软件层,正在整体被资本化。本文回答三个问题:公司化在技术上意味着什么、谁在打谁、"开源免费午餐"是否真的终结了。
二、技术拆解:公司化改的不是 License,是治理
vLLM 与 SGLang 的竞争,本质是两种 KV Cache 复用哲学的对决。[A]
vLLM 靠 PagedAttention 起家:把 KV 缓存切成固定块,用操作系统式页表管理,解决显存碎片化,让批处理吞吐翻 2-4 倍;V1 引擎用无阶段调度器统一 prefill/decode,官方称比 V0 快约 1.7 倍。到今天它是生产环境的默认选择,GitHub 约 8.5 万星。[A]
SGLang 的 RadixAttention 走另一条路:把 KV 缓存建成基数树,自动复用最长公共前缀。在多轮对话、RAG、Agent 工具调用这类"前缀高度重复"的工作负载里,缓存命中率 52-74%,吞吐可达 vLLM 的 3-6 倍;还最早把 prefill/decode 物理拆分做进开源引擎。[A]
上图:2026 推理栈的四层结构——硬件、引擎、控制面、服务层,公司化发生在引擎层
RadixArk 卖的不是"更快的引擎",是GPU 利用率。CMU 实测 756 块 GPU 约 20% 的执行时间耗在等待,推理场景浪费更夸张——Azure Code 65%、OpenAI Chat 52%;行业平均 GPU 利用率只有约 5%。一个 $4 百万的 GB200 机架在 50% 利用率下,等于每年烧掉 $2 百万。[B] 这正是公司化的盈利点:模型越便宜,把利用率从 5% 抬到 40% 就越值钱。
反直觉的是,两家公司都没改 License,vLLM 和 SGLang 至今 Apache 2.0。公司化是人才与服务的收编,不是代码闭源。真正的变化在治理:vLLM 进了 PyTorch 基金会、有中立理事会,但核心维护者多数受雇 Inferact;SGLang 核心团队整建制进 RadixArk,没有独立基金会兜底。这是治理不对称。[D]
三、竞争格局:三种生意,一个新护城河
| 玩家 | 引擎 | 融资/估值 | 时间 | 关键信号 |
|---|---|---|---|---|
| Inferact | vLLM(开源) | $1.5 亿种子 / $8 亿 | 2026-01-22 | a16z+Lightspeed 领投 |
| RadixArk | SGLang+Miles(开源) | $1 亿种子 / $4 亿 | 2026-05-05 | 英伟达+AMD+联发科+英特尔 CEO 天使 |
| NVIDIA | Dynamo+TRT-LLM | R&D | Dynamo 3/16 GA | 编排层「推理OS」,7x Blackwell |
| llama.cpp | 本地/边缘(MIT) | 无公司 | 作者 2/20 入 HF | 纯开源无商业实体 |
| Together AI | ATLAS+开源引擎 | $8 亿 C 轮 / $83 亿 | 2026-07-01 | 推理云,$11.5 亿预订额 |
| Fireworks | 自研+开源引擎 | $15 亿 D 轮 / $175 亿 | 2026-07 | ARR $10 亿+ |
芯片厂的动机各异但同向。英伟达要主导引擎与自家硬件对齐、最大化 H100/B200 利用,同一季度还投了 Fireworks 和 Together;AMD的动机最致命——ROCm 需要绕开 CUDA 的通道,没有 SGLang 这种硬件中立引擎,MI300 系没有入口;英特尔要替 Gaudi 找一条正式出路。[B]
上图:从社区项目到商业公司的关键节点——真正的分水岭在 2026 年 1-5 月
表面都是"公司化",内里三种生意:云厂商把引擎当获客成本、回本靠托管消耗;NVIDIA 的 Dynamo 是软硬一体的控制面卡位;RadixArk/Inferact 是 Red Hat 式的"开源核心+企业服务"。Red Hat 自己 5 月把 AI 3.4 建在 vLLM 上,放话"模型厂商发模型之前要先 build to vLLM"——这个比喻既是被动修辞,也是主动战略。[B]
上图:资金、开源与控制的三角关系——芯片厂投资中立层,NVIDIA 用 Dynamo 抢占控制面
推理云是被夹击的一方:一边被引擎公司亲自卖 managed 威胁,一边被 DeepSeek 价格战压毛利。但 5-7 月的融资潮说明资本仍在押注其"分发渠道"价值。[B]
四、落地与生态:免费午餐,被价格战量化
采用信号很强:vLLM 约 8.5 万星,SGLang 号称部署在 40 万+ GPU 上、每天处理数万亿 token,TGI 3 月 21 日归档后 Hugging Face 默认切到 vLLM。[A]
但有个诚实的提醒:简报里流传的"vLLM 45% / SGLang 17% / TRT-LLM 25%“份额,没有任何调查能证实,是方向正确的定性推断。技术媒体更常用的表述是"vLLM 是 80% 团队的安全默认,SGLang 是增长最快的挑战者”。[C]
价格战把"引擎效率"变成了美元。DeepSeek V4-Flash 7 月 31 日上线,把成本会计从"每百万 token"改写成"每完成一个任务":一个标准基准任务约 $0.03,比 Claude Fable 5 的 $3.15 便宜约 105 倍。OpenAI 被迫 7 月 30 日把 Luna 输出价砍 80%。同期 OpenRouter 数据显示中国模型占全球 token 调用 63.5%(28 天到 7/26),DeepSeek 单日 8 万亿 token。[B]
这跟公司化是同一枚硬币的两面:每 token 利润趋近于零时,谁能把 GPU 利用率提上去、把前缀缓存命中率从 20% 抬到 80%,谁就握住 $/任务 的定价权。
社区的总体情绪是"谨慎接受"。质疑集中在三点:会不会走"开源核心变闭源核心"的老路、企业功能会不会被门槛化、商业化后两家不再互相公布基准。但也有人指出这是可持续的唯一路径——免费引擎+付费托管,比纯白嫖的维护者枯竭健康。中国的态度更微妙:知乎主流判断是"大基建下的必然",但硅基流动 8 月 5 日港股招股书被扒出毛利率 -24%、公有云毛利率 -119%,"Token 工厂第一股"沦为"算力二房东"的警示样本。[B]
五、战略含义:谁在赢,谁在裸泳
纯软件推理速度不再是护城河。开源 day-0 就能吸收任何厂商优化,"更快的引擎"只是生存底线;价值向上(硬件所有者)和向下(平台/应用集成商)转移,独立"快引擎"创业公司会走进死胡同。[C]
硬件厂商是短期赢家,长期被侵蚀。英伟达的 Dynamo 抓住了控制面,但引擎公司化本身就在削弱 CUDA 锁定——中立引擎给了 AMD/Intel/ASIC 公平入口。英伟达是在"用开源对冲开源"。[D]
推理云进入并购与被夹击并存期。引擎公司的 managed 产品是推理云的直接竞品,但推理云又是引擎的分发渠道——结局大概率是收购或深度绑定,不是零和。[D]
中国走双轨,不用站队。信创场景用华为 MindIE/昇腾自研栈(数据不出域),开源场景把摩尔线程 MUSA、沐曦 MXMACA 合入 vLLM/SGLang 主线。因为核心是 Apache 2.0,fork 自由,RadixArk/Inferact 的托管生意在中国市场几乎收不到租。[B]
上图:中国推理栈双轨策略——信创走 MindIE,开源走上游合入
- 用户是短期赢家。开源保持免费、引擎效率还在爬坡,未来 12-24 个月推理成本大概率继续下探。风险在长期:治理漂移和"免费开源变成引流漏斗"。[D]
六、我的评估
先下结论:推理引擎的公司化是真的结构趋势,不是泡沫;但有局部泡沫,集中在没有技术护城河的中间层。半年 $2.5 亿种子轮投给两个"已部署在 40 万 GPU 上的引擎",背后是真实的 token 需求和真实的 GPU 浪费——CMU 那个 65% 推理空转的数据,才是这轮融资的锚。[B]
我判断未来 12 个月有三个观察点:第一,Inferact/RadixArk 的托管产品定价是否开始"割裂"开源社区——一旦出现"开源版功能落后企业版两代",公司化的信任就会崩盘;第二,Dynamo 会不会成为事实上的推理控制面标准——如果 AWS/Azure 都默认 Dynamo 编排,引擎公司就永远是"内核供应商";第三,中国市场会不会出现真正的 fork 分支。[D]
我原以为"免费午餐终结"会以 License 大戏收场(像当年 Redis/Elastic),研究完才发现这轮公司化没改 License,改的是治理和人才。这是更隐蔽的收编:代码开放如故,但路线图的话语权、基准测试的中立性、核心维护者的钱包,都悄悄换了主人。开源没有被杀死,它被聘用了。[D]
被打脸的风险同样真实:如果 Dynamo 真的通吃控制面,RadixArk/Inferact 会缩水成"给英伟达打工的工程团队";反过来如果托管需求爆发,$250M 种子只是开头。目前最确定的,是"引擎层"这个过去免费的中立地带,已经变成资本和芯片巨头争夺的战场——免费午餐不一定结束,但菜单已经换了。[D]
参考来源
- RadixArk 官宣 $100M 种子轮(Businesswire, 2026-05-05)
- Inferact $150M 种子轮(TechCrunch, 2026-01-22)
- NVIDIA Dynamo 1.0 生产就绪(NVIDIA 官方)
- vLLM V1 引擎架构(vLLM 官方博客)
- SGLang / RadixAttention(NeurIPS 2024, arXiv:2312.07104)
- 机器之心:SGLang 团队创立 RadixArk(2026-05-08)
- 36氪:「榨」出硅的极限,GPU 利用率危机
- DeepSeek V4-Flash 105 倍价差(EDGEN)
- 硅基流动港股 IPO:负毛利质疑(创业邦)
- 知乎:如何看 vLLM 和 SGLang 团队纷纷创业
- 摩尔线程 MUSA 合入 vLLM/SGLang 主线(Yesky/WAIC)
- Together AI $800M @ $83 亿(Wedbush/businesswire)
AI 辅助深度研究,人工视角解读。每日更新。