贾扬清离开英伟达后的新动向
一个月前,有报道称贾扬清离开英伟达。当时外界猜测他大概率会回到 GPU 云领域,毕竟他过去几年一直在和算力调度、多云部署、GPU 利用率这些 Infra 问题打交道,从阿里云到 LeptonAI,再到英伟达 DGX Cloud 皆是如此。6 月初,GPU 云服务商 Hyperbolic 聘请他担任顾问,业务方向与 LeptonAI 的旧路线几乎无缝衔接。然而,真正的答案如今浮出水面,贾扬清联合 Junjie Bai、Xiang L.、Casber Wang 等开源领域老将,正式创立新公司 Intent Lab(意图实验室)。此次,他没有继续做 GPU 云平台,也不是简单重走 AI Infra 的老路,而是试图解决一个更上层的问题:当模型已经越来越会写代码,AI 离真正自主开发一套生产级软件,究竟还差在哪一步?
Intent Lab 的首批成果
伴随官宣一起亮相的,是 Intent Lab 的首批成果:一是一个 GLM - 5.2 推理引擎,在两台 Grace Blackwell 节点上,把输出速度从 102 tokens/s 提升到 647 tokens/s,提升 6.3 倍;二是一个数据库引擎,从一句模糊需求出发,最终跑通 600 万条 SQLite 兼容性测试;三是一个带形式化验证的分布式文件系统,能抓出普通 coding agent 生成代码里的数据损坏 bug。从推理引擎,到数据库,再到代理文件系统,看似没有承接联系,但实际上贾扬清想展示的是它们背后同一套系统 Fleet 的能力。贾扬清把 Fleet 定义为“全球第一个把意图变成生产级软件的自主团队”,即用户提出更高层目标,由一组智能体自己完成理解、设计、编码、验证和后续演进。这让贾扬清这次再创业有了更值得关注的行业意味。
AI Infra 的底层命题转变
过去十年,贾扬清做过 Caffe、ONNX、PyTorch 1.0,是上一代 AI 框架公认的奠基人,也在阿里和英伟达参与过大规模 AI 基础设施建设。到 LeptonAI,他试图降低开发者使用 GPU 和部署模型的门槛。而现在的 Intent Lab,则是让 AI 来直接构建具备交付能力的基础软件。这背后是 AI Infra 正在发生的一次价值重估。在上一篇报道中探讨过,降低开发者使用和管理 GPU 集群的门槛,在 2023 年或许值得花数亿美元去解决,但如今解法和门槛已经松动。以 Cursor、Claude Code、Codex 为代表的 Agentic Coding 工具正在重塑软件开发的底层逻辑,开发者可以用自然语言描述需求,AI Agent 会自动生成、调试、部署完整的基础设施代码。这意味着传统 AI Infra 试图用产品化方式封装的复杂性,正在被 Agentic Coding 用代码生成的方式直接绕过,那些只停留在“让工程更省事”的工具层平台,正面临被开源组件和 Agent 组合替代的系统性挑战,这也是 DGX Lepton 未达黄仁勋预期、开源承诺未兑现等问题的客观背景。所以,关于 AI Infra 层创业的核心拷问变成:解决的是表层的复杂性,还是底层的稀缺性?贾扬清用 Intent Lab 给出了答案,他表示更感兴趣的是“一次能产出一千个系统的系统”,这是他这次再创业的底层逻辑。
Intent Lab 的核心产品 Fleet
Intent Lab 的核心产品叫 Fleet,它不是一个更快的代码补全工具,也不是一个新的 IDE 插件,而是一套面向生产系统的自主智能体团队。如今大多数 coding agent 解决的是“代码生成”问题,但距离真实的软件工程还差很远,真实工程要经过理解需求、拆分目标、设计架构等一系列流程,上线后还要持续修正和演进。Intent Lab 想把这整条链路交给 AI,Fleet 要从一个粗糙的人类意图出发,端到端完成设计、实现和验证,并在生产环境里持续进化,它试图复刻一支靠谱工程团队的完整协作流程。这也是 Intent Lab 首批展示推理引擎、数据库和文件系统的原因,这些系统软件对性能、可靠性、兼容性和正确性要求极高。
Fleet 的能力展示
以 GLM - 5.2 推理引擎为例,最初给 Fleet 的目标是改造 TensorRT - LLM,让 GLM - 5.2 在 Grace Blackwell 节点上跑得更快,并自己识别优化空间、自己实现、自己验证。Fleet 要面对的是硬核系统优化,最终交付了四类优化:内核层优化,通过 kernel fusion 以及直接生成 PTX 和 SASS,让 Agent 绕过普通编译器路径,拿到更细粒度的指令级控制;运行时优化,通过 H2D batching,大幅减少稳定 decode 阶段里 CPU 到 GPU 的元数据拷贝,降低不必要的调度开销;通信优化,把 residual add 和 RMSNorm 折进融合后的 all - reduce 里,减少每层 kernel launch 和内存往返;投机解码优化,配合更好的 drafter,让模型一次提出多个 token,再由大模型批量验证,显著提高输出吞吐。最终 GLM - 5.2 的输出速度从 102 tokens/s 提升到 647 tokens/s,性能提升 6.3 倍。而且 Fleet 的工作方式像一个系统工程团队,先做瓶颈分析,再提出方案、实现方案、验证结果,失败就回退,成功后再继续寻找下一个瓶颈,更像自动化的系统工程循环 Looping。
数据库和文件系统案例体现的能力
如果说 GLM - 5.2 推理引擎展示的是性能优化能力,那么数据库和文件系统展示的就是复杂系统的正确性。Intent Lab 展示的第二个案例是一句话生成一个数据库引擎,并最终通过 600 万条 SQLite 兼容性测试。数据库要处理诸多复杂问题,很多 bug 在复杂情况下才会暴露,真正难的是让 Agent 把自己放进严格测试体系里不断修正,直到接近真实生产系统的要求。第三个案例是文件系统 AgentFS,专门为 AI Agent 设计的分布式文件系统,难点在于直接管理状态。传统方案不适合 Agent 的工作负载,Fleet 从零构建了 AgentFS,结果显示在基础操作和 Git 仓库操作上都有显著提升。更关键的是,Fleet 对核心协议做了约 190 万个状态的形式化验证,配合 300 个集成测试、故障注入和模糊测试,覆盖极端情况,还发现并修复了一个 coding agent 在分布式创建和删除文件时导致数据损坏的 bug。这说明 Fleet 的价值不只是“会写代码”,而是能围绕真实负载重新设计系统,并同时把性能和正确性做到可验证,这也是当下 Agentic Coding 最大的分界线。
AI Infra 的新分水岭
把贾扬清这几年的路径连起来,能发现他一直在降低别人用上算力和系统的门槛。Caffe 让深度学习走出实验室,PyTorch 让模型变成生产基础设施,Lepton AI 让 GPU 集群更好用,到了 Intent Lab,他试图让“造一个生产级系统”从手艺活变成自动化的东西。这意味着 AI Infra 的价值正在发生重估,过去 Infra 最值钱的是“资源和封装”,但 Agentic Coding 崛起后,一部分封装复杂性的价值正在被 AI 自己吃掉,真正稀缺的是让 AI 理解模糊意图、拆解架构设计、持续验证并发现隐藏 bug 的深层系统能力。简而言之,AI Infra 的竞争正在从“帮人管理基础设施”,转向“让 AI 成为基础设施的建造者”,贾扬清这次押注的正是后者,如果这个方向跑通,未来的软件形态可能会变得更碎片化、更专用。