你花大价钱买了最先进的AI模型,却发现它只能帮你完成20%的工作,剩下80%还得靠人工反复校验——这不是你的问题,是商业模式的问题。
当AI只能完成20%的工作时
几天前,某企业技术负责人在内部复盘会上甩出一组数据:他们团队每月在GPT-4级别的API调用上花费超过8万美元,但最终人工介入修改的比例是76%。「我们以为买了最好的模型就能解决问题,结果发现最贵的不是模型费用,是工程师盯着输出结果重新写prompt的时间。」
这就是硅谷投资人Tomasz Tunguz在最近一篇长文里描述的核心矛盾。
一、最前沿的AI,正在变成「俱乐部制」
Tunguz的职位是Theory Ventures普通合伙人,曾在Redpoint Ventures任职15年,投过Looker、Kustomer等明星项目。他最近的分析框架之所以引发关注,是因为他的观察点不再停留在「哪个模型更强」,而是转向了「谁在用这些模型、用什么条件在用」。
实验室建白名单,切断竞争对手
2026年6月,Salesforce宣布以36亿美元收购Fin(前身为Intercom AI团队)。同周,Tunguz在X平台上发文指出,前沿AI市场正在从「按token计费的公用事业」转变为「封闭的俱乐部制」。Lab本身开始建立白名单与黑名单,最强模型的访问权不再是对所有企业开放的。
这种变化的直接体现是:OpenAI、Anthropic、Google DeepMind等实验室纷纷推出分层访问协议,头部客户(如Microsoft、Meta、Salesforce)获得的是优先调用权、更高配额和定制化微调服务,而中小企业只能拿到受限版的API。
实验室正在分配访问权
更准确地说,这是基础设施投资回报逻辑在倒逼商业模式重构。Tunguz引用的数据显示,今年大规模科技公司的数据中心支出将成为人类历史上第五大基础设施项目——仅次于铁路和两次世界大战。但这些投资的投入产出比并不直观:每从AI里赚1美元,就要先砸下12美元做基础设施。
也就是说,前沿模型的「护城河」正在从参数规模转向访问控制。你买的旗舰款,瞬间变成平替套餐。
访问权取代价格,成为新稀缺
Anthropic在每个工程师身上,算力支出已经是工程师薪酬的2.3倍。来自Tunguz团队的数据:Anthropic的算力支出达到每位工程师每年51.5万美元,而工程师的全薪(含福利)约为22.4万美元。这个数字是中位数软件公司的37倍。
这意味着什么?前沿AI研发的成本结构已经和普通软件公司完全不在一个量级。当算力成本的压力持续推动模型效率提升时,驱动因素不只是市场需要,更是财务报表需要。
对于企业而言,这带来了一个结构性变化:获取顶级模型访问权的成本,可能远高于你为这个访问权节省的人力成本。如果你是为了「用最好的模型」而付溢价,这个决策在大多数场景下是错的。
二、「中间地带」到底在烧什么钱
Tunguz文章中反复出现的关键词是「the messy middle」(混乱的中间地带)。这不是指技术水平的中间,而是指工作流中模型和人类交互的那段模糊区域。
模型价格是小头,等待时间是真金
「模型价格是小头,真正烧钱的是每一步人工重新检查的等待时间。」这是Tunguz原话,也是整篇文章最被引用的判断之一。
等待模型输出时的真实成本
让我们拆解这个机制。假设一个企业用AI辅助撰写销售邮件:模型输出了第一版草稿,销售VP需要逐条检查事实准确性、语气是否符合品牌调性、是否有合规风险。这个过程平均耗时20分钟。如果每天产生50封邮件,等待时间就是16.7小时/天,相当于一个全职员工。
模型本身的调用成本可能是2美元/天,但等待时间是8000美元/年的隐性成本。
更狠的是,这种等待不是静态的。随着业务复杂度上升,每次修改的等待时间呈指数增长——因为你不仅要改AI的输出,还要验证修改是否引入了新的错误。
真正值钱的是workflow深度和切换成本
这才是Tunguz框架的核心:企业AI化的竞争壁垒,不在模型本身,而在于workflow的「深度」和「切换成本」。
workflow深度指的是什么?是你把AI嵌入到业务流程的哪个环节,以及嵌入的粒度有多细。一个简单的RAG问答系统,和一套能自动提取证据、生成假设、执行校验、最终输出的完整Agent pipeline,两者之间的差距不是模型质量的差距,是工作流设计的差距。
切换成本则是这个问题的另一面:当你把workflow设计到足够深,企业切换到另一个AI供应商的代价是什么?答案是:很高。因为你的数据管道、反馈循环、eval体系、业务规则都已经绑定在当前的实现上。
Workflow深度才是真正的护城河
Salesforce收购Fin的逻辑就在这里。Fin的AI Agent能自主处理76%的客服工单,依托开源模型实现性价比最优。但Fin的真正价值不是模型能力,而是他们已经为Salesforce生态设计好的客服workflow——这个workflow包含了工单分类、证据检索、回复生成、合规校验、人工接管触发等十几个环节的深度耦合。
三、从数据栈到AI栈:基础设施的重构
Tunguz最近在X上发了一条值得注意的判断:「AI breaks the data stack。」
AI打破了十年建起来的数据架构
绝大多数企业过去十年在数据栈上投入巨大:ETL管道把数据从源头抽取到数据仓库,转换层清洗数据供分析使用,BI工具把洞察呈现给用户。这套架构在传统analytics场景下运转良好。
但AI的需求完全不同。Tunguz举了一个例子:一个客户在ATM取钱,他的手机AI agent需要实时理解他的消费行为、账户余额、历史交易模式,才能给出合理的建议。这种场景需要的不是「今天的报表」,而是「实时的embedding和上下文检索」。
传统数据栈 VS AI需求
数据栈与AI栈的架构差异
这两套架构的差异在于:传统数据栈是离线的、批量的、单向流动的;AI栈需要实时的、连续的、带反馈循环的。当企业试图把AI强行接入旧的data stack时,你会发现「延迟」、「上下文缺失」、「反馈难以回传」成为三个核心瓶颈。
实时反馈循环取代离线ETL
Tunguz提出,AI时代的数据基础设施应该从「ETL pipeline」转向「feedback loop pipeline」。这里的关键词是「continuous」——数据不需要等到明天早晨的报表,agent在执行过程中就需要实时获取上下文、修正推理路径、记录交互痕迹用于后续优化。
这解释了为什么Dropzone(被Theory Ventures投资的Security AI公司)选择自建实时数据管道而非复用客户现有的data warehouse:因为安全运营需要分钟级甚至秒级的上下文更新,而传统的日级batch update完全无法满足这个节奏。
从离线报表到实时反馈
这也意味着企业架构师需要在「复用现有数据资产」和「重建适合AI的数据流」之间做出取舍。答案通常是:两者都要,但优先级不同。
四、企业如何在这个市场定位自己
回到开头的场景:你买了最先进的模型,但只能帮你完成20%的工作。问题出在哪?Tunguz给出了一个三分法。
三项难关:选对模型、爬坡循环、真实场景评估
第一关:选对模型。这不是指「选最强的模型」,而是「选最适合当前workflow的模型」。一个复杂的多步推理任务,可能需要Claude-Opus级别的上下文理解和逻辑能力;而一个简单的事实提取任务,GPT-4o-mini可能完全够用,且成本只有前者的十分之一。
第二关:设计能让系统持续进化的「爬坡循环」。这不是技术问题,是组织问题。你的团队是否有机制收集模型输出错误、归因原因、更新prompt或rag材料、重新部署?如果没有这个闭环,你的AI系统会在三个月内停滞。
第三关:在真实场景中评估系统表现。benchmark得分再高,也不如100个真实用户的一周反馈。企业常见的错误是把eval当成一次性验收,而不是持续监控体系。
三项难关不是选择题
可执行判断:什么条件下自建,什么条件下外包
Tunguz在分析中明确指向一个结论:多数企业既没有意愿、也没有必要为每套内部业务软件单独配备AI团队。这类精细工作更适合交由少数专业厂商完成,以实现每一美元的最大智能产出,并将成本分摊到更广泛的用户群体中。
具体判断如下:
- 如果你的核心业务流程高度差异化,且AI接入深度影响客户体验(如Fin的客服agent),建议自建或深度合作专业厂商。
- 如果你的AI需求主要限于内部知识检索、文档生成、数据分析等通用场景,直接使用主流SaaS AI产品即可,无需自建pipeline。
- 无论你选择哪条路,都必须建立「反馈循环」机制——无论是自建还是购买,你的团队需要有能力监控模型输出质量、归因错误来源、迭代改进。
Tunguz的完整判断可以用一句话总结:AI竞赛的瓶颈已从模型能力转向电力、芯片与推理成本,真正值钱的是workflow深度和切换成本,而非模型访问权限。能跨越「选对模型、设计爬坡循环、在真实场景中跑通」三项难关的企业,才正在进入AI应用的黄金时代。
二、真正的利润池:中间地带的「messy middle」
按token计费只是冰山一角
当模型价格快速下降,很多企业会发现一个尴尬的事实:最贵的往往不是模型调用本身,而是围绕模型建立的整个workflow。
以一个典型的企业客服场景为例。一个工单进来后,AI需要理解意图、查询知识库、生成回复、再由人工审核。每完成一步,系统都要停下来等人工确认。这一步等待时间,才是真正的成本黑洞。
假设每个工单平均需要人工复核10分钟,每天处理1000个工单,就是100小时的人工成本。即便模型本身每次调用只花几毛钱,这个等待时间也会迅速吃掉所有节省下来的钱。
大头是人等待重新检查的时间成本
这就是为什么Tomasz Tunguz提出「中间地带」的概念。真正值钱的地方,不是模型本身,而是那些能让系统持续信任AI、减少人工干预的workflow设计。
这类场景的共同特征是:
- 每步输出都需要人工验证,但验证标准明确
- 上下文较长,需要跨多轮对话保持连贯
- 业务规则复杂,无法完全依赖通用模型
在这种情况下,模型价格差异微不足道。真正拉开差距的,是谁能设计出更短的验证循环、更智能的错误恢复机制、更流畅的人机协作界面。
AI Workflow的真实成本结构
一个典型的workflow里,模型调用只占总成本的10%到20%,剩下的大部分时间都花在等待人工确认、理解产出、以及重新校准上。这才是「中间地带」真正烧钱的地方。
能在这种场景下把模型输出质量从70%提升到99%的企业,依靠的不是更好的通用模型,而是对特定场景的深度理解、持续的评估迭代、以及在真实业务中的持续优化。
三、什么才是真正的护城河?
Workflow深度 > 模型访问权限
2026年6月,Salesforce以36亿美元收购Fin(前Intercom),这是一个标志性事件。Fin的AI Agent能自主处理76%的客服工单,依托开源模型实现性价比最优。
「我们正在进入AI应用的黄金时代。」Tunguz在收购案后发文。
这组数字背后的逻辑是:将AI系统从通用跑分70%调到生产可用的99%以上,依靠的不是更好的通用模型,而是对特定场景的深度理解、持续的反馈循环。
\
构建AI应用需要跨越三项难关:
- 选对模型——不是最新最好的,而是最适合业务场景的
- 设计能让系统持续进化的「爬坡循环」——包括eval机制、反馈闭环
- 在每家企业的真实场景中评估系统表现——没有标准答案,只有边界条件
多数企业既没有意愿、也没有必要为每套内部业务软件单独配备AI团队。这类精细工作「更适合交由少数专业厂商完成,以实现每一美元的最大智能产出,并将成本分摊到更广泛的用户群体中」。
切换成本和信任壁垒
企业尝试AI
这个流程揭示了一个残酷现实:那些以「我们用最好的模型」作为差异化的公司,正面临真正的危机。一旦更便宜的模型能在特定workflow中达到同等效果,用户的忠诚转移几乎是零摩擦的。
「一旦模型层的价格压缩速度超过大多数产品路线图的速度,这就是一个真正的问题。」
真正的护城河,不是你能拿到哪个模型的访问权,而是你为这个业务场景积累的workflow深度——包括历史数据、领域知识、评估体系、反馈循环。
为什么「我们用最好的模型」不再成立
\
2026年,当Anthropic的算力支出已经是工程师薪酬的2.3倍时,继续追求「最顶尖模型」可能是一个战略失误。
Tunguz的框架给出了三个关键洞察:
第一,中间地带的竞争不在模型层,而在workflow层。那些能「在真实场景中跑通」的企业,建立的护城河是不可复制的——因为每一个workflow都是针对特定业务场景定制的,包含了大量隐性知识。
第二,切换成本来自信任积累,而非技术锁定。用户不会因为你用了GPT-4就离开,但会因为你的系统已经深度嵌入他们的日常操作、经过了数百次的调优和验证,而难以迁移。
第三,「最贵」不等于「最值」。一个能在特定场景达到99%准确率、只需极少人工校验的模型,远比一个通用跑分第一但需要大量人工干预的模型更有商业价值。
五、回到资本逻辑:赚1块烧12块之后
数据中心支出将成为人类第五大基础设施
今年大规模科技公司的数据中心支出,将成为人类历史上第五大基础设施项目——仅次于铁路和两次世界大战。更惊人的是投入产出比:每从AI里赚1美元,要先砸下12美元做基础设施。
Anthropic的数据最有代表性。每个工程师身上,算力支出已达51.5万美元每年,而工程师全薪(含福利)约22.4万美元。雇一个人的钱,还没有给这个人用的算力贵。对比标普500里顶尖1%的软件公司,人均算力支出是8.9万美元,中位数只有1.37万美元。Anthropic的数字是中位数的37倍。
这意味着什么?前沿AI研发的成本结构和普通软件公司完全不在一个量级。算力成本的压力会持续推动模型效率提升,不只是因为市场需要,而是因为财务报表需要。
到2030年,美国数据中心容量可能从25GW增长到70GW,全球建设成本约5万亿美元。这部分资本开支会占到美国GDP的5%到7%。AI竞赛的真正瓶颈已从模型能力转向电力、芯片与推理成本。
私募市场的投资方向正在改写
AI的价值链正在从模型层向上游的能源、芯片、数据中心,以及下游的应用层同时延伸。私募市场的投资方向也在从纯软件转向软硬一体。
Theory Ventures的布局反映了这一趋势。他们投了Dropzone(AI安全运营)、LanceDB(向量数据库)、Spot AI(AI可观测性),这些都是AI栈的中坚力量——不生产模型,但让模型能在企业里真正跑起来。
数据栈和AI栈正在彻底融合。过去十年企业花巨资搭建的ETL管道、数据仓库、BI工具,正在被实时嵌入、上下文检索、持续反馈循环重新定义。Datadog、Snowflake、MongoDB这些传统数据基础设施厂商,要么加速整合AI能力,要么面临被绕过的风险。
产品-市场匹配不再是一次性到达的终点,而是一个持续校准的过程。能跨越「选对模型、设计爬坡循环、在真实场景中跑通」三项难关的企业,才正在进入AI应用的黄金时代。
参考文献
- Tomasz Tunguz, “The Most Important Market in AI is the Middle”, LinkedIn, 2026 [https://www.linkedin.com/posts/tomasztunguz_the-most-important-market-in-ai-is-the-middle-activity-7508602769658826752-g2nZ]
- 火星财经, “分析:前沿AI市场正分化为封闭阵营”, 2026-09-01 [https://news.marsbit.co/flash/20260901123035760414.html]
- JX News, “Tonguz:前沿AI正在大分层,访问权取代价格成为新稀缺” [https://www.jxxy.net/ai/articles/ah-tunguz-frontier-ai-access-segmentation]
- 36氪, “硅谷知名AI投资人Tomasz Tunguz:AI公司赚1块烧12块” [https://m.36kr.com/p/3828092988805762]
- Xudong Han on X, 引用Tunguz数据:Anthropic算力支出与工程师薪酬对比 [https://x.com/xudong07452910/status/2072118991267471539?s=52]
- Tomasz Tunguz on X, “AI breaks the data stack” [https://x.com/ttunguz/status/1973853375751205281]
- 界面新闻, “硅谷顶级投资人:我们正在进入AI应用的黄金时代” [https://www.jiemian.com/article/14595184.html]
延伸入口
- 原文归档:https://tobemagic.github.io/ai-magician-blog/posts/2026/09/25/硅谷投资人说ai最赚钱的市场不在最顶尖而在中间地带/
- 公众号:计算机魔术师