模型没死,但已经不重要了
上周我干了件蠢事。
让三个AI Agent同时复现一篇ICML 2026的论文。OpenAI那个跑了一半告诉我额度用完了,账单20美元。DeepSeek那个花了2美分就跑完了,结果全是错的。还有一个开源的,跑是跑完了,结果也对,但中间断线了三次,每次得我手动重连。慢慢的我就想清楚了一个事儿,我们现在根本不是在比谁更聪明。
跑分时代已经过去了
GPT-5.6 Sol发布了,OpenAI说它同时管即时回答和深度推理,Plus和Pro用户能用,免费用户也能不限量地用Luna聊天。
你看,连OpenAI都不再强调“我比5.5强了多少分”了。
以前一个模型出来,大家第一件事是查MMLU、GSM-8K、HumanEval。现在呢?没人关心了。因为GPT-4级别的能力已经遍地都是,免费用户都能随便用。模型从“奢侈品”变成了“自来水”——谁家水龙头出水快、水流稳、不突然停水,才是关键。
OpenAI想明白了:与其让大家抢着用Pro,不如把基础版放开,把人留住,然后靠工具调用、生态绑定、响应速度赚钱。这跟Google当年把搜索做成免费的逻辑一模一样。
DeepSeek的尴尬
V4-Flash发布的时候,大家都觉得“国产之光又来炸场了”,价格低到离谱。结果没几天,平台说API要涨价,涨幅不小。
OpenCode团队有个人说了句大实话:他们拿租赁GPU算了一下,DeepSeek现在的定价自己也能做出来。涨价可能真不是成本问题,是服务被挤爆了,只能靠价格赶人。
这就是低价策略的代价。
你卖得越便宜,Agent调用得越疯狂——Coding Agent跑一次任务几十万Token,连续几十分钟不间断。你以为是好事?峰值流量一来,机房扛不住,调度崩了,用户全在骂。
价格战谁都会打,但价格打完了还能把服务稳住,那才是真本事。DeepSeek现在卡在中间:便宜是便宜了,但便宜带来的用户量,它接不住。涨价吧,口碑受损;不涨吧,服务瘫痪。这个问题比模型跑分难搞一百倍。
Google选了一条更聪明的路
Demis Hassabis去当董事长和首席科学家了,不管日常了。
很多人觉得这是“升职”,我倒觉得这是Google在Chat产品上认输了——反正追不上OpenAI和Anthropic,干脆让Demis去搞他真正擅长的东西:科学。
Google DeepMind一直以来的差异化,从来不是聊天聊得多好,而是AlphaFold、数学推理、药物研发。这些东西有明确的对错标准——蛋白质结构预测得准不准,实验能不能复现,结果是客观的,不需要用户打分。
WeatherNext就是个典型。气旋路径预测比原来多争取了24小时预警时间。
24小时是什么概念?你ChatGPT回答快一秒,用户感觉不出来。但气象预警多一天,可能意味着几千人的疏散、几亿的物资调动。这个价值不需要吹,算得出来。
而且Google还把代码和权重都开源了,让各国气象部门自己做本地化。这是在铺基础设施,不是在抢用户。
科研复现的那点事
再说回HuggingFace那个AI Agent复现论文的事。这件事被很多人解读为“AI要取代科学家了”。别扯了。
复现论文本质上是个体力活——配环境、调参数、跑代码、对结果。AI干这个确实在行,而且不会因为熬夜而崩溃。但真正难的是两件事:第一,这个方向值不值得研究?第二,结果怎么解释?这两件事AI现在还做不了。
所以AI Agent在科研里的真实角色,就是个超级实验员。人类提方向、定标准、解释意义,AI负责把那些重复劳动干掉。科研不会因此“自动化”,但迭代速度会快很多。这已经很了不起了。
值得怀疑的那些“大饼”
MatrAIx搞了个社会模拟,号称能覆盖83亿虚拟角色。83亿,听着就吓人。但你仔细想想就知道不可能——83亿个大模型Agent同时跑,全地球的算力加起来都不够。它更可能是个统计学抽样系统,按年龄、地区、职业生成一些虚拟样本,用来做政策推演或者消费行为研究。这个方向本身有价值,但千万别被“数字孪生地球”这类话术忽悠了。模型输出的东西来自训练数据,训练数据有偏见,出来的结果就是放大版的偏见。规模越大,看起来越精确,其实可能错得越离谱。NVIDIA的MotionBricks也是类似道理。35万段动作素材,能生成动画也能控制机器人,听着很酷。但它解决的是“基础动作怎么生成”,解决不了“这个动作符不符合角色性格”或者“物理上到底能不能站稳”。动画师和机器人专家不会失业,他们只是不用再调那些重复的骨骼绑定了。
最后说两句
每次AI有进展,你就会看到一堆夸张的标题。“100倍速度提升”“完全不需要反向传播”“83亿人社会模拟”。
别信。
去看原文,看它跟什么比的,测试条件是什么,代码开没开源,第三方复现过没有。这些话说出来很扫兴,但比记住一个跑分有用得多。