谷歌内部最核心的工程人员 Jeff Dean 从谷歌离开,新公司的方向锁定 AI4S。这个消息一出来,很多人的第一反应是:谷歌的地基少了一个人,AI 赛道多了一个新变量。
Jeff Dean 不是普通高管,他在过去二十年里直接参与了谷歌技术地基的建设。从 MapReduce 到 BigTable,从 TensorFlow 到大规模机器学习基础设施,谷歌能支撑亿级用户的搜索、广告、云服务,背后有相当一部分工程地基和他有关。现在他把下一站押在 AI4S 上,这个选择本身比“谁离开谷歌”更值得技术人认真拆解。
这篇文章不打算做新闻复述,而是从技术视角回答几个问题:Jeff Dean 过去的积累为什么和 AI4S 匹配?AI4S 的技术栈到底是什么?它现在落地的卡点在哪些环节?开发者如果想跟上这个方向,应该提前准备什么?
1. Jeff Dean 的标签:分布式系统、大规模计算、TensorFlow
要理解 Jeff Dean 为什么做 AI4S,先要看他过去在谷歌解决过哪些问题。
1.1 MapReduce:让分布式计算成为普通工具
在谷歌早期,网页索引、日志分析、网页排名都面临同一个问题:数据量超过单台机器能处理的上限。Jeff Dean 和同事提出 MapReduce,把分布式计算抽象成 Map 和 Reduce 两个阶段。
这个设计的意义不只是“并行处理”,而是让普通工程师不需要理解分布式系统的全部细节,就能写跑在几千台机器上的计算任务。后面 Hadoop、Spark 都受到这套思想的影响。放到今天看,MapReduce 是整个大数据生态的一个基础设施原点。
1.2 BigTable 与存储体系:大规模系统的底层骨架
搜索业务不只是计算,还要存储海量网页信息、用户数据和中间结果。BigTable 是谷歌早期的分布式键值存储系统,解决的是“海量结构化数据如何在大规模集群上可靠存储和高效读写”的问题。
这类系统积累的是“工程韧性”:数据分片、容错副本、一致性协议、热点问题、在线系统与离线系统之间的平衡。AI4S 场景同样需要这类基础能力,因为科学数据的规模和管理复杂度并不比互联网数据低多少。
1.3 TensorFlow:把深度学习变成可工程化的系统
Jeff Dean 团队推动 TensorFlow 的诞生,很大程度是因为当时的机器学习模型训练已经从单个 GPU 实验扩展到多机多卡,缺少一个统一的分布式训练和部署框架。
TensorFlow 解决的不只是“能不能训练”,而是“模型从研究到生产的全链路问题”:数据输入、模型定义、分布式训练、参数服务、模型导出、线上推理。这套系统化思路,在 AI4S 落地时依然成立——科学计算场景同样需要把“实验方法、数据管线、训练任务、模型验证”串成一体。
他做 AI4S,本质上是在延续同一个职业主线:解决复杂系统在规模变大之后的工程问题。
2. AI4S 到底解决什么问题
AI4S 是 AI for Science 的缩写,中文通常叫“AI 驱动科学发现”或“AI 科学计算”。它不是某个具体模型,而是一类方法和一套研究范式。
2.1 从已知信息中找规律,再生成可验证的假设
传统科研流程通常是这样:提出假设、设计实验、收集数据、统计分析、得出结论。这个过程慢,而且依赖研究者的直觉。
AI4S 改变的是这个流程中的某些环节:
- 用模型从大量历史数据里学习复杂关系;
- 用生成模型提出新的候选分子、候选材料、候选蛋白质序列;
- 用预测模型快速筛选高可能性实验方向;
- 用主动学习选择下一轮最值得做的实验。
换句话说,AI4S 不是替代实验,而是把实验从“逐项试错”变成“模型筛选后精准验证”。
2.2 和普通生成式 AI 的区别
普通生成式 AI 主要处理语言、图片、音频,面向的是互联网内容和办公辅助场景。AI4S 的目标是科学发现,对结果的要求完全不同:
- 普通问答可以接受“大致合理”的回答;
- 科学预测必须尽可能接近真实测量值;
- 普通生成可以有创造性;
- 科学生成需要满足物理、化学、生物的基本约束。
所以 AI4S 对模型的要求更高,也更强调“预测 + 验证”的闭环。
2.3 典型子领域
从公开研究和行业实践看,AI4S 主要集中在几个方向:
| 子领域 | 典型任务 | 代表思路 |
|---|---|---|
| 蛋白质结构预测 | 根据氨基酸序列预测三维结构 | AlphaFold 类型的深度模型 |
| 分子与材料设计 | 生成候选分子、新材料并预测性质 | 生成模型 + 物理约束 |
| 气象与气候建模 | 加速大气模拟、提高分辨率 | AI 与数值模式结合 |
| 基因组学 | 基因变异与疾病关联分析 | 大规模序列模型 |
| 化学合成 | 预测反应路径、推荐合成条件 | 图神经网络 + 知识图谱 |
| 数学辅助 | 定理发现、符号推导 | 大模型与符号推理结合 |
这些方向有个共同点:搜索空间巨大,传统方法要么算不动,要么试不完,AI 模型能在一定程度上做加速。
3. AI4S 技术栈拆解:数据、模型、实验三层
AI4S 的技术栈比普通 AI 应用多出一层“实验验证”,这是它最有价值也最难做的部分。
3.1 数据层:科学数据的收集、清洗与管理
互联网数据的特点是海量、多源、质量参差,但采集成本相对低。科学数据不一样,通常来自实验测量、仪器输出、文献资料或大规模模拟,采集成本高、标准不统一。
AI4S 的数据层要解决几个问题:
- 多源异构数据对齐,不同实验室或不同批次的数据可能采用不同标准;
- 标注成本高,很多科学数据需要专家人工标注;
- 数据版本管理,实验条件变化会影响数据分布;
- 私有数据与公开数据的隔离,很多科研机构的数据不能直接上传到云上。
数据工程在 AI4S 里的重要性被低估。没有高质量的训练数据,模型再好也出不了可靠结果。
3.2 模型层:几何结构、物理约束与基础模型
模型层是 AI4S 的核心技术环节。常用的模型方法包括:
- 图神经网络,用于分子图、晶体结构、化学反应网络;
- 等变神经网络,把旋转、平移等对称性内建到模型结构中,在分子和蛋白质场景中更稳定;
- 蛋白质语言模型,在大量蛋白质序列上做预训练,再微调解码或预测;
- 大规模生成模型,用于生成新分子、新材料候选。
模型层的关键不只是“准”,还包括“有依据”。很多科学模型会在训练时加入物理约束,避免预测结果违反基本规律。例如,预测分子能量时要求模型满足能量守恒关系,或者保证结果在一定误差范围内。
3.3 实验与验证层:闭环迭代
AI4S 和普通 AI 最大的区别在这一层。普通模型训练完,用测试集评估就够了。AI4S 的预测最终要回到真实实验。
一个典型的 AI4S 闭环长这样:
# AI4S 主动学习闭环示意 # 实际系统会更复杂,这里只说明核心流程 for round in range(max_rounds): model.train(training_pool) candidates = model.propose_candidates(top_k=64) scores = model.predict(candidates) selected = select_most_valuable(candidates, scores) measurements = run_lab_experiments(selected) training_pool.update(selected, measurements)这个循环的意义在于:模型每跑一轮都能从真实实验结果中学习,逐步缩小搜索空间。
实验验证可以有三种形态:
- 人工实验,研究者手动做实验验证模型预测;
- 半自动实验,机器人辅助完成部分加样、测量、记录;
- 自动化实验,系统自动调度设备和仪器完成验证。
现在很多研究喊 AI4S,实际只做到“模型预测出候选”,实验验证还停留在“实验室人工跑一批”。这是工程落差最大的地方。
4. Jeff Dean 为什么偏偏选 AI4S
从互联网基础设施工程师到 AI4S 创业者,跨度不小,但仔细看,能力结构是匹配的。
4.1 他擅长解决的不是算法问题,而是系统问题
AI4S 的难点不完全在模型精度,而在“模型怎么和实验系统连接”。实验室里的仪器、数据文件、流程管理,往往缺乏统一标准。要把 AI 引入实验流程,需要有人解决设备数据读取、任务编排、结果回收、版本追踪等问题。
这些是典型的系统工程师问题,也是 Jeff Dean 最擅长的问题。
4.2 AlphaFold 的成功带来了范式示范
AlphaFold 在蛋白质结构预测上证明了:AI 模型能从生物学序列直接预测高精度三维结构,效果可以接近实验测定。这一结果让科研界和技术投资界意识到,AI 不是只能用来做对话和画图,也能解决真实的科学问题。
之后的几年,AI 预测蛋白质结构、AI 设计抗体、AI 找电池材料等方向快速升温。这些方向需要的不只是算法团队,还需要能把预测能力产品化、平台化的工程团队。
4.3 算力和模型成本到了可以商业化的拐点
过去几年,大模型的训练和推理成本大幅下降,开源生态也成熟了很多。做 AI4S 的技术门槛不再是“能不能训练模型”,而是“怎么把模型嵌入科研流程,并让用户愿意付费”。
这与 Jeff Dean 做 TensorFlow 时的思路类似:当模型能力接近可用时,决定落地速度的是基础设施和工具链。
5. AI4S 落地绕不开的工程挑战
即使技术背景很强,AI4S 仍然有一堆工程问题要解决。
5.1 数据闭环很难真正打通
实验室数据通常保存在不同格式的表格、仪器文件、电子实验记录本里,字段定义不统一,单位不统一,命名不统一。做 AI4S 的第一件事往往不是建模,而是花大量时间整理数据。
如果没有打通“实验数据生成 → 数据标准化 → 模型训练 → 预测择优 → 实验验证 → 数据回流”的闭环,AI4S 就只是一堆预测模型的组合,价值有限。
5.2 混合算力调度比纯云任务复杂
AI4S 既需要 GPU 训练模型,也需要 CPU 做科学模拟,可能还要连接实验室仪器和专用设备。这些任务类型差异很大:训练任务吃 GPU,仿真任务有些是 CPU 密集,实验任务要求实时性。
一个完整的 AI4S 平台需要同时调度这些资源,还要考虑任务优先级和失败重试。这比普通互联网应用的服务编排复杂得多。
5.3 物理约束和不确定性估计
纯数据驱动模型很容易学到数据里的噪声或虚假关联。科研场景中,错误的预测结果会造成资源浪费,甚至误导实验方向。
所以 AI4S 模型需要做到两件事:
- 让预测结果符合物理、化学、生物规律;
- 提供预测的不确定性,让研究者知道哪些结果可信、哪些结果需要更多实验验证。
现在很多科研团队已经在用贝叶斯优化、集成模型、模型校准等方法处理不确定性问题,但这部分技术还没有变成便捷工具。
5.4 可复现性与审计
科研领域对可复现性要求极高。AI4S 项目需要记录清楚每次实验用了什么数据、什么模型版本、什么超参数、什么实验条件。数据版本、模型版本、代码版本、实验记录要能对应起来。
很多团队在这个环节用的是传统论文记录方式,工程化程度不够。这也是未来 AI4S 基础软件可以发力的位置。
6. 开发者现在可以做的技术准备
如果对 AI4S 有兴趣,不一定要等 Jeff Dean 的公司发布产品,现在就可以从几个方向着手准备。
6.1 熟悉科学数据的基本处理方式
建议先选一个具体的科学领域,比如分子性质预测、蛋白质稳定性优化、电池材料筛选,然后从公开数据集进入。掌握这些技术点:
- 图数据表示,分子图和晶体图怎么建;
- 化学描述符和指纹特征;
- 标准化、归一化、数据增强,科学数据的增强方法要和物理意义一致;
- 数据切分,按分子骨架或结构聚类切分,不能随机切。
6.2 掌握主动学习和贝叶斯优化
AI4S 很依赖实验效率优化,主动学习是核心方法。建议了解一个通用流程:在未标注数据上选择最不确定或有最大期望收益的样本,交给实验验证,再更新模型。
# 贝叶斯优化示意代码 from skopt import gp_minimize def optimize_experiment(params): # 这里接入真实实验或仿真器 return run_simulation(params) res = gp_minimize( optimize_experiment, dimensions=[(0.0, 1.0), (0.0, 1.0)], n_calls=20, random_state=42 ) print("建议实验参数:", res.x)6.3 搭建一套最小可复现的 AI4S 工程目录
科学实验的代码目录结构会影响协作效率。下面是一套通用目录组织方式,可按实际项目调整。
# 建议的 AI4S 项目目录结构 mkdir -p data/raw data/processed data/experiments \ models/checkpoints models/registry \ configs src tests notebooks outputs对应的配置文件可以这样写:
# configs/experiment.yaml 示例 project: name: protein_stability_optimization version: 0.1.0 data: raw_path: data/raw/lab_export.csv processed_path: data/processed/features.parquet split_method: scaffold_split model: encoder: graph_transformer pretrained: true batch_size: 32 epochs: 50 active_learning: top_k: 64 acquisition: expected_improvement max_rounds: 10 experiment: lab_platform: optional_robot_api retry: 3 output_dir: outputs/6.4 面向接口的思维
AI4S 要真正落地,软件形态大概率是“平台 + API + 工作流”。即使现在只做个人项目,也应该把模型封装成可调用的服务或 Python 包,而不是散落的 Notebook。
# 把预测模型封装为可调用接口的示意 def predict_properties(molecule_smiles: str) -> dict: features = featurize(molecule_smiles) prediction = model.predict(features) return { "smiles": molecule_smiles, "predicted_value": prediction, "uncertainty": compute_uncertainty(prediction) }这样后续接入自动化实验系统或者批量筛选流程会顺畅很多。
7. AI4S 的风险与不确定性
虽然方向值得关注,但也要客观看待风险。
7.1 实验验证环节是硬骨头
AI4S 的价值不止在于预测,更在于能否完成“实验验证”的闭环。这一步涉及硬件集成、实验室信息化、设备接口标准、操作流程重构,推进速度往往比软件迭代慢很多。
如果一家 AI4S 公司只提供预测模型,不打通实验闭环,产品的价值会受限。但打通实验,意味着进入重资产运营模式,投入周期长。
7.2 商业化周期长
科研市场不像消费互联网那样能快速放量。高校、研究所、药企、材料企业的采购决策周期长,对稳定性和合规性要求高。AI4S 公司需要同时具备科研理解力和企业服务能力,这对团队要求很高。
7.3 模型能力与真实价值的差异
AI 模型预测的准确性再高,也只是“建议”。最终落地要经过真实实验验证。如果模型预测与实验结果的差距不稳定,用户信任度会快速下降。
所以 AI4S 产品的核心竞争力不只是模型精度,还包括:预测置信度、失败率、实验反馈速度和迭代效率。这些需要长期打磨。
7.4 安全与合规边界
AI4S 涉及生物、化学、医药等敏感领域,同样需要注意安全边界。比如:
- 设计分子或蛋白时,要避免可用于不安全用途的毒性筛选模型被滥用;
- 使用实验数据和公开数据时,要遵守数据授权协议和隐私要求;
- 涉及人类基因、医疗健康数据时,要把隐私保护和合规审计放在首位;
- 涉及高风险实验时,平台需要考虑设置风险控制与审核机制。
这些不是阻碍,而是 AI4S 走向工程化的必要约束。
8. 常见问题与解读
8.1 AlphaFold 是 AI4S 吗
是,而且是目前最出圈的 AI4S 案例之一。AlphaFold 解决的问题非常具体:根据蛋白质氨基酸序列预测三维结构。它证明了 AI 可以在真实科学问题上达到接近实验测定的精度。
但 AlphaFold 只是 AI4S 众多子任务中的一个。AI4S 还包括分子设计、材料筛选、反应预测、气象建模等大量方向,每个方向都有各自的数据特征和验证方式。
8.2 AI4S 是炒概念还是真实需求
真实需求是存在的。传统科研方法在组合优化类问题上存在明显瓶颈,比如分子空间规模接近数十亿级别甚至更大,完全靠实验试错不现实。AI 模型可以用较低成本快速筛选候选,再集中资源做实验验证。
真正应该关注的是技术成熟度的差异。有些方向已经能提供实际价值,有些方向还停留在论文和演示阶段。做技术判断时,要区分“模型能预测”和“产品能落地”。
8.3 小团队能参与 AI4S 吗
能,但要选对切入点。
大团队可以覆盖“数据 → 模型 → 自动化实验 → 企业服务”全链路。小团队更适合聚焦单一环节:
- 做一个细分领域的数据清洗和标准化工具;
- 为一个垂直场景做预测模型和可视化前端;
- 做一个实验室数据管理系统;
- 把开源模型包装成领域专用工具。
AI4S 的生态还处在早期,细分工具有大量生存空间。
8.4 AI4S 会取代传统计算化学和计算生物学吗
短时间内不会,更可能是一种互补关系。传统方法有成熟的理论基础和数值精度,AI 模型有速度和成本优势。两者结合的方式是:AI 做快速粗筛,传统方法做精确验证;AI 预测候选空间,传统方法在候选空间里做高精度计算。
9. 结语与下一步关注点
Jeff Dean 选择 AI4S,给这个赛道带来的不只是名人效应,更是把“系统级基础设施思维”带入科学发现领域的信号。
对技术人来说,AI4S 现在还处于早期,但边界已经足够明确:数据标准化、模型与物理约束结合、主动学习闭环、实验自动化、可复现性工具,这些都是真实存在的工程空间。
接下来值得关注的是新公司首批产品形态:是面向科研机构的软件平台,还是面向实验自动化的基础设施,或者是聚焦某一垂直领域的技术服务。无论哪种形态,只要能把数据、模型、实验这三个环节真正串起来,AI4S 的工程化进程就会明显加快。
对普通开发者的建议是:不必急着追概念,先把科学数据处理、主动学习、模型接口封装这些基础能力练好。AI4S 需要的不是只会调参的训练师,而是能同时理解模型、数据和实验流程的工程人才。