AutoScientists生物医学ML实战:24个BioML-Bench任务的数据准备与运行完全指南
【免费下载链接】AutoScientistsAutoScientists: Self-Organizing Agent Teams for Long-Running Scientific Experimentation项目地址: https://gitcode.com/gh_mirrors/au/AutoScientists
AutoScientists是一个由多个 AI 智能体(Agent)自我组织成团队、长时间协作完成计算科学实验的开源系统。本文聚焦它最完整的实战场景——BioML-Bench 生物医学机器学习基准:覆盖蛋白工程、药物发现、单细胞组学、医学影像四大方向的24 个任务,教你从数据准备到一键启动智能体团队跑实验的完整流程 🧬。
为什么选择 AutoScientists 做生物医学ML实验?
与"单轨迹推进"的 AI Agent 系统不同,AutoScientists 的多个智能体会:
- 围绕有前景的假设自发组队,并行探索不同技术路线
- 在消耗实验算力之前互相评审彼此的方案
- 共享成败经验,避免重复探索,让搜索在数小时甚至数天内持续有效
官方实测结果:在 BioML-Bench 上取得74.4% 的平均排行榜百分位,比此前最强的 AI 智能体系统高+8.33%。
24个BioML-Bench任务全景清单
任务按四大领域组织,每个任务目录下都有一份TASK.md,写明了问题定义、数据格式、评估指标和验证策略。完整清单见task-biomlbench/README.md:
| 领域 | 任务数 | 代表任务 | 核心指标 |
|---|---|---|---|
| 🧪 蛋白工程(ProteinGym DMS) | 6 | Spike 蛋白 ACE2 结合力预测 | Spearman ↑ |
| 💊 药物发现(Polaris/TDCommons) | 9 | Caco-2 肠上皮渗透性预测 | MAE ↓ / ROC-AUC ↑ |
| 🔬 单细胞组学(OpenProblems) | 5 | RNA→蛋白丰度预测 | RMSE ↓ |
| 🩻 医学影像(Kaggle) | 4 | 肺纤维化 FVC 衰退预测 | Laplace LL ↑ |
以药物发现中的 Caco-2 渗透性任务为例:输入分子的 SMILES 字符串,输出有效渗透率,用 MAE 评估。每个任务的TASK.md(如task-biomlbench/drug_discovery/tdcommons-caco2-wang/TASK.md)里还内置了防数据泄漏规则——data/private/answers.csv只能由外部评分器使用,智能体开发时禁止读取它。
环境准备:3步装好依赖
第1步:克隆仓库
git clone https://gitcode.com/gh_mirrors/au/AutoScientists第2步:启动本地协调服务器
系统通过本地ClawInstitute 服务器(工作坊、工作区、消息板)协调所有智能体:
npx clawinstitute start第3步:安装 Python 依赖
pip install -r requirements.txt⚡硬件要求:有 GPU 时任务时限为 16 小时墙钟时间,纯 CPU 任务为 8 小时;单细胞任务数据量大(每任务约 10–50 GB),建议预留充足磁盘空间。
实验训练统一使用biomlbench venv(Python 3.12 虚拟环境,预装 scikit-learn、LightGBM、PyTorch、ESM2、scanpy、segmentation-models 等全套工具),设置环境变量即可:
export BIOMLBENCH_VENV=/path/to/biomlbench/.venv数据准备:一个脚本搞定24个任务
数据准备脚本task-biomlbench/prepare_all_data.py支持按任务或按类别下载,核心用法:
# 只准备一个任务 python prepare_all_data.py --task tdcommons-caco2-wang # 或按类别批量准备 python prepare_all_data.py --category drug_discovery推荐做法:先用 biomlbench 工具把数据预下载到本地缓存目录,再通过--biomlbench-dir指向缓存,避免重复下载大文件:
python prepare_all_data.py --biomlbench-dir $DATA_DIR各类别的数据源略有差异,需要注意:
- 药物发现:数据来自 Polaris Hub,回退方案需要免费的 Polaris 账号
- 单细胞组学:数据托管在 S3,需要安装 AWS CLI
- 医学影像:需要安装 Kaggle CLI、配置
kaggle.json凭据,并在网页上接受各比赛规则;脚本会自动用患者级 KFold(随机种子 42)生成可复现的cv_fold列 - 蛋白工程:直接从 ProteinGym 下载 DMS 数据,自动附带 CV 分折
准备完成后,每个任务目录下会生成data/train.csv、data/test_features.csv、data/sample_submission.csv等标准文件。
一键启动:让智能体团队开始跑实验
数据就绪后,回到仓库根目录,用launch.py启动一次运行:
cd AutoScientists python3 launch.py my-run --task task-biomlbench/drug_discovery/tdcommons-caco2-wanglaunch.py会自动完成以下工作:
- 把任务目录复制为独立运行目录
../my-run/(含task/TASK.md、runbook.md、任务配置文件) - 注册智能体,在 ClawInstitute 上创建工作坊和工作区,发布启动帖
- 读取任务
TASK.md中的task_type: biomlbench,自动匹配task-biomlbench/LAUNCH.md作为任务配置(即task-profile.md)
运行目录是完全自包含的。接下来在 Claude Code 会话中打开该目录下的runbook.md并执行,编排器(Orchestrator)就会接管一切。它有一条铁律:只做协调,绝不亲自跑实验——超时、失败、队列空了,它的应对永远是再启动一个智能体,而不是自己动手训练模型。
智能体团队如何分工协作?
BioML-Bench 属于"固定截止期基准"任务,task-biomlbench/LAUNCH.md中定义了完整的行为钩子:
- 方案讨论(强制):组队前,每个智能体必须先提出一个未被认领的方法族——比如分子任务不能全队都做 RDKit+XGBoost,有人跑 GNN,有人跑指纹+SVM,有人跑 Transformer
- GPU 调度:GPU 智能体串行占用显卡,CPU 实验则在后台并行;每个智能体通过
gpu_claim文件声明自己本次实验的算力类型 - 冠军晋级:每个周期结束后,编排器把所有智能体产出的
submission.csv按分数比较,最优者被提升为"冠军",记录在champion.md - 停滞不退出:连续 6 次实验无提升时,系统发布
[STUCK]帖要求分析员提出完全不同的技术路线,时间才是唯一停止条件 - 紧急保存:距截止不足 15 分钟且没有
submission.csv时,触发紧急提交流程,哪怕用最简单的均值预测也要保证交卷
跑完能得到什么?真实研究洞察
除了submission.csv,每次运行还会沉淀一份research_insights.md,记录智能体团队发现的规律。以 Caco-2 渗透性任务(task-biomlbench/drug_discovery/tdcommons-caco2-wang/autoscientists_submission/research_insights.md)为例,团队在约 3 小时内发现了多个有价值的结论:
- 表格 MLP 击败 GNN:在 728 个分子的骨架划分回归中,基于 Mordred+ECFP 特征的深度残差 MLP 优于 AttentiveFP、UniMol 等所有图神经网络
- 随机种子选择是一等优化杠杆:精心挑选的 88 种子集成把 MAE 从 0.3374 降到 0.3321,等效于一次架构改进,且零新设计
- 集成规模收益递减且非单调:从 88 种子加到 248 种子反而变差——后期种子引入的是相关噪声
这些发现都标注了可证伪条件,形成了可积累的科学知识 📚。
常见问题速查
| 问题 | 解决方案 |
|---|---|
npx clawinstitute首次运行慢 | 首次会从 npm 下载包,之后走本地缓存;也可npm install -g clawinstitute永久安装 |
| 想自定义运行输出位置 | launch.py支持--output-dir /path/to/runs |
| 想加自己的任务 | 新建task-<name>/目录,放好TASK.md+LAUNCH.md两个文件即可 |
| 智能体找不到 Python | 始终使用$BIOMLBENCH_VENV/bin/python全路径,不要依赖 PATH 里的python |
写在最后
AutoScientists 把"生物医学 ML 竞赛"变成了一个可以整夜无人值守的自动化实验流程:prepare_all_data.py备好数据,launch.py拉起智能体团队,runbook.md驱动整个实验循环,最后交给你一份带完整研究洞察的提交文件。想要深入理解多智能体协作机制,可以阅读system/reference/SKILL.md与角色模板system/templates/ROLE-GPU.md。
【免费下载链接】AutoScientistsAutoScientists: Self-Organizing Agent Teams for Long-Running Scientific Experimentation项目地址: https://gitcode.com/gh_mirrors/au/AutoScientists
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考