news 2026/8/27 15:18:47

AutoScientists生物医学ML实战:24个BioML-Bench任务的数据准备与运行完全指南

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
AutoScientists生物医学ML实战:24个BioML-Bench任务的数据准备与运行完全指南

AutoScientists生物医学ML实战:24个BioML-Bench任务的数据准备与运行完全指南

【免费下载链接】AutoScientistsAutoScientists: Self-Organizing Agent Teams for Long-Running Scientific Experimentation项目地址: https://gitcode.com/gh_mirrors/au/AutoScientists

AutoScientists是一个由多个 AI 智能体(Agent)自我组织成团队、长时间协作完成计算科学实验的开源系统。本文聚焦它最完整的实战场景——BioML-Bench 生物医学机器学习基准:覆盖蛋白工程、药物发现、单细胞组学、医学影像四大方向的24 个任务,教你从数据准备到一键启动智能体团队跑实验的完整流程 🧬。

为什么选择 AutoScientists 做生物医学ML实验?

与"单轨迹推进"的 AI Agent 系统不同,AutoScientists 的多个智能体会:

  • 围绕有前景的假设自发组队,并行探索不同技术路线
  • 在消耗实验算力之前互相评审彼此的方案
  • 共享成败经验,避免重复探索,让搜索在数小时甚至数天内持续有效

官方实测结果:在 BioML-Bench 上取得74.4% 的平均排行榜百分位,比此前最强的 AI 智能体系统高+8.33%

24个BioML-Bench任务全景清单

任务按四大领域组织,每个任务目录下都有一份TASK.md,写明了问题定义、数据格式、评估指标和验证策略。完整清单见task-biomlbench/README.md

领域任务数代表任务核心指标
🧪 蛋白工程(ProteinGym DMS)6Spike 蛋白 ACE2 结合力预测Spearman ↑
💊 药物发现(Polaris/TDCommons)9Caco-2 肠上皮渗透性预测MAE ↓ / ROC-AUC ↑
🔬 单细胞组学(OpenProblems)5RNA→蛋白丰度预测RMSE ↓
🩻 医学影像(Kaggle)4肺纤维化 FVC 衰退预测Laplace LL ↑

以药物发现中的 Caco-2 渗透性任务为例:输入分子的 SMILES 字符串,输出有效渗透率,用 MAE 评估。每个任务的TASK.md(如task-biomlbench/drug_discovery/tdcommons-caco2-wang/TASK.md)里还内置了防数据泄漏规则——data/private/answers.csv只能由外部评分器使用,智能体开发时禁止读取它。

环境准备:3步装好依赖

第1步:克隆仓库

git clone https://gitcode.com/gh_mirrors/au/AutoScientists

第2步:启动本地协调服务器

系统通过本地ClawInstitute 服务器(工作坊、工作区、消息板)协调所有智能体:

npx clawinstitute start

第3步:安装 Python 依赖

pip install -r requirements.txt

硬件要求:有 GPU 时任务时限为 16 小时墙钟时间,纯 CPU 任务为 8 小时;单细胞任务数据量大(每任务约 10–50 GB),建议预留充足磁盘空间。

实验训练统一使用biomlbench venv(Python 3.12 虚拟环境,预装 scikit-learn、LightGBM、PyTorch、ESM2、scanpy、segmentation-models 等全套工具),设置环境变量即可:

export BIOMLBENCH_VENV=/path/to/biomlbench/.venv

数据准备:一个脚本搞定24个任务

数据准备脚本task-biomlbench/prepare_all_data.py支持按任务或按类别下载,核心用法:

# 只准备一个任务 python prepare_all_data.py --task tdcommons-caco2-wang # 或按类别批量准备 python prepare_all_data.py --category drug_discovery

推荐做法:先用 biomlbench 工具把数据预下载到本地缓存目录,再通过--biomlbench-dir指向缓存,避免重复下载大文件:

python prepare_all_data.py --biomlbench-dir $DATA_DIR

各类别的数据源略有差异,需要注意:

  • 药物发现:数据来自 Polaris Hub,回退方案需要免费的 Polaris 账号
  • 单细胞组学:数据托管在 S3,需要安装 AWS CLI
  • 医学影像:需要安装 Kaggle CLI、配置kaggle.json凭据,并在网页上接受各比赛规则;脚本会自动用患者级 KFold(随机种子 42)生成可复现的cv_fold
  • 蛋白工程:直接从 ProteinGym 下载 DMS 数据,自动附带 CV 分折

准备完成后,每个任务目录下会生成data/train.csvdata/test_features.csvdata/sample_submission.csv等标准文件。

一键启动:让智能体团队开始跑实验

数据就绪后,回到仓库根目录,用launch.py启动一次运行:

cd AutoScientists python3 launch.py my-run --task task-biomlbench/drug_discovery/tdcommons-caco2-wang

launch.py会自动完成以下工作:

  1. 把任务目录复制为独立运行目录../my-run/(含task/TASK.mdrunbook.md、任务配置文件)
  2. 注册智能体,在 ClawInstitute 上创建工作坊和工作区,发布启动帖
  3. 读取任务TASK.md中的task_type: biomlbench,自动匹配task-biomlbench/LAUNCH.md作为任务配置(即task-profile.md

运行目录是完全自包含的。接下来在 Claude Code 会话中打开该目录下的runbook.md并执行,编排器(Orchestrator)就会接管一切。它有一条铁律:只做协调,绝不亲自跑实验——超时、失败、队列空了,它的应对永远是再启动一个智能体,而不是自己动手训练模型。

智能体团队如何分工协作?

BioML-Bench 属于"固定截止期基准"任务,task-biomlbench/LAUNCH.md中定义了完整的行为钩子:

  • 方案讨论(强制):组队前,每个智能体必须先提出一个未被认领的方法族——比如分子任务不能全队都做 RDKit+XGBoost,有人跑 GNN,有人跑指纹+SVM,有人跑 Transformer
  • GPU 调度:GPU 智能体串行占用显卡,CPU 实验则在后台并行;每个智能体通过gpu_claim文件声明自己本次实验的算力类型
  • 冠军晋级:每个周期结束后,编排器把所有智能体产出的submission.csv按分数比较,最优者被提升为"冠军",记录在champion.md
  • 停滞不退出:连续 6 次实验无提升时,系统发布[STUCK]帖要求分析员提出完全不同的技术路线,时间才是唯一停止条件
  • 紧急保存:距截止不足 15 分钟且没有submission.csv时,触发紧急提交流程,哪怕用最简单的均值预测也要保证交卷

跑完能得到什么?真实研究洞察

除了submission.csv,每次运行还会沉淀一份research_insights.md,记录智能体团队发现的规律。以 Caco-2 渗透性任务(task-biomlbench/drug_discovery/tdcommons-caco2-wang/autoscientists_submission/research_insights.md)为例,团队在约 3 小时内发现了多个有价值的结论:

  • 表格 MLP 击败 GNN:在 728 个分子的骨架划分回归中,基于 Mordred+ECFP 特征的深度残差 MLP 优于 AttentiveFP、UniMol 等所有图神经网络
  • 随机种子选择是一等优化杠杆:精心挑选的 88 种子集成把 MAE 从 0.3374 降到 0.3321,等效于一次架构改进,且零新设计
  • 集成规模收益递减且非单调:从 88 种子加到 248 种子反而变差——后期种子引入的是相关噪声

这些发现都标注了可证伪条件,形成了可积累的科学知识 📚。

常见问题速查

问题解决方案
npx clawinstitute首次运行慢首次会从 npm 下载包,之后走本地缓存;也可npm install -g clawinstitute永久安装
想自定义运行输出位置launch.py支持--output-dir /path/to/runs
想加自己的任务新建task-<name>/目录,放好TASK.md+LAUNCH.md两个文件即可
智能体找不到 Python始终使用$BIOMLBENCH_VENV/bin/python全路径,不要依赖 PATH 里的python

写在最后

AutoScientists 把"生物医学 ML 竞赛"变成了一个可以整夜无人值守的自动化实验流程:prepare_all_data.py备好数据,launch.py拉起智能体团队,runbook.md驱动整个实验循环,最后交给你一份带完整研究洞察的提交文件。想要深入理解多智能体协作机制,可以阅读system/reference/SKILL.md与角色模板system/templates/ROLE-GPU.md

【免费下载链接】AutoScientistsAutoScientists: Self-Organizing Agent Teams for Long-Running Scientific Experimentation项目地址: https://gitcode.com/gh_mirrors/au/AutoScientists

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/8/27 15:14:23

2026年内容防盗的教培系统有哪些,具体如何操作呢?

2026年内容防盗的教培系统有哪些&#xff0c;具体如何操作呢&#xff1f;2026年7月&#xff0c;京津冀三地检察机关在全球数字经济大会发布护航数字经济发展典型案例&#xff1a;被告人通过爬取资源、拆分账号分销、跨平台倒卖学科网教育资料&#xff0c;被统一认定构成侵犯著作…

作者头像 李华
网站建设 2026/8/27 15:12:24

TeenyUSB MSC U盘开发指南:用FatFs打造你自己的闪存U盘设备

TeenyUSB MSC U盘开发指南&#xff1a;用FatFs打造你自己的闪存U盘设备 【免费下载链接】TeenyUSB Lightweight USB device and host stack for STM32 and other MCUs. Ready for USB 3.0 device. 项目地址: https://gitcode.com/gh_mirrors/te/TeenyUSB TeenyUSB 是一个…

作者头像 李华
网站建设 2026/8/27 15:10:59

KKCE: 网站测速,ping检测,IP查询,路由追踪-快快测

一、引言&#xff1a;为什么 Chrome DevTools 显示完美&#xff0c;网站测速却显示移动端布局错乱&#xff1f; 在响应式网页设计中&#xff0c;我们常以为只要在 Chrome DevTools 的设备模拟器中切换为“iPhone 12”视图&#xff0c;页面能正常排列&#xff0c;移动端适配就“…

作者头像 李华
网站建设 2026/8/27 15:08:37

AI情感陪伴的隐私风险:从上下文窗口到数据脱敏的技术拆解

这两天“AI 情感陪伴”的话题热度又上来了。聊天机器人能陪你聊心事、模拟朋友口吻、在你深夜失眠时给出“温柔回应”&#xff0c;但斯坦福相关研究引发的讨论&#xff0c;给这个热闹场面泼了一盆冷水&#xff1a;你跟 AI 说的私密话&#xff0c;可能并不只是你们俩知道。问题不…

作者头像 李华