news 2026/9/12 7:10:55

AI-Scientist 部署实战:4 步跑通 LLM 全自动科研流水线

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
AI-Scientist 部署实战:4 步跑通 LLM 全自动科研流水线

AI-Scientist 部署实战:4 步跑通 LLM 全自动科研流水线

【免费下载链接】AI-ScientistThe AI Scientist: Towards Fully Automated Open-Ended Scientific Discovery 🧑‍🔬项目地址: https://gitcode.com/GitHub_Trending/ai/AI-Scientist

AI-Scientist 让 LLM 自主完成“提出假设 → 设计实验 → 执行实验 → 撰写论文”的科研闭环,全程无需人工干预:睡前把机器挂着,早上输出目录里就多出几篇带图表的论文 PDF。下面是完整的 AI-Scientist 部署流程,覆盖环境安装、API 密钥配置、模板基线准备、首次实验启动与排错。

AI-Scientist 到底替你跑什么

AI-Scientist 是一个全自动科学发现工具:给它一个研究模板,剩下的由 LLM 完成——提出研究想法、设计实验、执行代码、分析结果,最后用 LaTeX 把论文排版成 PDF。一次完整运行结束,你得到的是一个目录:论文、实验数据、图表全部齐全。

项目自带三个核心模板,覆盖不同方向:

  • nanoGPT:Transformer 自回归语言模型,使用 enwik8、shakespeare_char、text8 三个经典数据集;
  • 2d_diffusion:低维二维数据集上的扩散生成模型,涉及概率建模与采样技术;
  • grokking:研究深度神经网络的泛化能力与学习速度,观察模型如何从记忆训练数据走向真正的理解。

仓库里的 example_papers 目录存放了历次运行产出的完整示例论文,动手前先随便翻一篇,你就知道最后会拿到什么。

AI-Scientist 安装教程:从克隆仓库到环境就绪

前置条件比较直接:

  • Linux 系统 + NVIDIA GPU,CUDA Toolkit 11.7 及以上,建议 16GB 显存起步;
  • Python 3.11+、Git、Conda。

依赖各有用途:实验要在 GPU 上跑 PyTorch 训练,论文要用 LaTeX 编译,所以系统里还得装 texlive。

# 克隆仓库 git clone https://gitcode.com/GitHub_Trending/ai/AI-Scientist cd AI-Scientist # 用 Conda 建独立环境,避免依赖和其他项目冲突 conda create -n ai_scientist python=3.11 conda activate ai_scientist # LaTeX 编译环境,装得比较久 sudo apt-get install texlive-full # Python 依赖 pip install -r requirements.txt

两个容易卡住的点:texlive-full耗时较长,安装过程中可能反复要求确认磁盘占用,持续按 Enter 即可;Python 侧的依赖全在 requirements.txt 里,不用手动对版本。

API 密钥配置:三条 export 跑通 LLM 自动科学发现

模型调用只依赖环境变量,按需配置对应厂商的密钥:

export OPENAI_API_KEY="你的密钥" # GPT 系列,官方推荐 export ANTHROPIC_API_KEY="你的密钥" # Claude 系列 export DEEPSEEK_API_KEY="你的密钥" # 国内访问友好

你实际用哪家模型就配哪家的,不必三个都填。

文献检索属于可选项,论文生成阶段可以接入 Semantic Scholar:

export S2_API_KEY="你的密钥"

没有 Semantic Scholar 密钥时,用 OpenAlex 作为替代:

pip install pyalex export OPENALEX_MAIL_ADDRESS="你的邮箱"

AI-Scientist 模板运行:三大模板的额外依赖与基线实验

每个模板要先跑一次基线,AI 后续的改进都是拿基线结果当参照物。三个模板的额外依赖平时散落在各处,这里统一收拢成一次操作。

额外依赖一次装齐

# 2d_diffusion 需要:NPEET 熵估计库 git clone https://github.com/gregversteeg/NPEET.git cd NPEET pip install . pip install scikit-learn # grokking 需要 pip install einops

NanoGPT 的数据准备

只有 nanoGPT 模板需要预先处理三个数据集,另两个模板没有这步:

python data/enwik8/prepare.py python data/shakespeare_char/prepare.py python data/text8/prepare.py

基线实验与出图

三个模板的基线命令完全一致,换目录即可:

cd templates/nanoGPT # 或 templates/2d_diffusion、templates/grokking python experiment.py --out_dir run_0 python plot.py

基线结果落在run_0目录里,实验日志和曲线都由plot.py生成,AI 生成新想法时会以此为改进的起点。

⚡ 启动首次实验:launch_scientist.py 的关键参数

基线就绪后,启动全自动流水线:

# GPT-4o python launch_scientist.py --model "gpt-4o-2024-05-13" --experiment nanoGPT_lite --num-ideas 2 # Claude python launch_scientist.py --model "claude-3-5-sonnet-20241022" --experiment nanoGPT_lite --num-ideas 2 # 多 GPU 并行(需要机器上有多块 GPU) python launch_scientist.py --model "gpt-4o-2024-05-13" --experiment 2d_diffusion --num-ideas 5 --parallel

参数就记四个:--model选 LLM,--experiment选模板(nanoGPT_lite 是计算量更小的轻量版),--num-ideas控制生成几个研究方向,--parallel开启多 GPU 并行。launch_scientist.py 是整个过程唯一的启动入口。

实验结束后会自动产出一篇完整论文(PDF),所有实验数据和图表都存放在同一目录下,长这样:

论文产出后验证:LLM 审阅与批量分析

项目自带审阅模块,把生成的论文喂给 LLM,拿回评分、决定和缺点列表:

import openai from ai_scientist.perform_review import load_paper, perform_review client = openai.OpenAI() paper_txt = load_paper("report.pdf") review = perform_review( paper_txt, "gpt-4o-2024-05-13", client, num_reflections=5, num_fs_examples=1, num_reviews_ensemble=5, temperature=0.1, ) print(review["Overall"], review["Decision"], review["Weaknesses"])

ai_scientist/perform_review.py 里的反思次数、few-shot 示例数、多评审集成这些参数可按需开关,快速验证时保持默认即可。

批量评估大规模实验结果另有入口,核心参数两个:

cd review_iclr_bench python iclr_analysis.py --num_reviews 500 --batch_size 100

--num_reviews控制审阅总量、--batch_size控制批次大小;采样相关的--num_fs_examples--temperature等参数按需追加。

🐳 跑进沙箱:Docker 容器化部署

流水线会执行 LLM 生成的代码,在宿主机上直接跑总归不太放心,容器化既隔离了风险,也方便跨机器复现。项目提供了社区贡献的 Dockerfile:

docker build -t ai-scientist -f experimental/Dockerfile . docker run -e OPENAI_API_KEY=$OPENAI_API_KEY \ -v $(pwd)/templates:/app/AI-Scientist/templates \ ai-scientist --model gpt-4o-2024-05-13 \ --experiment 2d_diffusion --num-ideas 2

-v把本地 templates 目录挂进容器,改模板时无需重建镜像。experimental/Dockerfile 就是构建依据。

🛠️ 踩坑速查表:三种情况与对应命令

现象处理
依赖冲突、环境跑不起来重建干净环境:conda env remove -n ai_scientist,再依次执行conda create -n ai_scientist python=3.11conda activate ai_scientistpip install -r requirements.txt
LLM API 受限、调用不通换 DeepSeek:export DEEPSEEK_API_KEY="你的密钥",然后python launch_scientist.py --model "deepseek-chat" --experiment grokking --num-ideas 2
实验跑得慢降算力:python launch_scientist.py --model "gpt-4o-mini" --experiment nanoGPT_lite --num-ideas 1

部署完成之后的三个方向

  • 自建模板:参照 templates 目录下现成的模板结构,为自己关注的课题搭一个研究模板;
  • 对比模型:同一实验换不同模型各跑一遍,观察论文质量与结论的差异;
  • 量化质量:用审阅模块对一批产出做批量评估,给结果一个可比较的分数。

下次睡前把机器挂上时,你应该清楚里面每一环在做什么了。

【免费下载链接】AI-ScientistThe AI Scientist: Towards Fully Automated Open-Ended Scientific Discovery 🧑‍🔬项目地址: https://gitcode.com/GitHub_Trending/ai/AI-Scientist

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/12 7:10:42

SpringBoot导游平台开发实战:景区数字化解决方案

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/12 7:10:35

GPT-6 Astra企业知识库机器人实战:企业微信与飞书接入全指南

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/12 7:10:32

C#调用MarkEzd.dll激光打标SDK实战指南

简介:本资源是面向C#开发者与激光打标设备二次开发工程师的EzCad2平台MarkEzd.dll SDK实战示例工程,提供英文版完整开发模板与配套资源。项目基于北京金橙科技官方MarkEzd.dll动态库,支持对EzCad2及LMC1控制卡进行深度集成与功能扩展&#xf…

作者头像 李华
网站建设 2026/9/12 7:08:59

Flutter组件化开发全解析:从基础到高级实践

1. Flutter组件体系全景解读作为Google推出的跨平台UI工具包,Flutter的组件化设计是其核心架构思想。在Flutter中,万物皆组件(Widget)——小到一个图标按钮,大到整个页面布局,都是由不同层级的组件嵌套组合…

作者头像 李华
网站建设 2026/9/12 7:08:42

编程是逆熵运动:从Python入门到分布式系统的秩序之道

我开始理解这篇博文该怎么写了:它必须是一篇“有观点、有实操、有反思”的行业分享,而不是一个鸡汤标题的注水扩写。下面我直接以从业者口吻输出正文。编程,其实是一场大脑的逆熵运动。这句话我琢磨了好几年,越写代码越觉得它不只…

作者头像 李华