news 2026/9/12 16:53:17

一个想法进去,一篇完整论文出来:AI-Scientist 全自动科学发现上手指南

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
一个想法进去,一篇完整论文出来:AI-Scientist 全自动科学发现上手指南

一个想法进去,一篇完整论文出来:AI-Scientist 全自动科学发现上手指南

【免费下载链接】AI-ScientistThe AI Scientist: Towards Fully Automated Open-Ended Scientific Discovery 🧑‍🔬项目地址: https://gitcode.com/GitHub_Trending/ai/AI-Scientist

AI-Scientist 是一个开源的全自动科学发现工具:它让大语言模型独立完成"提出研究假设 → 改代码跑实验 → 撰写论文 → 自评审"四个环节,最终产出一份符合学术规范的论文 PDF。只要你有 GPU 和 API Key,今天就能跑出自己的第一篇 AI 写论文。

它到底能替你干什么

自动提出研究假设

你只需要给几个种子想法(存放在模板的 seed_ideas.json 里),系统会基于它们推导新假设,再调用文献检索服务做新颖性检查,最后给出一批可挑选的候选想法(ideas.json)。这一步的核心逻辑在 ai_scientist/generate_ideas.py。

自动改码并跑实验

想法确定后,它交给 Aider 直接修改实验代码,在 GPU 上启动 run_1 到 run_N 多组训练,自动收集指标并生成图表。下图就是一份示例实验产出的最终验证准确率对比柱状图——实验自己跑,图自己画:

自动写论文并自评审

📝 实验跑完,它会整理结果生成 LaTeX 论文、编译成 PDF,并自动补充文献引用。随后切换到审稿模式:给出 1–10 的总体评分、Accept/Reject 决定和缺点清单,相当于先替你过一轮内审。

最小路径跑通第一个实验

下面是最短完整路径。先克隆代码并装好环境(含 LaTeX,用于编译论文 PDF;安装时间较长,中途可能需要按住 Enter):

git clone https://gitcode.com/GitHub_Trending/ai/AI-Scientist cd AI-Scientist conda create -n ai_scientist python=3.11 conda activate ai_scientist pip install -r requirements.txt sudo apt-get install texlive-full

接着设置 API Key、下载 nanoGPT 模板所需语料,并跑一组基线实验存到 run_0(基线用于和你本机硬件做运行时间对比,不可跳过):

export OPENAI_API_KEY="你的密钥" python data/enwik8/prepare.py python data/shakespeare_char/prepare.py python data/text8/prepare.py cd templates/nanoGPT python experiment.py --out_dir run_0 python plot.py

最后回到根目录启动"AI 科研员",--num-ideas 1只跑一个想法,是熟悉流程成本最低的方式:

cd ../../ python launch_scientist.py --model "gpt-4o-2024-05-13" --experiment nanoGPT_lite --num-ideas 1

结果会写入根目录下带时间戳的新文件夹,包含论文 PDF 与实验图表;多显卡机器可加--parallel并行执行多个想法。

三个官方模板怎么选

模板都放在 templates/ 目录下,每个模板自带 experiment.py、plot.py、prompt.json 等文件,选模板就是选 AI 研究的方向:

  • nanoGPT / nanoGPT_lite:研究 Transformer 自回归语言模型,适合做学习率、架构与预训练技巧类想法,数据准备最标准,新手首选。
  • 2d_diffusion:研究低维 2D 数据(Datasaurus 等)上的扩散生成模型,使用前需先装 NPEET 依赖,适合关注样本质量与多样性的方向。
  • grokking:复现"模型先背题、突然通晓测试集"的突变泛化现象,适合研究泛化能力与学习速度。🧪

下图是 2D Diffusion 示例论文在 dino 数据集上的样本生成效果对比,能直观看到 AI 正在优化什么:

让 AI 自己当审稿人

论文写好后不必只信 AI 自己的判断。调用 ai_scientist/perform_review.py 里的两个函数,就能让 LLM 给出结构化评审:

from ai_scientist.perform_review import load_paper, perform_review review = perform_review(load_paper("report.pdf"), "gpt-4o-2024-05-13", client, num_reflections=5, num_reviews_ensemble=5) print(review["Overall"], review["Decision"], review["Weaknesses"])

官方实验显示 GPT-4o 的评审风格最稳定,其他模型容易给分偏高或格式跑偏。想批量评估大量论文,可以改用 review_iclr_bench/iclr_analysis.py 对 ICLR 语料做批量评审,分数以 CSV 落盘。

定制你自己的研究领域

想让 AI 进你的领域,按现有模板结构组装 5 个文件即可:experiment.py(实验主脚本,接收--out_dir参数)、plot.py(结果绘图)、prompt.json(模板描述)、seed_ideas.json(种子想法)、latex/template.tex(论文版式)。关键约束是文件名与输出 JSON 格式要和官方模板保持一致,其余内容都可以改。社区已贡献了 SEIR 传染病模型、MobileNetV3 分类、sketch_rnn、量子化学 MACE、地震预测等模板,可直接参考其结构。

提前说三件事:

  • 安全:系统会执行 LLM 生成的代码,建议用 experimental/Dockerfile 做容器化部署并限制网络访问。
  • 成本:用 Claude 3.5 写一篇论文通常约 15 美元,DeepSeek Coder V2 更便宜;完整支持模型清单见 ai_scientist/llm.py。
  • 避坑:缺文件或 PDF 没生成,多半是没做完模板准备(数据 + run_0)或 API Key 配错;底模能力建议不低于 GPT-4 水平,论文完整成功率以 Claude Sonnet 3.5 最高。

现在就动手

选 nanoGPT 或离你领域最近的一个模板,用--num-ideas 1让 AI 写出第一篇论文,再调用评审功能让它自我批评——看看你的研究流程里,哪些环节已经被它包圆了。

【免费下载链接】AI-ScientistThe AI Scientist: Towards Fully Automated Open-Ended Scientific Discovery 🧑‍🔬项目地址: https://gitcode.com/GitHub_Trending/ai/AI-Scientist

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/12 16:49:41

RAG 技术方案全解析:从基础架构到生产级优化

这里写自定义目录标题欢迎使用Markdown编辑器引言:RAG 为什么成为大模型落地的主流范式一、RAG 的核心原理与设计目标1.1 从"参数记忆"到"外部记忆"1.2 RAG 解决的核心问题二、RAG 的完整架构:从数据到服务的全链路2.1 数据层&#…

作者头像 李华
网站建设 2026/9/12 16:48:50

如何用 GoogleMock NiceMock 和 StrictMock 控制 uninteresting call 警告

如何用 GoogleMock NiceMock 和 StrictMock 控制 uninteresting call 警告 【免费下载链接】googletest GoogleTest - Google Testing and Mocking Framework 项目地址: https://gitcode.com/GitHub_Trending/go/googletest 在写 GoogleMock 测试时,一个常见…

作者头像 李华