25年8月来自哈工大、香港大学、UIUC、普林斯顿大学、复旦、香港中文和字节公司的论文“AI4Research: A Survey of Artificial Intelligence for Scientific Research”。
这篇综述的核心价值,是把 AI 辅助科研整理成一个覆盖文献理解、文献调研、科学发现、论文写作和同行评审的完整框架。它适合用来了解领域全貌、寻找研究方向和查找资源;但对于“哪些方法真正有效、自动化到了什么程度、是否产生了可靠的新知识”,它的证据比较和批判性分析仍不够充分。
如图 1 所示AI4Research涵盖多种主流流程与类别,可归纳为五个关键领域:(1) AI 辅助科学理解,(2) AI 辅助学术调研,(3) AI 辅助科学发现,(4) AI 辅助学术写作,以及 (5) AI 辅助学术同行评审。这些领域均有助于提升融合了人工智能技术的科研与出版工作的成效与效率。
一、这篇综述想解决什么问题?
作者认为,既有研究往往分别讨论 AI 如何发现新材料、生成研究想法、撰写论文或辅助审稿,缺少覆盖整个科研过程的统一视角。因此,文章提出 AI4Research,讨论 AI 如何提升、加速和部分自动化跨学科科研。
文章把 AI4Research 与 AI4Science 作了如下区分(第 10 页):
这里应注意:这是作者为了组织综述而采用的概念划分,不宜理解为两个领域已有严格统一的边界。
全文共 121 页,正文及目录约占前 49 页,后面主要是参考文献。其结构可以概括为:
理解已有知识 → 整理研究版图 → 提出并验证新发现 → 表达研究成果 → 评价与传播成果。
文章以这个顺序构建框架,同时在具体系统中讨论反馈、迭代和多智能体协作。
二、详细概述:五个科研环节分别讨论了什么?
1.科学理解:让 AI 从论文中提取和理解知识。
如图 3 所示实现科学理解的AI主要范式包括:(1) 文本科学理解,进一步细分为半自动科学理解和全自动科学理解;以及 (2) 表格与图表科学理解,涵盖表格理解和图表理解。
这一部分主要对应第 3 节,第 11—13 页。作者区分文本理解与图表理解。
文本理解又按自动化程度分为两类:
半自动理解:人提出问题,AI 回答。包括人机多轮交流、调用检索与计算工具,以及对单轮问题进行完整回答。
全自动理解:AI 自行总结论文、自行提出问题、自行回答和反思,不依赖人逐个提出阅读问题。
文章强调,科研理解需要外部工具支持。例如,检索工具补充领域知识,事实核查工具检查回答依据,计算器和公式工具处理精确推理。PaperQA2、SciAgent 等被用作例子。
图表理解则涵盖表格结构、数值关系、图形信息和跨模态推理。文中介绍了 Chain-of-Table、Tree-of-Table 等通过逐步操作或分解表格来辅助推理的方法。
这一部分的重要含义是:**科研阅读的目标应包括理解论证与证据关系,而不仅是生成摘要。**不过,综述收录的许多评测主要测问答或摘要能力,距离完整的批判性阅读仍有差距。
2.学术调研:从“找到论文”发展到“组织一个领域的知识”。
如图 4 所示人工智能驱动的学术综述主要包含两个阶段:相关工作检索与综述报告生成。其中,相关工作检索进一步细分为语义引导检索、图引导检索和大语言模型(LLM)增强检索;综述报告生成则涵盖研究路线图构建、章节级相关工作生成以及文档级综述生成。
第 4 节,第 13—16 页,将这一任务分为文献检索和综述生成。
文献检索有三条主要路线:
综述生成则分为三个层次:
研究路线梳理:形成主题分类、发展脉络与研究空白。
相关工作章节生成:围绕某个具体研究组织已有方法。
整篇综述生成:完成检索、提纲、章节撰写和修改。
文章介绍 AutoSurvey、SurveyForge、STORM 等系统,体现出一个共同趋势:先组织知识结构,再生成长文,并通过反馈完善内容。
需要把握的要点是:高质量调研依赖检索覆盖、分类结构和引用准确性,文字流畅只是其中一部分。
3.科学发现:从提出想法到验证想法,是全文最核心的部分。
如图 5 所示这是一套由人工智能增强的科学发现流程,涵盖了创意挖掘、新颖性与重要性评估、理论分析以及实验实施等环节。“全自动发现”将这些要素整合为一个连贯的端到端流程,从而有力支持科学探索与创新。
第 5 节,第 17—25 页,把科学发现拆成五项任务。
第一项是研究想法与假设生成。作者总结了三类来源:
模型内部知识:利用已有知识和提示产生候选想法。
外部信号:利用文献、知识图谱、实验结果或环境反馈产生想法。
团队讨论:通过 AI 与 AI、人与 AI 的讨论、批评和组合产生想法。
文章特别重视“提出假设—获得反馈—修改假设”的过程,因为静态文献组合可能无法反映真实实验中的约束。
第二项是新颖性与重要性评估。这里讨论传统评分方法、LLM 评估以及人机协同评估。作者承认,模型可能高估创意,也可能使不同人的想法趋同。因此,自动生成大量想法之后,仍需可靠的筛选机制。
第三项是理论分析,包括:
把自然语言主张转换成可处理的结构;
收集支持或反驳主张的证据;
检查逻辑、事实一致性和稳健性;
使用形式化工具完成定理证明。
这部分把文献证据核查和形式化证明纳入同一框架,但两者所能提供的保证不同:已有文献支持某个命题,不等于这个命题已获得数学证明或现实实验验证。
第四项是科学实验,覆盖完整实验过程:
文章同时涉及机器学习实验、仿真实验和真实实验室,介绍了自我改进、多智能体协作、外部工具调用和专门模型训练等技术路径。
第五项是全自动科学发现。代表系统包括 The AI Scientist、Agent Laboratory、Dolphin、Curie 和 Zochi 等。其目标是把前述环节连接起来,根据实验结果继续修改研究方向。
这一部分真正值得关注的,是系统能否形成有证据支持、能够纠错的研究循环。自动生成一份论文,只能说明完成了一种输出形式。
4.学术写作:覆盖准备、撰写和修改全过程。
如图 6 所示学术写作中的人工智能主要范式可分为两大类:半自动学术写作与全自动学术写作。具体而言,半自动学术写作涵盖了稿件准备、稿件撰写及稿件完成这几个阶段。
第 6 节,第 25—28 页,区分半自动写作与全自动写作。
半自动写作分为三个阶段:
写作前:生成标题、组织提纲、检查章节逻辑。
写作中:绘制图表、生成图注、转写公式、推荐和插入引用。
写作后:修改语法、表达和论证结构,支持多轮人机编辑。
全自动写作则把研究记录、代码、结果和图表组织为完整稿件,并通过自动评审反馈反复修改。
值得注意的是,作者在第 28 页明确承认:**文中讨论的系统尚未完全消除人工编辑需求,尤其是正确使用引用方面。**因此,“全自动”在这里更多是任务目标或系统设计方向,不能直接视为已经普遍实现的能力。
5.同行评审:从稿件分配到评语生成,再到传播。
如图 7 所示用于学术同行评审的AI核心流程管线涵盖三个关键阶段:(1) 评审前阶段(Pre-Review),包括初审(Desk-Review)与审稿人匹配,旨在确保评估工作更高效、质量更高;(2) 评审中阶段(In-Review),包含同行评审与元评审(Meta-Review),旨在提供全面的学者反馈与评估;以及 (3) 评审后阶段(Post-Review),涉及影响力分析与推广增强,旨在评估评审过程的影响力并促进学术成果的传播。
第 7 节,第 28—32 页,将流程分为:
文章介绍单智能体、多轮修订和多智能体讨论等评审机制,也指出模型与专家的关注点存在差异。例如,文中引用的研究发现,现成模型可能更关注技术有效性,而对新颖性关注不足。
因此,这一部分的关键问题是:AI 能否发现真实、重要且可修正的问题,而不只是写出像审稿意见的文字。
三、跨学科应用、资源和未来方向
如图 8 所示人工智能在研究中的多学科应用。这包括三个主要领域:(a) 自然科学领域的人工智能,涵盖物理学、生物学与医学、化学及材料科学等学科;(b) 应用科学与工程领域的人工智能,侧重于机器人技术和软件工程;以及 © 社会科学领域的人工智能,涵盖社会学和心理学等学科。
第 8 节把应用分为三类:
这里的共同思路,是让语言模型组织任务,并调用领域模型、数据库、代码工具或实验设备。
不过,不同领域的验证条件差异很大。代码可以运行测试,数学证明可以接受形式化检查,材料需要实际合成与表征,社会科学则需要检验模型模拟与真实人群之间的对应关系。这些任务不能仅凭同一个“自动化”标签来比较。
第 9 节整理了工具、数据集和基准。例如,文献理解有 ScienceQA、LitQA2,综述生成有 SurveyBench,想法生成有 LiveIdeaBench,实验执行有 MLE-Bench、MLAgentBench,评审研究有 PeerRead、ReviewCritique 等。这使文章具有较强的资源索引价值。
第 10 节提出七个未来方向:
跨学科模型与知识迁移。
伦理、安全、公平与偏差治理。
人机协作和多智能体科研。
可解释性与透明性。
动态、实时优化的实验系统。
文本、图表、代码和实验信号的多模态整合。
多语言科研知识整合。
这些方向共同指向一个需求:科研系统既要扩展能力,也要保留证据、表达不确定性,并允许研究者检查和纠正。
四、这篇综述最值得记住的要点
五点:
以科研全流程为组织单位。它把经常分开研究的阅读、调研、发现、写作和评审连接起来,是全文最主要的框架贡献。
科学发现需要多个能力共同作用。想法生成只是起点,后面还有新颖性判断、理论检查、实验执行和结果分析。
外部知识、工具和实验反馈至关重要。文章大量方法都通过这些机制扩展模型自身能力。
人机协作与多智能体协作贯穿全篇。它们被用于任务分工、批评、修订和实验协调,但协作本身仍需验证是否有效。
评测已覆盖多个科研环节,但尚未形成统一的可靠性标准。局部任务得分与真实科研贡献之间,仍存在需要解释的距离。
文章最有用的阅读方式,是把它当作一张研究任务与相关资源的地图,再沿具体方向回到原始论文核查证据。
五、它存在哪些问题?
作者已经讨论了幻觉与验证不足、创意同质化、跨领域迁移困难、多智能体协调错误、数据隐私、多模态不确定性和低资源语言偏差。因此,不能说文章完全忽视风险。它的主要不足是:这些风险尚未充分转化为比较各类系统的统一评价框架。
1.文献覆盖很广,但检索与筛选方法不够透明。
正文没有明确给出可复现的检索数据库、检索式、时间范围、纳入排除标准、筛选流程和证据质量分级。
这意味着读者难以判断:某种方法被重点讨论,是因为证据更强、影响更大,还是因为更容易被作者检索到。
因此,它更接近大规模叙述性综述与分类整理。引用数量多,并不足以保证覆盖完整或选择没有偏差。
2.分类体系混合了不同维度,部分边界较模糊。
一级分类是科研阶段,但下一级有时按自动化程度划分,有时按技术方法、信息来源或协作方式划分。
例如,“外部知识生成想法”和“团队讨论生成想法”可以同时发生;“文献综述生成”与“论文写作”也有明显重叠。把传播推广放在“同行评审后”之下,虽然符合时间顺序,却扩大了同行评审的概念范围。
更清楚的做法,是分别标注科研阶段、自动化程度、技术机制和验证方式,允许一个系统同时具备多个标签。
3.对“全自动”的界定和证据要求不够一致。
文中多次使用全自动理解、全自动写作和全自动发现,但没有统一标注人类在哪些环节仍然参与,例如:
谁选择课题和数据?
谁设置评价标准?
谁修复环境和运行故障?
谁检查实验是否合理?
谁最终确认结论?
第 28 页承认写作系统仍需人工编辑,也说明自动化存在层次。缺少这些细节,容易把“在预先配置好的环境中完成任务”理解成更广泛的自主科研能力。
4.有评测表,但不足以支持整体科研能力的强结论。
文章的表 2—5 引用了不同来源的评测结果,并未形成统一实验条件下的比较。
两个例子尤其值得注意:
第 24 页表 4:所列 ScienceAgentBench 结果中,最高 SR 数值为 42.2。这提示该表所覆盖的模型与配置仍有明显失败空间,不能由此推导出全自动科研已普遍可靠。
第 30 页表 5:评审评测包括关注点匹配和文本相似度。与专家评语相似,并不能直接证明模型发现了关键错误,或作出了正确的录用判断。
这些结果也只是文中收录时的特定模型与配置表现,不能作为当前能力排名。
更有说服力的比较,还需要控制成本、工具权限、人类帮助、重复运行次数,并报告错误类型和结果波动。
5.对“新颖性”“正确性”“科学价值”的区分仍不够深入。
第 9 页将发现质量表示为新颖性、有效性和重要性的组合,但没有建立可操作的统一测量方法。
这里有几个根本问题:文本上新颖的想法可能早已被研究;模型评为重要的命题可能无法验证;产生大量候选方案后挑出少数成功案例,也不能说明总体发现效率。
综述需要更充分讨论训练数据泄漏、时间隔离评测、独立验证,以及失败候选的统计。否则很难区分模型是在重现已有知识,还是确实提出了新的有效发现。
6.真实科研中的统计严谨性和失败处理,没有成为贯穿全篇的主线。
文章涉及验证不足,也讨论了把统计结果简单分成“显著/不显著”的问题,但没有系统比较各系统是否处理:
多次尝试带来的选择偏差;
测试数据被反复使用;
负结果和失败实验的保留;
效应大小与不确定性;
独立复现;
连续实验中的停止条件。
当系统能自动提出并测试大量假设时,这些问题会直接影响结论可信度。单纯提高实验执行速度,无法替代这些保障。
7.跨学科应用介绍丰富,但部分结论超出了所列证据的支持范围。
一个明显例子是第 34—35 页:文章把医学考试表现、多智能体医院模拟和特定机器人操作成果结合起来,进一步论述完全自主医疗设施的可行性。
从综述自身展示的证据看,这个推论跨越较大:几个模块分别在有限任务中表现良好,尚不足以建立整个复杂系统可靠运行的结论。
这反映出全文部分段落的共同倾向:从局部成功案例迅速上升到整体系统前景,对适用条件和外推限制交代不足。
8.形式化表达和编辑一致性存在可直接核查的问题。
这些不是最根本的缺陷,但会影响框架的严谨性:
第 6 页写“六项核心能力”,实际列出五项。
第 9 页公式(10)中,按通常函数复合顺序,会先执行“写作完成后修改”,再执行“撰写”和“准备”,与文字描述的流程相反。
第 23 页对开环与闭环实验管理的定义都强调无人干预,没有清楚交代两者在反馈机制上的区别。
多个目标函数把不同质量指标直接相加,但没有说明量纲、权重和测量程序,因而主要起概念说明作用。
这些问题提示:文章提出的“统一框架”在分类层面有帮助,但还没有发展成能够直接实施和检验的严格方法体系。
最关键的不足,是它尚未建立一条清晰的证据链,把“任务完成、报告生成或基准得分提高”连接到“产生可独立验证、可复现的新知识”。这也是阅读其中任何“自主科研”成果时,最值得继续追问的问题。