上周,我接到一个任务:把一篇42页的英文综述从零到一,从规划到排版,全部搞定。这听起来像是一个需要数周、甚至数月才能完成的苦差事。但这次,我决定换一种方式——不依赖传统的文献管理、写作、图表绘制、排版工具链,而是尝试用一套全新的“AI Agent + 大模型”组合拳,看看能否将这个过程压缩到几天之内,并且保证质量。
这个组合的核心,我称之为“怪兽Agent”和“Codex”。它们不是某个具体的软件,而是一种工作流思路:用一个能自主规划、拆解任务的智能体(Agent)作为大脑,指挥一个或多个擅长代码生成与执行的大模型(如基于Codex的模型)作为手和脚,去完成从文献检索、内容撰写、图表生成到最终排版的所有环节。
很多人听到“AI科研写作”,第一反应是让ChatGPT帮忙润色句子,或者用某个工具自动生成摘要。但这只是最表层的应用。真正的挑战在于,如何让AI理解一个复杂的、结构化的科研任务,并自主地、可靠地执行下去。这不仅仅是“写”,而是“规划-执行-验证-迭代”的完整闭环。我这次实践的核心判断是:AI在科研写作中的真正价值,不在于替代人类思考,而在于将研究者从繁琐、重复、高度格式化的“执行层”劳动中解放出来,让我们能更专注于“策略层”的构思、批判与创新。
下面,我将完整复盘这次从零到一完成42页英文综述的全流程,重点不是展示一个完美的自动化流水线,而是揭示如何将大模型的能力工程化,融入真实的科研工作流,并指出其中每一个环节的取舍、坑点与优化空间。
1. 规划先行:如何让AI理解一篇42页综述的“骨架”
在打开任何一个写作软件之前,最重要的一步是规划。对于AI来说更是如此。你不能直接对它说“写一篇关于XX领域的综述”,那只会得到一篇泛泛而谈、结构混乱的文本。你必须先为它搭建一个清晰、详细、可执行的“任务骨架”。
1.1 从模糊需求到结构化任务树
我的起点是一个宽泛的研究领域。第一步,我使用“怪兽Agent”(这里可以理解为一个具备任务拆解和规划能力的提示工程框架或专用Agent工具)来将这个模糊需求具体化。
我向Agent输入的核心指令不是“写综述”,而是: “作为一位资深领域研究员,你需要系统梳理[XX领域]在过去五年的关键进展。请首先输出一份详细的综述大纲,要求包含:1) 明确的章节划分(如引言、背景、方法分类、应用场景、挑战与未来方向);2) 每个章节下的3-5个核心子议题;3) 每个子议题需要涵盖的3-5篇关键文献(提供文献标题和核心观点简述);4) 预估每个章节的篇幅(占全文百分比)。”
这个指令的关键在于:
- 角色设定:让AI进入“领域专家”状态,而非通用聊天模式。
- 输出结构化:明确要求大纲、子议题、文献、篇幅,这迫使AI进行逻辑组织。
- 可验证:要求提供具体文献信息,这既是内容基础,也是后续验证AI“幻觉”的依据。
Agent接收到指令后,并不会立刻开始“写作”,而是先进行“规划”。它会模拟一个研究者的思考过程:先定义领域边界,再通过内部知识或联网搜索(如果具备该功能)获取领域内的关键议题和代表性工作,最后将这些信息组织成一个树状结构——这就是我们的任务树。
1.2 大纲的迭代与确认:人与AI的协同
Agent生成的第一版大纲通常只是“可用”,而非“优秀”。它可能遗漏某些新兴子领域,或者对某些议题的重要性判断有偏差。
这时,人的介入至关重要。我的做法是:
- 快速审阅:浏览大纲的整体逻辑是否自洽。
- 重点标记:对存疑的子议题、不熟悉的文献进行高亮。
- 指令修正:向Agent提供反馈:“大纲整体不错,但在‘应用场景’部分,请补充工业界在[具体场景]的最新实践案例。另外,将‘挑战’部分细分为技术挑战、数据挑战和伦理挑战。”
这个过程可能需要2-3轮迭代。目标是得到一个你(研究者)认可的结构蓝图。这个蓝图将成为后续所有自动化任务的“宪法”,任何偏离这个结构的写作都会被纠正。
注意:不要追求一次性生成完美大纲。将AI视为一个高效的“初级研究员”,它能快速提供80分的草案,而你作为“导师”,负责将其打磨到95分。这比从零开始自己搭建大纲要高效得多。
1.3 定义清晰的产出物与验收标准
规划阶段的最后一步,是将任务树中的每个叶子节点(最小的子任务)转化为AI可明确执行的指令,并定义产出物的格式和验收标准。
例如,对于子任务“撰写3.1.2节:基于Transformer的XX方法”,给AI的指令不应只是“写这一段”,而应是: “请撰写‘3.1.2 基于Transformer的XX方法’小节,字数约800-1000词。内容需包括:a) 该方法的起源与核心思想(引用文献[文献A]);b) 其相对于传统方法的优势(引用文献[文献B]);c) 两个典型的模型变体(如Model-V1, Model-V2)及其特点;d) 在公开数据集[数据集名]上的典型性能表现。请以学术性、客观的语气写作,避免使用第一人称,并在段落末尾以[END]标记。”
同时,我会定义验收标准:
- 格式:Markdown格式,包含正确的二级、三级标题。
- 内容:覆盖指令中要求的a/b/c/d所有要点。
- 引用:正确提及指定文献,不编造不存在的文献。
- 风格:语言正式、连贯,无明显语法错误。
有了这样的规划,后续的“写作”就变成了对一个个明确小任务的“执行与验收”,极大降低了失控的风险。
2. 写作执行:Codex类模型如何扮演“高产作者”
规划好骨架,接下来就是填充血肉。这里,“Codex”类模型(泛指擅长代码生成、同时文本能力也较强的大模型)将扮演核心角色。我之所以更倾向于使用这类模型,而非纯粹的聊天模型,是因为它们通常在遵循复杂指令、生成结构化内容、保持格式一致性方面表现更稳定。
2.1 分而治之:基于任务树的模块化写作
不要试图让AI一次性写完整个章节甚至全文。这会导致上下文溢出、内容重复或前后矛盾。正确的方法是,依据上一步生成的任务树,将写作任务拆解成数百个独立的、上下文清晰的小任务。
我的工作流是这样的:
- 任务队列:将任务树的所有叶子节点(每个小节)放入一个任务列表。
- 上下文构建:对于每个任务,为AI模型提供精确的上下文。这通常包括:
- 本小节的标题和路径(如
2.3.4)。 - 父章节的摘要(让AI知道当前段落在全文中的位置)。
- 本小节需要涵盖的核心要点列表(来自规划阶段)。
- 必须引用或提及的2-3篇关键文献的精确信息(标题、作者、核心结论)。
- 相邻小节的标题(确保逻辑衔接)。
- 本小节的标题和路径(如
- 模型调用:将构建好的上下文和具体的写作指令,发送给Codex类模型。指令要极其具体,如“根据以上上下文,撰写约600字的段落,重点比较A方法和B方法的优缺点,并以表格形式总结。”
- 产出接收:接收模型生成的文本块。
2.2 提示词工程:从“写句子”到“写学术段落”
让AI写出合格的学术文本,提示词(Prompt)的设计是关键。经过多次实践,我总结出一个有效的学术写作提示词结构:
你是一位在[领域名称]领域有深厚造诣的学术作者,正在撰写一篇综述文章。 当前任务:撰写 **[小节完整标题]**。 背景信息:本节属于 **[父章节标题]**,主要讨论 **[父章节核心主题]**。上一节讨论了 **[上一节主题]**,下一节将讨论 **[下一节主题]**。 核心要求: 1. 内容要点:必须涵盖以下方面:[要点1, 要点2, 要点3]。 2. 关键文献:必须引用并准确阐述以下文献的观点:[文献1信息], [文献2信息]。 3. 写作风格:正式、客观、严谨。使用被动语态和学术用语。避免“我认为”、“我们觉得”等主观表述。 4. 逻辑结构:采用“总-分-总”结构。开头给出本节概述,中间分点论述,结尾进行小结并引出下一节。 5. 格式要求:输出纯文本,无需标题。段落之间空一行。在段落末尾标注[SECTION_END]。 现在,请开始撰写。这个提示词明确了角色、任务、上下文、内容边界、风格和格式,能极大提高产出内容的质量和一致性。
2.3 处理“AI幻觉”与事实核查
这是AI写作中最棘手的部分。模型可能会“自信地”编造不存在的文献、数据、实验结论。我的应对策略是多层防御:
- 源头控制:在规划阶段,就要求Agent提供具体的文献信息。写作时,只让AI围绕这些已知文献展开,而不是让它自由发挥“还有哪些相关研究”。
- 增量验证:每完成一个章节的初稿,就进行快速的事实核查。重点检查:
- 引用的文献是否真实存在?(快速去Google Scholar或领域顶会网站搜索验证)
- 文献中是否真的得出了AI所描述的结论?(核对原文摘要)
- 数据指标(如准确率、效率提升)是否在合理范围内?(根据领域常识判断)
- 交叉验证:对于关键论点,尝试用不同的提示词或让模型换一种方式复述,看结论是否一致。如果不一致,则需要人工介入查证。
- 人工终审:这是不可省略的一环。AI是强大的起草者,但研究者必须是最终的审稿人和定稿人。你需要通读全文,确保逻辑流畅、论据扎实、没有学术硬伤。
核心经验:将AI视为一个有时会“记忆错乱”但文笔极佳的研究助理。你的工作是给它划定明确的资料范围(已知文献),并仔细核对它基于这些资料所做的陈述。永远不要完全相信AI生成的“事实”,只相信它生成的“表述”。
3. 图表与排版:自动化工作流的“临门一脚”
一篇42页的综述,不可能只有文字。图表(Figures & Tables)和专业的排版(Typst/LaTeX)是让论文从“草稿”升级为“成品”的关键。这也是传统流程中最耗时、最需要技巧的环节之一。借助AI,我们可以将这部分工作也极大地自动化。
3.1 用代码生成图表:从描述到SVG/PDF
传统流程:在Excel、Python+Matplotlib或Adobe Illustrator中手动调整图表。 AI辅助流程:用自然语言描述图表需求,由Codex类模型生成绘图代码(如Python的Matplotlib、Plotly代码或LaTeX的TikZ代码),本地执行后得到图表文件。
我的具体做法:
- 描述图表:在写作到需要图表的地方,我会插入一个特殊的注释,例如:
[CHART: A line chart comparing the accuracy trends of Model A, B, and C on Dataset X from 2018 to 2023. The x-axis is "Year", the y-axis is "Accuracy (%)". Use solid, dashed, and dotted lines for A, B, C respectively. Add a legend.] - 模型生成代码:将这段描述连同“请生成绘制该图表的Python Matplotlib代码”的指令,发送给Codex模型。
- 本地运行与微调:在隔离的Python环境中运行生成的代码。大部分情况下,代码可以直接运行并产生可用的图表。如果图表样式不理想(如颜色、字体大小),我可以直接修改描述,让模型调整代码,或者手动微调几行关键参数。
- 输出与集成:将生成的图表保存为高分辨率PDF或SVG格式,放入论文的指定文件夹。
这种方法特别适合生成趋势图、对比柱状图、流程图等结构性强的图表。对于非常复杂或需要定制化设计的图表,AI生成代码+人工调整的效率,依然远高于从零开始手写代码。
3.2 自动化排版:连接内容与格式的“桥梁”
排版是另一个痛点。Word排版费时费力,LaTeX学习曲线陡峭。我的解决方案是:使用基于Markdown的、可由AI辅助生成的排版工具链,如Typst。
Typst是一种新兴的、更简洁的排版语言,其语法比LaTeX更友好,同时又能产出非常专业的PDF。关键一步在于,如何将前面生成的、分散的Markdown文本块,自动组合成符合Typst语法的完整文档。
这里,“怪兽Agent”再次登场。它的任务是:
- 内容聚合:按照最终确认的大纲顺序,将所有写作完成并验证通过的Markdown文本块(每个块都以
[SECTION_END]标记)收集起来。 - 模板填充:将这些内容块,插入到一个预定义的Typst模板文件中。这个模板文件已经设置好了文档类型(
article)、页面边距、字体(如Times New Roman)、标题样式、引用格式(如APA)、页眉页脚等。 - 图表引用集成:自动在文本中相应的
[CHART: ...]注释位置,替换为Typst的图片引入语法(#image("figures/chart1.pdf", width: 70%)),并确保图表文件在正确路径。 - 参考文献生成:根据写作过程中积累的、已验证的文献列表,自动生成BibTeX文件或Typst原生的参考文献条目,并在正文中插入正确的引用标记。
这个流程结束后,我得到的是一个完整的、可编译的Typst源文件。执行一条简单的编译命令(typst compile paper.typ),一份排版精良、格式统一的PDF初稿就诞生了。
3.3 环境搭建与依赖管理
自动化流程依赖于稳定的环境。对于这个项目,我的核心环境是:
- 本地或云开发环境:VS Code + 必要的插件(如Markdown预览、Typst支持)。
- Python环境:用于运行图表生成代码。使用
conda或venv创建独立环境,固定matplotlib,pandas,numpy等库的版本。 - Typst:本地安装Typst编译器。其安装和配置远比完整的LaTeX发行版(如TeX Live)简单快速。
- 版本控制:使用Git管理所有的文本块、图表代码、模板文件。每一步AI生成的内容和代码都进行提交,方便回溯和修改。
这个环境可以在30分钟内搭建完毕,并且具有极好的可复现性。
4. 全流程复盘:效率、质量与人的角色
走完整个流程后,我们来回答最关键的问题:这套方法到底带来了什么?它只是一个酷炫的演示,还是真正具有实践价值的科研生产力变革?
4.1 效率提升的量化感知
与传统手动写作相比,效率的提升是数量级的:
- 规划与大纲:从1-2天缩短到2-3小时(包括迭代时间)。
- 内容撰写:这是最耗时的部分。AI的起草速度极快,但需要配合事实核查。总体而言,将纯粹的“打字+组织语言”时间减少了70%以上。我的时间主要花在了指令优化、事实核查和逻辑润色上。
- 图表生成:从数小时/每个图表,缩短到10-30分钟/每个图表(包括描述、生成代码、微调、导出)。
- 排版:从痛苦地调整Word样式或调试LaTeX错误,缩短为“编译一次,微调全局模板”。排版时间从1-2天减少到1-2小时。
最终,这篇42页的综述,从立项到产生第一版可投稿的PDF,总计用时约5个工作日。其中,纯AI“执行”的时间可能只占一小部分,大部分时间是我在“规划、验证、微调”。但这正是效率的核心——将人的精力从低价值的重复劳动,转向高价值的思考与决策。
4.2 质量把控:AI的边界与人的不可替代性
必须清醒认识到,当前AI的产出质量存在明确天花板:
- 深度与创新性:AI可以出色地总结、归纳、对比已知工作,但它无法提出真正原创性的研究问题、理论框架或颠覆性的见解。这是研究者的核心价值。
- 批判性思维:AI难以对文献进行深刻的批判性分析,指出其方法论缺陷、潜在偏见或结论的局限性。
- 领域直觉:对于领域内哪些工作是真正里程碑式的,哪些是昙花一现,哪些结论可能存在争议,需要研究者基于多年积累的“领域直觉”来判断。
因此,在这套工作流中,人的角色发生了转变,但并未被取代:
- 从“写手”变为“导演与编辑”:你不再需要亲自撰写每一个句子,但你需要构思全局(导演),并对AI生成的每一幕内容进行严格的审核与修正(编辑)。
- 从“操作工”变为“策略家与质检员”:你不再需要亲自操作绘图软件或调试排版命令,但你需要设计图表所要传达的信息(策略),并确保所有事实和数据的准确性(质检)。
4.3 适用边界与启动建议
这套方法并非万能,它有明确的适用边界:
最适合的场景:
- 文献综述、调研报告、技术文档等强结构性、重归纳总结的写作。
- 需要快速产出初稿、搭建项目文档或演示材料。
- 研究者个人或小团队,希望最大化利用时间,聚焦于核心研究问题。
不太适合的场景:
- 需要高度原创性、严密理论推导的学术论文(如提出新定理、新算法)。
- 涉及大量未公开数据、需要复杂实验验证的研究。
- 对文字风格、哲学思辨有极高要求的非技术性写作。
给想尝试者的启动建议:
- 从小处着手:不要一开始就挑战42页的综述。先尝试用AI辅助写一篇2-3页的文献小结或项目报告。
- 工具链准备:先花一点时间搭建好基础环境(Python, VS Code, Typst)。磨刀不误砍柴工。
- 重视规划与提示词:在“规划”和“设计提示词”上多花30%的时间,会在“修改和纠错”上节省300%的时间。
- 建立核查习惯:从一开始就养成对AI产出进行系统性事实核查的习惯。这是保证工作质量的底线。
- 保持耐心与迭代:第一版流程肯定不会完美。把它看作一个需要不断调试和优化的“科研辅助系统”,每次实践后都反思哪个环节可以做得更好。
这次用“怪兽Agent+Codex”完成42页英文综述的实战,与其说是一次自动化写作的胜利,不如说是一次“人机协同”工作流的重塑。它清晰地展示了,当AI负责执行那些定义明确、规则清晰的子任务时,所能释放的巨大生产力。而研究者,则得以站在更高的维度,负责规划、批判、整合与创新——这些才是科研工作中真正无法被自动化、且最具价值的部分。未来,掌握如何高效地指挥和协同这些“数字助理”,或许会成为每一位科研工作者的必备技能。