博士第三年的某个晚上,我在知网里筛完了 60 篇文献,一篇一篇下载 PDF、重命名、拖进 Zotero、补全作者年份、再打开 Word 一条条插入参考文献。等全部弄完,已经是凌晨一点。真正让人崩溃的不是找文献,而是这些“复制、粘贴、拖拽、对齐”的动作重复了几十次之后,我还没开始读任何一篇论文。
后来我把这套流程换成了“Zotero 抓取 + Codex 辅助处理”:知网页面上点一下保存条目,PDF 和元数据自动进库;批量导出的题录交给 Codex 整理成结构化笔记;写综述时让 Codex 按我指定的大纲逐段输出初稿,我再基于原文核对、改写、补充。整个过程从“体力活”变成了“流水线”。
这篇文章就用知网作为例子,把从抓文献、入库、整理题录、到生成初稿的完整工作流拆开讲。重点不只在按钮在哪,而是每一步背后的设计逻辑、容易踩的坑,以及这套方法真正的边界在哪里。
1. 先搞清楚:Zotero 和 Codex 在这个工作流里分别扮演什么角色
很多文章把 Zotero 和 Codex 放在一起讲,好像它们是一个组合套装。其实它们是两个完全不同层级的工具,配合方式也不是“二选一”或者“谁替代谁”。
1.1 两个工具的核心分工
Zotero 的核心价值是管理文献元数据。它解决的是“文献从哪里来、怎么存、怎么引用”的问题,本质上是一个数据库加一个引用引擎。Codex 的核心价值是处理文本和代码任务,它解决的是“内容怎么生成、怎么改写、怎么整理”的问题。
两者的交集出现在一个中间环节:当文献已经入库,但论文还没开始写的时候。
这个阶段有三类任务非常适合交给 Codex:
- 把题录信息转换为结构化笔记。
- 根据若干篇文献的摘要,做主题归类和分组合并。
- 按论文章节结构生成初稿段落。
也就是说,Zotero 负责“输入侧的秩序”,Codex 负责“输出侧的效率”。真正的工作流主链是:知网检索 → Zotero 抓取入库 → 导出题录/做笔记 → Codex 辅助整理与写作 → 回到 Zotero 插入引用。
这里有一个很重要的判断:不要让 Codex 直接接管文献数据库。让它读取数据、生成内容是可以的,但它不应该成为你唯一的内容存储地。Zotero 里那份被插件、翻译器和 Word 插件支撑起来的数据库才是长期资产。
注意:Codex 生成的内容只适合作为初稿素材,不能直接当最终文字。它的价值是把“从空白页到 3000 字草稿”的时间压缩,而不是替代你对文献的理解和判断。
1.2 为什么这套组合值得尝试
过去用 Zotero 的人最容易卡在两个地方:一是浏览器插件在知网等中文数据库上经常抓不到元数据,二是即便抓到了,从文献到论文之间仍然隔着一大片空白。很多人的做法是用 Excel 临时记录笔记,或者开一个巨大的 Word 文档手动整理。
Codex 的价值正好补在第二个空档上。它有足够强的长文本理解能力,可以把十几条题录信息一次读进去,按你给定的规则生成摘要对比、研究脉络梳理甚至综述草稿。这比从前“读完一篇写一段笔记”的方式更适合做快速扫描和初稿铺路。
所以这套方案真正的意义不是“用 AI 写论文”,而是把文献调研过程中的重复劳动剥离出来,让人把精力集中在筛选、判断和修改上。
2. 知网文献抓取:为什么点一下没反应,以及正确的解决路径
Zotero 抓取网页文献依赖的并不是浏览器插件本身的“识别能力”,而是一套名为 Translator(翻译器)的抓取规则。每个网站对应一个或多个翻译器文件,插件的本质是调用这些翻译器去解析网页中的元数据。
2.1 最常见的失败原因
在知网场景下,抓取失败或者“保存此条目时发生错误”的原因通常是这几类:
- 翻译器版本过旧,知网改版后旧规则不再匹配。
- 浏览器插件和 Zotero 客户端之间的连接中断。
- 网页本身需要登录,或者页面结构是动态加载的,翻译器没拿到完整数据。
- 浏览器插件权限不足,无法访问当前标签页的内容。
其中第一类最隐蔽。Zotero 内置的翻译器是定期更新的,但更新节奏不一定赶得上知网的改版节奏。碰到这种情况,你可能会发现其他网站都能正常抓取,只有知网报错。这时候去 Zotero 翻译器仓库拉取最新版中文网站翻译器,通常能解决大部分问题。
2.2 一个可复用的排查顺序
我建议按下面这个顺序排查,而不是先重装插件或者重装 Zotero:
1. 确认 Zotero 客户端处于打开状态。 2. 确认浏览器插件图标能正常显示当前页面的文献类型图标。 3. 打开浏览器开发者工具,查看插件请求是否有报错。 4. 检查 Zotero 翻译器版本是否为最新。 5. 换用 Zotero 内置的“通过标识符添加条目”,用 DOI 或 PMID 导入。 6. 最后再考虑重置插件或更新浏览器。如果翻译器版本落后,处理方法也很简单:
# 访问 Zotero translators 官方 GitHub 仓库 # 下载最新版 zh-CN.js 或其他中文网站翻译器文件 # 放入 Zotero 数据目录的 translators 文件夹 # 重启 Zotero 后测试注意:手动替换翻译器文件前,先备份原文件。虽然这是常规操作,但版本不对可能会导致所有网站都无法抓取。
2.3 知网抓不到的备份方案
即便翻译器是最新的,知网某些页面依然可能抓不到完整元数据。比如学位论文详情页、某些专题库页面、或者旧版链接。我的建议是准备一套离线导入方案,不要和网页死磕:
- 在知网详情页找到“导出与分析”按钮。
- 选择导出格式为“Refworks”或“EndNote”,两种格式 Zotero 都能识别。
- 下载文件后用 Zotero 的“文件导入”功能导入。
这套方法不需要浏览器插件,也不依赖网页翻译器,是最稳定的备份路径。缺点是比直接点击多两步操作,但宁可多花三十秒,也不要反复试错。
2.4 关于“只能抓到 PDF 没有元数据”的情况
很多人在知网上下载了 PDF 后,拖进 Zotero 发现只生成了一个空条目。这说明 PDF 里的元数据信息无法被 Zotero 识别,或者 PDF 本身缺少必要的元数据标记。处理方式有三个方向:
- 用 Zotero 的“查找可用 PDF 元数据”功能,它会尝试通过 DOI 或标题匹配补齐信息。
- 用“通过标识符添加条目”手动补录,输入 DOI 或标题让 Zotero 自动拉取信息。
- 如果以上都不行,就手动补齐作者、年份、标题、期刊和页码。
这里要特别提醒:不要指望每个 PDF 都能自动变成完美条目。中文文献的 PDF 元数据质量参差不齐,遇到问题老老实实用导出文件导入或者手动补录,反而更快。
3. Codex 的正确打开方式:不是让它替你读文献,而是让它替你处理“处理文献的过程”
Codex 在不同语境下指的东西不太一样。在本文的工作流里,Codex 指的是 OpenAI 提供的命令行 AI 编程与任务代理工具,它可以在终端里运行,通过自然语言指令完成文件和代码处理任务。虽然它主要面向编程,但它的文本处理能力完全可以用于科研文献整理。
3.1 先解决环境和登录问题
从常见使用情况看,Codex 的安装和登录问题主要集中在这些节点:
# npm 安装(Node.js 环境) npm install -g @openai/codex # 登录 codex login # 查看当前配置 codex status不少人在运行codex命令时遇到cc switch local proxy failed while handling codex endpoint /responses或类似报错,这类问题通常不是 Codex 本身坏了,而是本地代理设置与 API 端点冲突。排查顺序是:
- 检查系统或终端是否设置了 HTTP 代理环境变量。
- 检查 Codex 配置文件中的
model_provider和base_url是否指向了非官方端点。 - 暂时关闭代理或重置配置后重试。
- 如果配置过第三方模型服务,先恢复默认配置。
这个排查逻辑其实适用于所有 AI 命令行工具:先确认网络链路,再确认配置指向,最后确认认证是否有效。
3.2 在科研场景里,Codex 最适合的三种用法
第一种:批量整理题录数据。
比如你把 Zotero 导出的 CSV 文件丢给 Codex,让它把标题、作者、年份、期刊、摘要整理成一个 Markdown 表格,按研究方向打标签,或者按发表时间排序。这在做大规模文献筛选时非常高效。
第二种:生成文献对比笔记。
你可以把 5 到 10 篇文献的题录和摘要放进去,要求 Codex 输出一个对比表格,包含研究问题、方法、数据、结论和局限。这样你能快速判断哪些文献值得精读,而不是每篇都从头读。
第三种:辅助综述写作。
给 Codex 一个大纲,再给若干条文献摘要或你的阅读笔记,让它按照大纲生成初稿。这不是让 AI 编造内容,而是让 AI 基于你提供的文献信息完成“组织语言”的工作。它写出来的内容不一定是最终结果,但能提供非常好的起点。
3.3 和 Zotero 的连接方式
Codex 本身不直接连接 Zotero,但它可以读取 Zotero 导出的文件。常见做法是:
Zotero 导出 → 得到 CSV/BibTeX/JSON 文件 → 用 Codex 读取并处理 → 输出整理后的笔记 → 重新放入 Zotero 或 Markdown 笔记系统你不需要安装什么“Zotero-Codex 官方插件”,因为这类跨工具插件往往很脆弱。更稳定的方式是通过中间文件完成信息交换。这种“不集成但互通”的思路,在工具选型上往往比追求一个插件解决所有问题更可靠。
注意:不要让 Codex 直接修改 Zotero 的本地数据库文件。数据库损坏的风险不值得冒。正确的姿势是把文件导入、导出作为数据交换边界。
4. 把整条链路跑通:从知网检索到生成论文初稿的完整流程
下面用一个实际场景完整演示整条工作流。假设场景是:需要写一篇关于“数字鸿沟与老年人信息技术使用”的综述,目标是从知网找 20 篇左右核心文献,并在 Zotero 里完成管理,然后用 Codex 辅助搭出初稿框架和部分段落。
4.1 第一阶段:知网检索与 Zotero 抓取
- 打开知网,输入检索词,比如“老年人 数字鸿沟 信息技术”。
- 按相关性或引用量排序,勾选需要的文献。
- 点击“导出与分析”,选择“Refworks”格式,下载文件。
- 打开 Zotero,选择目标分类文件夹。
- 点击“文件 → 导入”,选择刚才下载的文件。
- 确认导入结果,检查作者、年份、期刊、摘要是否完整。
这个过程比逐篇点击保存条目慢一点点,但更稳定,适用于批量导入。如果你只需要导入三五篇,直接用浏览器插件点击保存更高效。
4.2 第二阶段:整理题录与生成文献笔记
这一步是 Zotero 和 Codex 交接的节点。建议按下面的模式进行:
- 在 Zotero 里选中需要整理的条目。
- 右键“导出条目”,格式选择“CSV”,字段勾选标题、作者、年份、期刊、摘要。
- 打开终端,进入导出文件所在目录。
- 用 Codex 读取 CSV,并给出整理指令。
一个可以直接参考的指令模板:
读取当前目录下的 literature.csv 文件。 请按以下要求处理: 1. 将每条文献按主题分成 3 到 4 个研究方向。 2. 为每个研究方向写一段 200 字左右的总结,引用文献的作者和年份。 3. 用 Markdown 表格输出每个方向的文献清单,包含作者、年份、标题、期刊。 4. 最后列出 5 篇最值得精读的文献,并说明理由。这个做法的好处是,Codex 能同时处理几十条题录信息,输出的结果可以直接作为综述第一章的素材。如果一个人手动做,这个工作量至少要半天。
4.3 第三阶段:生成综述初稿
拿到整理后的笔记后,进入写作阶段。这个阶段 Codex 的角色是“分章节写作助手”,而不是“一次性写完整篇论文”。
建议把整篇综述拆成五到六个章节,每个章节单独生成:
章节 1:研究背景与概念界定 输入材料:研究方向的背景总结、3-5 篇高相关文献摘要 生成目标:1000 字左右,说明研究对象和核心概念 章节 2:国内外研究现状 输入材料:主题分组后的文献清单、每组的总结段落 生成目标:1500 字左右,按主题梳理已有研究 章节 3:研究方法与数据分析(如果做实证) 输入材料:变量说明、数据来源、方法思路 生成目标:按学术规范写出方法部分 章节 4:结论与未来展望 输入材料:前面的总结、当前研究的不足 生成目标:500 字左右的结论段写每一章时,都要把原文材料给 Codex,而不是让它凭知识库“自由发挥”。这样才能保证引用有出处,内容和个人研究方向的契合度也更高。
4.4 一个具体的 Prompt 模式
这里给出一个可以直接复制的提示词模板:
我正在撰写一篇论文,论文主题是:{你的主题}。 这是本阶段的写作任务:{章节标题}。 以下是相关文献的题录和摘要信息: {粘贴 Zotero 导出的题录,或粘贴 Codex 整理的文献笔记} 请按以下要求写作: 1. 严格基于我提供的文献信息,不要编造文献内容。 2. 段落之间要有逻辑衔接,不要写成条目堆砌。 3. 引用时用“作者(年份)”格式标注。 4. 语言风格为学术论文风格,避免口语化。 5. 输出约 {字数} 字。这个模板的核心是“严格基于我提供的文献信息”这个约束。没有这个约束,Codex 很可能会写出看似流畅但引用完全不存在的段落,这类内容在学术写作里风险极高。
4.5 回到 Zotero 完成引用
初稿生成后,正式写作阶段还是在 Word 或 Markdown 编辑器里完成。这时 Zotero 的 Word 插件就派上用场了:
- 在 Word 里点击 Zotero 插件图标。
- 选择“Add/Edit Citation”。
- 搜索你实际引用的文献并插入。
- 文章写完后选择“Add/Edit Bibliography”,自动生成参考文献列表。
这里有一个很多人忽略的细节:Codex 生成初稿时文内引用的文献,和最终 Zotero 里真实存在的文献,必须一一对应。如果用了不存在的引用,要么删掉,要么替换成真实文献。绝对不能为了保留 AI 写出来的漂亮句子而留下假引用。
5. 从工具到工作流:真正值得长期投入的是什么
整套流程跑通之后,你会发现一个事实:工具本身并不神奇,真正提升效率的是“流程固定化”。
5.1 前几次使用会遇到的真实问题
按经验来看,新手第一次跑这套流程时,最常遇到的是这些情况:
- Zotero 里导出的 CSV 字段是英文,Codex 可能读不出“摘要”列。
- 中文文献的 PDF 无法识别元数据,需要手动补录。
- Codex 生成的内容引用格式不稳定,有时有年份,有时没有。
- 大量文献一次性丢给 Codex 时,输出可能遗漏部分文献。
这些问题都不是工具缺陷,而是流程设计中需要处理的边界条件。对应的解决方案分别是:
- 导出时先改字段名称,用“title, author, year, journal, abstract”这类英文名。
- 用导出文件导入而不是直接拖 PDF。
- 在 Prompt 里指名要求“每一条引用都必须包含作者和年份”。
- 把几十条题录分批处理,每批控制在 10 条左右。
5.2 这个方法适合谁,不适合谁
适合这套方法的人有三个特征:
- 需要处理大量中文文献,尤其是知网来源。
- 写作前有整理文献笔记、梳理研究现状的需求。
- 愿意花几个小时调试流程,换来未来每次写作都省下数天时间。
不适合这套方法的人也有三个特征:
- 只是偶尔写一篇小论文,文献量少于十篇,手动处理反而更快。
- 完全不检查 AI 生成内容,准备直接复制提交。
- 对写作质量有非常高要求,且愿意逐字打磨,AI 初稿反而会干扰个人思路。
5.3 长期使用需要补上的工程化能力
如果这套流程要长期用,我建议你在第一次跑通之后,顺手把以下能力补上:
- 统一的导出模板:固定 Zotero 导出的字段和格式,避免每次调整。
- 一份常用的 Prompt 模板库:按“文献整理”“摘要对比”“章节写作”“研究现状总结”分类保存。
- 一个笔记归档结构:Codex 生成的内容统一放在固定目录,按时间和主题命名,方便回溯。
- 定期核对引用:每次完成初稿后,用 Zotero 的“重复条目检测”和 Word 插件的“刷新引用”,确认引用和题录一一对应。
这四项看起来不起眼,但决定这套方案是“一次性体验”还是“长期生产力工具”。
5.4 始终记住的边界
这套工作流再怎么优化,也改变不了一个事实:读文献、判断研究价值、形成自己的观点,这些环节必须由人来完成。Codex 可以帮助你更快地把文献变成结构化的素材,但它无法告诉你哪篇文献真正改变了你的研究思路。
把 AI 当成一个能力很强但需要监督的研究助理,而不是替代思考的写作机器,这套方法就能成为长期受益的科研基础设施。
6. 最后的经验之谈
回头看,这套工作流的核心收获可以浓缩成三点:
第一,先保证数据的结构和完整性,再谈 AI 辅助写作。Zotero 里的元数据是后续所有处理的地基,地基不稳,Codex 给出来的内容质量也无法保证。
第二,用中间文件连接工具,而不是追求一个万能插件。Zotero 导出、Codex 读取、再导回或归档,这种文件级的信息交换方式更稳定、更容易排查问题,也更容易替换工具。
第三,把 AI 放在“生成素材”的位置,而不是“生成结论”的位置。论文的判断、论证、创新点只能来自人的思考。AI 真正改变的是处理文献的速度和整理信息的效率。
如果你现在正准备用这套方法,我的建议很简单:先跑一遍最小流程,就拿五篇知网文献从抓取到生成一段 500 字的综述初稿。不用追求一步到位。等你体会到“曾经一晚上的工作量,现在半小时就能完成初稿”的变化后,自然会知道下一步该往哪里细化。