Wenyi全书理解机制揭秘:预扫(Prescan)如何让AI读懂整本小说
【免费下载链接】wenyi将被语言阻隔的作品,带到读者的语言中。Bringing literature into your language.项目地址: https://gitcode.com/BigDawnGhost/wenyi
Wenyi 是一款开源的 AI 小说翻译工具,它的核心卖点不是"逐段翻译",而是全书理解机制:在动笔之前,先通过一个名为预扫(Prescan)的阶段让 AI 通读整本小说,生成每章摘要(Chapter Digest)和全书梗概(Book Synopsis),再按章翻译。本文将为你拆解这套机制的原理、配置方法与实战效果,帮你理解长篇小说 AI 翻译质量背后的关键。
为什么整本小说翻译对 AI 是个难题
大语言模型都有上下文长度限制,而一本几十上百万字的小说远超这个上限。如果只让 AI 看眼前这一段就动手翻译,容易出现三类问题:
- 人名、称谓前后不一致:同一角色在不同章节被译成不同名字;
- 伏笔与呼应被破坏:后文才揭晓的身份、反转,在前文翻译时无法把握分寸;
- 语气与风格漂移:开篇和结尾像两个不同的人写的。
Wenyi 的解法很直观:先让 AI 用低成本方式"读完"全书,把理解结果固化成稳定的文本,再作为翻译上下文注入每一批翻译请求。
预扫(Prescan)如何工作:两步走的全书理解
预扫的完整实现位于 agents/synopsis.py,它由Synopsizer代理完成两个步骤。
第一步:并行生成每章摘要(Chapter Digest)
预扫阶段会遍历每一章源文,调用低成本(fast tier)模型为每章写一份限定长度的摘要。其提示词模板见 chapter_digest_system.txt,要求覆盖:
- 关键剧情进展与转折点;
- 出场人物及其处境;
- 重要信息与伏笔;
- 角色名统一以目标语言表达。
由于各章相互独立,这一步可以并行执行。并发度由 config.yaml 中的prescan_concurrency控制(默认为 4):
prescan: true prescan_concurrency: 4 # 并行生成章节摘要的worker数第二步:Map-Reduce 合并出全书梗概
几十上百份章节摘要如何合成一份不超限的全书梗概?Synopsizer.book_synopsis采用了经典的Map-Reduce 分组合并策略:按 12000 字符预算把摘要分组,每组合并成更高层的梗概,若结果仍有多组则继续递归合并,直到只剩一份为止。提示词见 book_synopsis_system.txt,要求最终梗概涵盖主线与结局、核心人物弧光、世界观、揭秘与伏笔、整体基调——并统一使用目标语言的角色名。
这套逻辑保证无论书多长,喂给翻译器的全书梗概长度始终可控。
理解结果如何注入翻译上下文
这是预扫真正产生价值的地方。每个翻译批次的提示词都遵循**"稳定信息在前"**的拼装顺序:
风格指引 → 全书梗概 → 当前章摘要 → 相关术语表 → 源语言注释 → 已翻译的近文上下文 → 待译源文 → 后一段源文
好处有两个:
- 早章也享受"剧透":翻译第一章时,AI 已经知道主角的结局走向,能更准确地拿捏语气与称谓;
- 前缀稳定可复用缓存:全书梗概和章摘要作为固定全局前缀,配合提示词缓存(Cache Reuse),显著降低重复计费——这是用廉价模型预扫"换"昂贵模型省钱的巧妙设计。
预扫与翻译的整体流程可以在 docs/pipeline.md 的流程图里看到,中文版见 docs/zh/pipeline.md。
断点续传:预扫是幂等的
Wenyi 的预扫结果直接持久化到每章的meta["source_digest"]字段与全书分析结果中(写入逻辑见 pipeline/preparation.py)。这意味着:
- 中途中断后重跑,已完成的章节摘要会被复用,不会重复花钱;
- 只翻译缺失部分,已完成的批次自动跳过。
在 Web 端查看预扫成果
翻译完成后,你可以直接在 Web 端核对每章的译文质量,并查看双语对照效果。校对工作台位于 proofreading 功能目录,界面长这样:
注意事项:字幕(SRT)不走预扫
需要说明的是,预扫属于书籍工作流(Orchestrator)。.srt字幕文件走一条轻量并行路径,没有全书预扫、术语表与 Review 阶段——因为字幕本身不存在"全书上下文"问题。详见 docs/usage.md。
总结:预扫的三个核心价值
| 价值 | 说明 |
|---|---|
| 一致性 | 角色名、称谓、伏笔贯穿全书 |
| 省成本 | 廉价模型先读全书,昂贵模型只做翻译,且前缀可缓存 |
| 可恢复 | 摘要幂等持久化,断点续传不重复计费 |
如果你想深入了解配置项prescan与prescan_concurrency的完整说明,可以查看 docs/zh/configuration.md。这套"先理解、后翻译"的全书理解机制,正是 Wenyi 让 AI 真正"读懂"整本小说的关键。
【免费下载链接】wenyi将被语言阻隔的作品,带到读者的语言中。Bringing literature into your language.项目地址: https://gitcode.com/BigDawnGhost/wenyi
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考