news 2026/10/2 6:55:23

Wenyi全书理解机制揭秘:预扫(Prescan)如何让AI读懂整本小说

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Wenyi全书理解机制揭秘:预扫(Prescan)如何让AI读懂整本小说

Wenyi全书理解机制揭秘:预扫(Prescan)如何让AI读懂整本小说

【免费下载链接】wenyi将被语言阻隔的作品,带到读者的语言中。Bringing literature into your language.项目地址: https://gitcode.com/BigDawnGhost/wenyi

Wenyi 是一款开源的 AI 小说翻译工具,它的核心卖点不是"逐段翻译",而是全书理解机制:在动笔之前,先通过一个名为预扫(Prescan)的阶段让 AI 通读整本小说,生成每章摘要(Chapter Digest)和全书梗概(Book Synopsis),再按章翻译。本文将为你拆解这套机制的原理、配置方法与实战效果,帮你理解长篇小说 AI 翻译质量背后的关键。

为什么整本小说翻译对 AI 是个难题

大语言模型都有上下文长度限制,而一本几十上百万字的小说远超这个上限。如果只让 AI 看眼前这一段就动手翻译,容易出现三类问题:

  • 人名、称谓前后不一致:同一角色在不同章节被译成不同名字;
  • 伏笔与呼应被破坏:后文才揭晓的身份、反转,在前文翻译时无法把握分寸;
  • 语气与风格漂移:开篇和结尾像两个不同的人写的。

Wenyi 的解法很直观:先让 AI 用低成本方式"读完"全书,把理解结果固化成稳定的文本,再作为翻译上下文注入每一批翻译请求。

预扫(Prescan)如何工作:两步走的全书理解

预扫的完整实现位于 agents/synopsis.py,它由Synopsizer代理完成两个步骤。

第一步:并行生成每章摘要(Chapter Digest)

预扫阶段会遍历每一章源文,调用低成本(fast tier)模型为每章写一份限定长度的摘要。其提示词模板见 chapter_digest_system.txt,要求覆盖:

  • 关键剧情进展与转折点;
  • 出场人物及其处境;
  • 重要信息与伏笔;
  • 角色名统一以目标语言表达。

由于各章相互独立,这一步可以并行执行。并发度由 config.yaml 中的prescan_concurrency控制(默认为 4):

prescan: true prescan_concurrency: 4 # 并行生成章节摘要的worker数

第二步:Map-Reduce 合并出全书梗概

几十上百份章节摘要如何合成一份不超限的全书梗概?Synopsizer.book_synopsis采用了经典的Map-Reduce 分组合并策略:按 12000 字符预算把摘要分组,每组合并成更高层的梗概,若结果仍有多组则继续递归合并,直到只剩一份为止。提示词见 book_synopsis_system.txt,要求最终梗概涵盖主线与结局、核心人物弧光、世界观、揭秘与伏笔、整体基调——并统一使用目标语言的角色名。

这套逻辑保证无论书多长,喂给翻译器的全书梗概长度始终可控。

理解结果如何注入翻译上下文

这是预扫真正产生价值的地方。每个翻译批次的提示词都遵循**"稳定信息在前"**的拼装顺序:

风格指引 → 全书梗概 → 当前章摘要 → 相关术语表 → 源语言注释 → 已翻译的近文上下文 → 待译源文 → 后一段源文

好处有两个:

  1. 早章也享受"剧透":翻译第一章时,AI 已经知道主角的结局走向,能更准确地拿捏语气与称谓;
  2. 前缀稳定可复用缓存:全书梗概和章摘要作为固定全局前缀,配合提示词缓存(Cache Reuse),显著降低重复计费——这是用廉价模型预扫"换"昂贵模型省钱的巧妙设计。

预扫与翻译的整体流程可以在 docs/pipeline.md 的流程图里看到,中文版见 docs/zh/pipeline.md。

断点续传:预扫是幂等的

Wenyi 的预扫结果直接持久化到每章的meta["source_digest"]字段与全书分析结果中(写入逻辑见 pipeline/preparation.py)。这意味着:

  • 中途中断后重跑,已完成的章节摘要会被复用,不会重复花钱;
  • 只翻译缺失部分,已完成的批次自动跳过。

在 Web 端查看预扫成果

翻译完成后,你可以直接在 Web 端核对每章的译文质量,并查看双语对照效果。校对工作台位于 proofreading 功能目录,界面长这样:

注意事项:字幕(SRT)不走预扫

需要说明的是,预扫属于书籍工作流(Orchestrator)。.srt字幕文件走一条轻量并行路径,没有全书预扫、术语表与 Review 阶段——因为字幕本身不存在"全书上下文"问题。详见 docs/usage.md。

总结:预扫的三个核心价值

价值说明
一致性角色名、称谓、伏笔贯穿全书
省成本廉价模型先读全书,昂贵模型只做翻译,且前缀可缓存
可恢复摘要幂等持久化,断点续传不重复计费

如果你想深入了解配置项prescan与prescan_concurrency的完整说明,可以查看 docs/zh/configuration.md。这套"先理解、后翻译"的全书理解机制,正是 Wenyi 让 AI 真正"读懂"整本小说的关键。

【免费下载链接】wenyi将被语言阻隔的作品,带到读者的语言中。Bringing literature into your language.项目地址: https://gitcode.com/BigDawnGhost/wenyi

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/10/2 6:55:21

C++ 第 16 课:指针、引用、值传递三者彻底对比

上一课标准答案:*p 10最后 x 20&x 表示“取得变量 x 的内存地址”;*p 表示“沿着指针 p 保存的地址找到那个变量,并访问它的值”最后 x 50你上一课最核心的关系是:int x 5; int* p &x;对应:x → 5 &…

作者头像 李华
网站建设 2026/10/2 6:55:15

SpringBoot+Vue车辆管理系统:从源码到部署的毕设全攻略

手头这套《SpringBootVue 车辆管理系统平台》是一个很典型的Java Web毕业设计源码包,我经常被读者问到“完整项目源码SQL脚本接口文档”这种搭配到底怎么用,其实里面包含了后端SpringBoot工程、前端Vue页面、数据库初始化脚本和接口说明文档四块内容&…

作者头像 李华
网站建设 2026/10/2 6:54:18

病毒寄生、自指崩溃与经验实体绑定:大语言模型“波话连篇”的逻辑根源、学术分赃机制与价值AI重构

论符号宿命、认知置换与学术特权分赃:大语言模型中的 “波普尔病毒” 现象、自指双重死局与物理因果绑定的重构摘要当前全球大语言模型(LLMs)的迭代狂热正处于技术神话与资本叙事的交汇巅峰。然而,基于下一词预测(Next…

作者头像 李华
网站建设 2026/10/2 6:51:35

AI开发实战:OpenClaw小龙虾图形化界面安装,读取腾讯文档写周报

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华