wenyi文译DOCX翻译:保留Word标题、表格与样式,一键产出专业译稿
【免费下载链接】wenyi将被语言阻隔的作品,带到读者的语言中。Bringing literature into your language.项目地址: https://gitcode.com/gh_mirrors/we/wenyi
如果你需要翻译一份 Word 文档(.docx),并且希望译文保留原有的标题层级、表格结构和字体样式,而不是退化成纯文本——那么wenyi 文译的 DOCX 翻译正是为此设计。它是一款开源 AI 长文写作翻译工具,一条命令即可完成解析、翻译、质检与排版还原,直接产出保留 Word 版式的.zh.docx专业译稿。
📦 一键完成 DOCX 翻译:从 Word 文档到译稿
Wenyi 文译的 DOCX 翻译与 EPUB 翻译共用同一套全书翻译引擎。你只需把文件交给它:
# 安装并运行(需 Python 3.10+ 和 uv) git clone https://gitcode.com/gh_mirrors/we/wenyi cd wenyi uv sync export DEEPSEEK_API_KEY=sk-... # 设置你的模型密钥 # 一键翻译 Word 文档,默认输出 output/<书名>.zh.docx uv run wenyi translate book.docx # 可选:产出双语版 / 换成其他格式输出 uv run wenyi translate book.docx --bilingual uv run wenyi translate book.docx --format epub三个值得注意的点:
- 默认输出就是 Word:
.docx输入默认导出output/<书名>.zh.docx,无需额外指定格式; - 同一命令即可续传:每个翻译批次都会即时写入状态目录,中途断网、断电后再次执行同一命令,会自动跳过已完成部分继续翻译,不重复计费;
- 完整流水线可用:术语表、润色、全书审校默认开启,也可用
--no-polish/--no-review单独关闭以降低成本。
✅ 它保留了什么:DOCX 结构与样式保全清单
这是 wenyi 文译 DOCX 翻译最核心的能力——不是"先翻译文字再重排格式",而是在解析阶段就把版式信息记录下来,翻译完成后逐项还原:
| 保留对象 | 处理方式 |
|---|---|
| 标题层级 | 识别Heading 1–9样式与大纲级别,一级标题自动切分为章,输出文档保留 Word"导航窗格"目录 |
| 表格 | 简单表格按单元格逐格重建,行列位置与格内样式保留(v1 暂不支持合并单元格 / 嵌套表格) |
| 列表编号 | Word 自动列表重建为 List Number / List Bullet 分组并按原列表续接;正文已带"1."前缀的目录行不会二次编号 |
| 字符样式 | 加粗、斜体、下划线、颜色、字号在译文对应位置保留 |
| 段落样式 | 对齐方式、段落底纹(背景色)保留 |
其中混合样式场景处理得尤为细致:当一段文字同时存在加粗、变色和普通文字时,Wenyi 在解析阶段给每个有意义的样式区间打上位置标记(与 EPUB 脚注定位同一套机制);翻译完成后逐个定位,样式属性继承自源文档区间;单个区间定位失败时会按比例回退,而不会丢弃整段。纯字体/字号变化被视为噪声,不做对齐处理,避免无效的模型调用。
另外两个默认优化:
- 译文中文统一使用宋体,而原文(双语版中的源文)不强制改宋体;
- 标题默认主题蓝会被中和,除非源文档显式设置了颜色——译文观感更干净专业。
完整实现可参考 Word 解析器 docx_reader.py 与导出端 docx_writer.py。
🔍 质量保障:术语表、润色、全书审校与人工校阅
DOCX 翻译复用全书流水线,意味着它同样享有完整的质量保障:
- 整书预扫描:先逐章生成摘要与全书梗概,每个翻译批次都能拿到"最新术语表 + 相邻上下文",人名与术语跨章保持一致;
- 实时术语表:翻译推进中持续抽取人名、地名、术语,并检测翻译冲突,可用
uv run wenyi glossary list book.docx随时检查; - 全书审校 + 可选自动修复:全书翻译完成后,AI 用最终术语表再审一遍;开启
--autofix可自动应用已确认的修复,且应用后会同步刷新 DOCX 样式偏移,格式不会错位; - Web 工作台人工校阅:打开 Web 界面可逐段编辑译文、对照原文、查看改动记录,页面每 3 秒自动刷新最新内容。
如果还想产出一份供审读或交付的双语版,加上--bilingual即可得到原文 + 译文的对照文档(双语排版效果以 EPUB 双语版为例):
⚙️ DOCX 翻译实用技巧
- 先试翻一章:
uv run wenyi translate book.docx --chapter 3,确认质量后再继续全书; - 阶段独立执行:
wenyi review book.docx单独复审、wenyi assemble book.docx不调用模型直接重新导出、wenyi status book.docx查看进度与累计用时; - 状态透明:全部状态存放在
state/<书名>/targets/<目标语言>/下(章节 JSON、SQLite 术语表、usage.json用量、报告),出问题可追溯、可随时续传; - 换格式输出:
--format epub|txt|html|markdown|pdf对所有书籍输入有效;.docx输入时默认走 docx 导出,显式指定则优先。
📚 相关文档与源码位置
| 资料 | 路径 |
|---|---|
| DOCX 使用文档(EN) | docs/usage.md |
| 使用文档(简体中文) | docs/zh/usage.md |
| 翻译流水线说明 | docs/pipeline.md |
| Word 文档解析器(标题/表格/样式) | packages/core/wenyi_core/ingest/docx_reader.py |
| DOCX 导出写入器 | packages/core/wenyi_core/assemble/docx_writer.py |
| 样式还原与输出字体设置 | packages/core/wenyi_core/assemble/docx_styles.py |
| 列表前缀检测工具 | packages/core/wenyi_core/document_styles/docx.py |
| 默认配置文件 | config.yaml |
一句话总结:wenyi 文译把 Word 文档当作一本"书"来翻译——一条命令产出保留标题、表格与样式的专业译稿,背后是术语表、全书审校与断点续传的完整工程流水线,适合小说、报告与商业文档等正式翻译场景。
【免费下载链接】wenyi将被语言阻隔的作品,带到读者的语言中。Bringing literature into your language.项目地址: https://gitcode.com/gh_mirrors/we/wenyi
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考