团队处理海外白皮书、用户手册或招投标资料时,真正容易出问题的往往不是“能不能翻译”,而是文件越来越多后,没人能确认哪一份才是最终版本。
常见文件名包括:
final.pdf final-new.pdf final-new-2.pdf 最终版.pdf 最终版-真的最终.pdf当原文、初稿、校对稿和交付稿混在同一个目录里,即使翻译内容没有问题,也可能发错文件。
一、先设计统一目录
建议按照项目、语言和处理阶段组织文件:
pdf-translation-project/ ├── 01-source/ ├── 02-translated-draft/ ├── 03-reviewed/ ├── 04-delivery/ └── 05-checksum/各目录职责如下:
01-source:只保存原始文件,不直接修改;02-translated-draft:保存机器翻译或人工初稿;03-reviewed:保存经过术语、数字和排版检查的版本;04-delivery:只放允许对外交付的文件;05-checksum:保存校验值和处理记录。
二、文件名要能回答四个问题
一个合格文件名应该说明:
它是什么文档;
使用什么语言;
处于哪个版本;
当前是什么状态。
例如:
sdk-guide_en_source_v01.pdf sdk-guide_zh-cn_draft_v01.pdf sdk-guide_zh-cn_reviewed_v02.pdf sdk-guide_zh-cn_delivery_v03.pdf不要用“新”“最新”“最终”等难以排序的文字代替版本号。
三、记录文件哈希,避免原文被悄悄替换
同名文件不一定内容相同。可以使用SHA-256生成校验值。
Python示例:
from pathlib import Path import hashlib def sha256_file(path): hasher = hashlib.sha256() with open(path, "rb") as file: while chunk := file.read(1024 * 1024): hasher.update(chunk) return hasher.hexdigest() pdf_path = Path("01-source/sdk-guide_en_source_v01.pdf") print(sha256_file(pdf_path))将结果保存到清单:
filename,sha256,status sdk-guide_en_source_v01.pdf,8c41...f290,source sdk-guide_zh-cn_delivery_v03.pdf,b320...2a18,delivery如果文件内容发生变化,哈希值也会改变。这样可以判断团队成员处理的是否为同一份原文。
四、长PDF可以先拆分,但要保留页码关系
当一份PDF需要由多人分别校对时,可以按章节拆分。拆分后建议在文件名中记录原始页码:
manual_part01_p001-p025.pdf manual_part02_p026-p052.pdf manual_part03_p053-p081.pdf如果需要按页分派任务,可以使用 PDF拆分 工具生成分段文件。拆分前应先备份原文,拆分后还要检查:
总页数是否一致;
是否存在重复页;
是否遗漏跨页表格;
目录中的页码是否仍可对应;
页眉和章节标题是否完整。
五、建立处理清单
多人协作时,不建议只靠聊天消息汇报进度。可以使用CSV或表格记录:
part,owner,status,term_check,number_check,layout_check part01,user_a,reviewed,yes,yes,yes part02,user_b,in_progress,no,yes,no part03,user_c,pending,no,no,no状态可以统一为:
pending in_progress reviewed approved delivered不要让不同成员自行创造“已完成”“差不多”“待确认”等状态,否则后续很难自动统计。
六、合并交付前做哪些检查?
分段文件合并后,至少检查以下内容:
页面连续性
确认原始第25页后面确实是第26页,不能只看新文件中的PDF页码。
书签和目录
拆分或合并可能影响书签。交付前应确认目录跳转是否有效。
字体和字符
检查是否出现方框、乱码或字体替换,尤其注意公式和特殊符号。
文件体积
如果合并后的文件异常增大,可能是图片被重复编码或页面被高分辨率栅格化。
最终哈希
在交付版本确定后生成新的SHA-256,并将文件设为只读或放入独立交付目录。
七、推荐的团队处理流程
接收原文 ↓ 生成哈希并归档 ↓ 按章节拆分 ↓ 翻译与术语校对 ↓ 排版检查 ↓ 重新合并 ↓ 抽查页码和图表 ↓ 生成交付哈希这个流程看起来比直接翻译多了几个步骤,却能明显减少版本混乱、漏页和误发文件的问题。
对于批量PDF项目,真正重要的不是产生更多文件,而是让每个文件都能被识别、验证和追溯。