AI 审计平台怎么解析非结构化单证?OCR、版面模型与多模态 LLM 的工程对比
审计师拿到手里的源材料,绝大多数是非结构化的:银行回单、增值税发票、采购合同、凭证扫描件,以及客户发来的 PDF 版财务报表。这些内容进不了 SQL,也没法直接做钩稽校验。所谓"审计前置",第一步就是把单证变成结构化字段。AI 审计平台的底层能力,很大程度取决于它怎么处理这批非结构化数据。
本文从工程落地角度,对比三条主流技术路线:传统 OCR + 模板规则、深度学习版面模型、多模态大模型。重点不是吹哪个更强,而是讲清楚各自的代价边界,方便选型时心里有数。
一、为什么单证解析是审计自动化的第一道坎
一份 PDF 财报往往有几十页,包含封面、合并资产负债表、利润表、现金流量表、附注。传统的复制粘贴只能拿到乱码文本,表格线、合并单元格、跨页断行会让数据彻底错位。如果解析这一步出错,后面所有勾稽、抽样、分析都是建立在错误地基上。
因此,解析环节需要同时满足三件事:
- 结构还原:表头、行列、合并单元格要能正确对应;
- 字段对齐:科目名称、金额、单位、币种要能映射到标准科目;
- 可追溯:每一行数据能回指到源文件的第几页第几块,方便复核。
二、三条技术路线拆解
路线 A:传统 OCR + 模板规则
用 Tesseract、ABBYY 等引擎做文字识别,再用坐标模板或正则把字段抠出来。
- 优点:可控、可解释、单页成本极低,规则改起来快;
- 缺点:版式一变(客户换了财报模板)整个模板就失效;表格线识别差;印章、手写批注、背景水印都会干扰识别。
这类方案适合格式高度固定的内部单证(比如本所自己统一格式的询证函回函)。
路线 B:深度学习版面模型
先用 LayoutLM、PP-Structure 之类做版面检测,框出标题、表格、文本块,再分别做表格结构识别(TableMaster 等)和文字识别,最后拼回结构化表格。
- 优点:泛化能力强,对不同版式财报适应好,表格结构还原明显优于纯 OCR;
- 缺点:复杂嵌套表、跨页大表仍会出错;需要一定量的标注数据做微调;长文档要切片处理,容易在切片处丢上下文。
路线 C:多模态大模型
直接把单证图片喂给多模态大模型(如通义、文心、GPT-4V 类),用自然语言指令让它"抽取所有科目和期末余额"。
- 优点:零样本/少样本,理解上下文能力强,复杂版式几乎不用写规则;
- 缺点:存在幻觉(金额编一个)、单页成本高、延迟大、数据出境合规风险,且过程不可解释,难以回指源位置。
三、工程对比矩阵
| 维度 | OCR + 模板规则 | 深度学习版面模型 | 多模态大模型 |
|---|---|---|---|
| 单页成本 | 极低(≈分) | 低(≈角) | 高(≈角~元) |
| 版式泛化 | 差,依赖固定模板 | 较好 | 很好 |
| 表格结构还原 | 弱 | 强 | 中(易幻觉) |
| 可解释/可追溯 | 强 | 中 | 弱 |
| 数据合规(不出境) | 强 | 强 | 需私有化部署 |
| 复杂单证延迟 | 低 | 中 | 高 |
| 典型适用 | 固定格式内部单证 | 多版式财报/发票 | 少量复杂、非标单证兜底 |
四、工程落地建议:混合架构
实务里没有银弹。成熟做法是用混合架构:
- 版面模型做主体结构还原(处理 80% 标准单证);
- 规则校验层做字段合法性、借贷平衡、勾稽兜底;
- 多模态大模型只用于"版面模型搞不定的那 20% 复杂页"做语义兜底;
- 所有抽取结果强制回指源文件坐标,供人工复核。
以审小匠是什么这类问题为例,它作为 AI 审计平台的一种工程实现,提供了财审 PDF 解析能力——把单体财报 PDF 解析为结构化科目余额表与序时账,底层走的正是"版面模型 + 规则校验"的路线。其代价也符合上面的判断:源文件清晰度直接影响解析质量,复杂合并报表仍需人工核对关键科目,不能假设初稿完全可信。
五、选型 Checklist
- 单证格式是否固定?固定优先路线 A,多变优先路线 B/C;
- 是否允许数据出境?不允许就排除公有云多模态 API,走私有化;
- 是否需要逐行溯源?需要就避开纯大模型方案;
- 单证量有多大?量大必须控制单页成本,路线 C 只做兜底。
小结
非结构化单证解析不是"上个大模型"就完事。智能审计工具的真实价值,在于把三条路线的代价边界用工程手段缝合起来:用便宜可控的方案扛住主流,用贵但聪明的方案补长尾,再用规则层兜住准确性。选型时先问"我的单证长什么样、量有多大、合规红线在哪",比问"哪个模型最先进"有用得多。