news 2026/9/12 1:52:44

PaddleOCR PP-StructureV3:文档结构化解析流水线的技术解析与基准实测

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
PaddleOCR PP-StructureV3:文档结构化解析流水线的技术解析与基准实测

PaddleOCR PP-StructureV3:文档结构化解析流水线的技术解析与基准实测

【免费下载链接】PaddleOCRTurn any PDF or image document into structured data for your AI. A powerful, lightweight OCR toolkit that bridges the gap between images/PDFs and LLMs. Supports 100+ languages.项目地址: https://gitcode.com/GitHub_Trending/pa/PaddleOCR

本文基于 PaddleOCR 仓库中 PP-StructureV3 算法文档,系统梳理该文档解析流水线的定位与能力边界(版面检测、表格/公式/印章/图表识别、阅读顺序恢复、Markdown 输出),完整呈现其在 OmniDocBench 上的精度对比、V100/A100 上的端到端时延与资源占用实测数据,并结合 流水线包装类源码 解析其参数体系与调用链路。读完后你将能够:根据硬件条件选择合适模型配置、理解各use_*开关与检测参数的含义、通过 CLI 或 Python API 实际运行该流水线并做二次开发。

1. PP-StructureV3 是什么:在 Layout Parsing v1 基础上的能力增强

PP-StructureV3 是基于 Layout Parsing v1(布局解析)流水线的增强版本,核心提升集中在以下几个方面:

  • 版面区域检测(Layout Detection)能力增强:默认的版面检测模型PP-DocLayout-L覆盖文档标题、段落标题、文本、页码、摘要、表格、参考文献、脚注、页眉页脚、算法、公式、公式编号、图像、图题、表题、印章、图、侧栏文本等 20 个常见类别;同时提供单类 Block 区块检测模型PP-DocBlockLayout(region detection)用于阅读顺序恢复;
  • 表格识别增强:内置有/无线表格结构识别(SLANeXt_wired / SLANeXt_wireless)、表格分类(PP-LCNet_x1_0_table_cls)、表格单元格检测(RT-DETR-L_wired/wireless_table_cell_det)等模型;
  • 公式识别增强:默认使用 PP-FormulaNet-L 等 PP-FormulaNet 系列模型;
  • 新增图表理解能力:通过 PP-Chart2Table 多模态模型将图表解析为表格;
  • 新增多栏阅读顺序恢复能力
  • 结果可直接转换为 Markdown 文件,面向文档数字化与 LLM 数据接入场景。

该流水线同样支持灵活的服务化部署(多语言客户端、多种硬件),并且支持二次开发:每个子模块/子流水线可独立训练与推理,基于自有数据集训练或微调后的模型可以无缝集成回流水线。其模块构成在 使用文档 中描述为 7 个可独立训练的模块/子流水线:

模块是否必需默认模型示例
文档图像预处理子流水线(DocPreprocessor)可选方向分类 PP-LCNet_x1_0_doc_ori、矫正 UVDoc
版面检测模块(Layout Detection)必需PP-DocLayout-L
通用 OCR 子流水线(GeneralOCR)必需PP-OCRv5_server_det / PP-OCRv5_server_rec
表格识别子流水线(Table Recognition)可选SLANeXt_wired/wireless + RT-DETR-L 单元格检测
印章文本识别子流水线(Seal Recognition)可选PP-OCRv4_server/mobile_seal_det
公式识别子流水线(Formula Recognition)可选PP-FormulaNet-L
图表解析模块(Chart Parsing)可选PP-Chart2Table

各子模块的模型清单与指标详见 PP-StructureV3 使用文档 与 中文版算法文档。

2. OmniDocBench 关键指标:与主流文档解析工具及 VLM 的精度对比

算法文档给出了一组基于OmniDocBench(面向多样化 PDF 文档解析的综合标注基准)的端到端精度数据。指标为 Edit 编辑距离,数值越低越好,分 Overall(整体)、Text(文本)、Formula(公式)、Table(表格)、Read Order(阅读顺序)五个维度,且每个维度区分中英文(EN/ZH)。

方法类型方法Overall ENOverall ZHText ENText ZHFormula ENFormula ZHTable ENTable ZHRead Order ENRead Order ZH
Pipeline ToolsPP-StructureV30.1450.2060.0580.0880.2950.5350.1590.1090.0690.091
Pipeline ToolsMinerU-0.9.30.150.3570.0610.2150.2780.5770.180.3440.0790.292
Pipeline ToolsMinerU-1.3.110.1660.3100.08260.20000.33680.62360.16130.18330.08340.2316
Pipeline ToolsMarker-1.2.30.3360.5560.080.3150.530.8830.6190.6850.1140.34
Pipeline ToolsMathpix0.1910.3650.1050.3840.3060.4540.2430.320.1080.304
Pipeline ToolsDocling-2.14.00.5890.9090.4160.9870.99910.6270.810.3130.837
Pipeline ToolsPix2Text-1.1.2.30.320.5280.1380.3560.2760.6110.5840.6450.2810.499
Pipeline ToolsUnstructured-0.17.20.5860.7160.1980.4810.999110.9980.1450.387
Pipeline ToolsOpenParse-0.7.00.6460.8140.6810.9740.99610.2840.6390.5950.641
Expert VLMsGOT-OCR0.2870.4110.1890.3150.360.5280.4590.520.1410.28
Expert VLMsNougat0.4520.9730.3650.9980.4880.9410.57210.3820.954
Expert VLMsMistral OCR0.2680.4390.0720.3250.3180.4950.60.650.0830.284
Expert VLMsOLMOCR-sglang0.3260.4690.0970.2930.4550.6550.6080.6520.1450.277
Expert VLMsSmolDocling-256M_transformer0.4930.8160.2620.8380.7530.9970.7290.9070.2270.522
General VLMsGemini2.0-flash0.1910.2640.0910.1390.3890.5840.1930.2060.0920.128
General VLMsGemini2.5-Pro0.1480.2120.0550.1680.3560.4390.130.1190.0490.121
General VLMsGPT4o0.2330.3990.1440.4090.4250.6060.2340.3290.1280.251
General VLMsQwen2-VL-72B0.2520.3270.0960.2180.4040.4870.3870.4080.1190.193
General VLMsQwen2.5-VL-72B0.2140.2610.0920.180.3150.4340.3410.2620.1060.168
General VLMsInternVL2-76B0.440.4430.3530.290.5430.7010.5470.5550.3170.228

从表格结构看,官方将对比对象分为三类:流水线工具(Pipeline Tools)、专家 VLM(Expert VLMs,如 GOT-OCR、Nougat、Mistral OCR)、通用 VLM(General VLMs,如 Gemini、GPT4o、Qwen2.5-VL)。加粗值为各自最优。可以观察到的事实性结论:

  • PP-StructureV3 在Pipeline Tools类别中 Overall(EN/ZH)、Text(ZH)、Table(ZH)、Read Order(EN/ZH)取得最低 Edit 距离;
  • 在公式(Formula ZH)单项上,Pix2Text-1.1.2.3(0.276)与 Qwen2.5-VL-72B(0.434,通用 VLM 类最优)优于 PP-StructureV3 的 0.535,说明公式识别是该场景下仍有明显差距的维度,选型时若公式密集可优先考虑更强的公式模型或 VLM 方案;
  • 相比同类的 MinerU-1.3.11,PP-StructureV3 在中文 Overall 上从 0.310 降到 0.206,阅读顺序指标差距尤为显著(EN 0.069 vs 0.0834,ZH 0.091 vs 0.2316),与文档"阅读顺序恢复"能力增强的描述相互印证。

3. 端到端 Benchmark:时延、资源占用与服务化并发

端到端测试的依赖环境为:Paddle 3.0、PaddleOCR 3.0.0、MinerU 1.3.10、CUDA 11.8、cuDNN 8.9。测试数据为 15 个 PDF 文件共 925 页,包含表格、公式、印章、图表等元素。

3.1 本地推理:NVIDIA Tesla V100 + Intel Xeon Gold 6271C

PP-StructureV3 在 6 种"OCR 模型 × 公式识别模型 × 图表识别 × 文本检测max_side_limit"配置下的实测表现如下(OCR 模型分为 Server / Mobile 两档,详见 PP-OCRv5 算法文档;公式模型细节见 公式识别文档;文本检测模块的侧长限制参数见 文本检测文档):

方法OCR 模型公式识别模型图表识别模型文本检测 max_side_limit每页平均耗时 (s)平均 CPU (%)峰值内存 (GB)平均内存 (GB)平均 GPU (%)峰值显存 (GB)平均显存 (GB)
PP-StructureV3ServerPP-FormulaNet-L40961.77111.46.75.238.917.016.5
PP-StructureV3ServerPP-FormulaNet-L40964.09105.35.54.024.717.016.6
PP-StructureV3MobilePP-FormulaNet-L40961.56113.76.64.929.110.710.6
PP-StructureV3ServerPP-FormulaNet-M40961.42112.96.85.13816.015.5
PP-StructureV3MobilePP-FormulaNet-M40961.15114.86.55.026.18.48.3
PP-StructureV3MobilePP-FormulaNet-M12000.991137.05.629.28.68.5
MinerU----1.57142.913.311.843.331.69.7

3.2 本地推理:NVIDIA A100 + Intel Xeon Platinum 8350C

方法OCR 模型公式识别模型图表识别模型文本检测 max_side_limit每页平均耗时 (s)平均 CPU (%)峰值内存 (GB)平均内存 (GB)平均 GPU (%)峰值显存 (GB)平均显存 (GB)
PP-StructureV3ServerPP-FormulaNet-L40961.12109.89.27.829.821.821.1
PP-StructureV3ServerPP-FormulaNet-L40962.76103.79.07.72421.821.1
PP-StructureV3MobilePP-FormulaNet-L40961.04110.79.37.82212.212.1
PP-StructureV3ServerPP-FormulaNet-M40960.95111.49.17.828.121.821.0
PP-StructureV3MobilePP-FormulaNet-M40960.89112.19.27.818.511.411.2
PP-StructureV3MobilePP-FormulaNet-M12000.64113.510.28.523.711.411.2
MinerU----1.06168.318.316.827.576.914.8

两张表共同传达的选型结论:

  • 开启图表识别是主要耗时来源:V100 上开启图表识别后每页耗时从 1.77 s 升至 4.09 s,A100 上从 1.12 s 升至 2.76 s;若无图表解析需求,use_chart_recognition=False是最明显的提速手段;
  • Mobile OCR + PP-FormulaNet-M +max_side_limit=1200是最省资源组合:V100 下每页 0.99 s、峰值显存仅 8.6 GB;A100 下 0.64 s、峰值显存 11.4 GB,而 MinerU 在 A100 上峰值显存高达 76.9 GB;
  • 公式模型从 L 换成 M 可显著降低显存占用(Server 档 V100:17.0 GB → 16.0 GB,Mobile 档 10.7 GB → 8.4 GB)。

3.3 服务化(Serving)并发性能

服务化测试基于 A100 + Xeon Platinum 8350C 环境,测试数据为 1500 张含表格、公式、印章、图表等元素的图像:

实例数并发请求数吞吐(req/s)平均时延 (s)成功率
4 GPU × 1 实例/GPU41.692.36100%
4 GPU × 4 实例/GPU164.053.87100%

即单机 4 卡下,通过每卡多实例的水平扩展,可将吞吐从 1.69 提升到 4.05(约 2.4 倍),代价是平均时延从 2.36 s 上升到 3.87 s,并发 16 请求下保持 100% 成功。

3.4 不同流水线配置的组合性能数据

文档还给出了 8 种流水线配置在多种硬件上的完整性能矩阵(测试环境:PaddlePaddle 3.1.0、CUDA 11.8、cuDNN 8.9;测试数据 280 张含表格/印章/公式/图表的图像;策略为先 20 张预热后完整跑一遍;NPU/XPU 未采集显存数据,记为 N/A):

流水线配置硬件平均推理时间 (s)峰值 CPU (%)平均 CPU (%)峰值主机内存 (MB)平均主机内存 (MB)峰值 GPU (%)平均 GPU (%)峰值显存 (MB)平均显存 (MB)
defaultIntel 8350C + A1001.381384.60113.265781.593431.2110032.7937370.0034165.68
defaultIntel 6271C + V1002.38608.70109.966388.913737.1910039.0826824.0024581.61
defaultIntel 8563C + H201.36744.30112.826199.013865.7810043.8135132.0032077.12
defaultIntel 8350C + A101.74418.50105.966138.253503.4110048.5418536.0018353.93
defaultIntel 6271C + T43.70434.40105.456865.873595.6810071.9213970.0012668.58
ppIntel 8350C + A1003.50679.30105.9613850.205146.5010014.0137656.0034716.95
ppIntel 6271C + V1005.03494.20105.6313542.944833.5510020.3629402.0026607.92
ppIntel 8563C + H203.17481.50105.1314179.975608.8010019.3535454.0032512.19
fullIntel 8350C + A1008.92697.30102.8813777.074573.6510018.3938776.0037554.09
fullIntel 6271C + V10013.12437.40102.3613974.004484.0010017.5029878.0028733.59
sealIntel 8350C + A1001.39747.50112.555788.793742.0310033.8138966.0035832.44
sealIntel 6271C + V1002.44630.10110.186343.393725.9810042.2328078.0025834.70
sealIntel 8563C + H201.40792.20113.636673.604417.3410046.3335530.0032516.87
sealIntel 8350C + A101.75422.40106.086068.873973.4910050.1219630.0018374.37
sealIntel 6271C + T43.76400.30105.106296.283651.4210072.5714304.0013268.36
chartIntel 8350C + A1007.70746.80102.696355.584006.4810022.3837380.0036730.73
chartIntel 6271C + V10010.58599.20102.515754.143333.7810021.9926820.0026253.70
chartIntel 8350C + A108.03413.30101.316473.293689.8410026.1918540.0018494.69
chartIntel 6271C + T411.69460.90101.856503.123524.0610046.8113966.0012481.94
notableIntel 8350C + A1001.24738.30110.455638.163278.3010035.3230320.0027026.17
notableIntel 6271C + V1002.24452.40107.795579.153635.9510043.0023098.0020684.43
notableIntel 8563C + H201.18989.00107.716041.764024.7610050.6733780.0029733.15
notableIntel 8350C + A101.58225.00102.565518.103333.0810049.9021532.0018567.99
notableIntel 6271C + T43.40413.30103.585874.883662.4910076.8213764.0011890.62
noformulaIntel 6271C(纯 CPU)7.851172.50964.7017739.0011101.02N/AN/AN/AN/A
noformulaIntel 8350C(纯 CPU)8.831053.50970.6415463.489408.19N/AN/AN/AN/A
noformulaIntel 8350C + A1000.84788.60124.256246.393674.3210030.5740084.0037358.45
noformulaIntel 6271C + V1001.42606.20115.537015.573707.0310035.6329540.0027620.28
noformulaIntel 8563C + H200.87644.10119.236895.764222.8510050.0036878.0034104.59
noformulaIntel 8350C + A101.03377.50106.875819.883830.1910042.8719340.0017550.94
noformulaIntel 6271C + T42.02430.20109.216600.623824.1810065.7514332.0012712.18
lightweightIntel 6271C(纯 CPU)4.361189.70995.7814000.509374.97N/AN/AN/AN/A
lightweightIntel 8350C(纯 CPU)3.741049.60967.7712960.967644.25N/AN/AN/AN/A
lightweightHygon 7490 + P8000.86572.20120.848290.493569.44N/AN/AN/AN/A
lightweightIntel 8350C + A1000.61823.40126.259258.223776.635218.957456.007131.95
lightweightIntel 6271C + V1001.07686.80116.709381.754126.285822.928450.008083.30
lightweightIntel 8563C + H200.46999.00122.219734.784516.406124.417524.007167.52
lightweightIntel 8350C + A100.70355.40111.519415.454094.068930.857248.006927.58
lightweightM4(Apple Silicon)12.22223.60107.359531.227884.61N/AN/AN/AN/A
lightweightIntel 6271C + T41.13461.40112.167923.093837.318541.678218.007902.04

各配置的含义:

配置说明
PP_StructureV3-default默认配置
PP_StructureV3-pp默认配置 + 开启文档图像预处理
PP_StructureV3-full默认配置 + 开启文档图像预处理 + 图表解析
PP_StructureV3-seal默认配置 + 开启印章文本识别
PP_StructureV3-chart默认配置 + 开启图表解析
PP_StructureV3-notable默认配置 - 关闭表格识别
PP_StructureV3-noformula默认配置 - 关闭公式识别
PP_StructureV3-lightweight默认配置,所有任务模型替换为轻量版本

几个可直接用于容量规划的数据点:full配置在 A100 上每张图 8.92 s,是default(1.38 s)的 6 倍以上,瓶颈即图表解析;lightweight配置在 H20 上可达 0.46 s/张、峰值显存约 7.5 GB,在纯 CPU 的 Intel 8350C 上为 3.74 s/张,验证了"CPU 也能跑"的可行性(对应 FAQ 的结论);noformula在纯 CPU 下耗时 7.85~8.83 s,说明公式识别模型对 CPU 推理是重大负担。

4. 源码解析:PPStructureV3 包装类的参数体系

PaddleOCR 3.x 的paddleocr包通过 PPStructureV3 包装类 将底层 PaddleX 的PP-StructureV3流水线暴露给用户。阅读 paddleocr/_pipelines/pp_structurev3.py 可以得到几个有实战价值的信息:

4.1 构造参数:每个模块都可用model_name/model_dir替换

构造函数接收 60 余个参数,按模块分组(节选自 L34-L100):

  • 版面检测layout_detection_model_name/layout_detection_model_dirlayout_threshold(置信度阈值)、layout_nmslayout_unclip_ratio(框扩张系数)、layout_merge_bboxes_mode(重叠框过滤策略);
  • 图表解析chart_recognition_model_name/model_dir/batch_size
  • 区块检测(阅读顺序)region_detection_model_name/model_dir
  • 文档预处理doc_orientation_classify_model_namedoc_unwarping_model_name等;
  • 通用 OCRtext_detection_model_nametext_det_limit_side_len(即文档中的max_side_limit,输入图像侧长上限)、text_det_limit_type(侧长限制应用方式)、text_det_thresh(像素阈值)、text_det_box_thresh(框阈值)、text_det_unclip_ratiotext_recognition_model_nametext_rec_score_thresh
  • 表格识别table_classification_model_namewired/wireless_table_structure_recognition_model_namewired/wireless_table_cells_detection_model_nametable_orientation_classify_model_name
  • 印章识别seal_text_detection_model_nameseal_det_*系列参数、seal_text_recognition_model_name
  • 公式识别formula_recognition_model_nameformula_recognition_batch_size
  • 功能开关use_doc_orientation_classifyuse_doc_unwarpinguse_textline_orientationuse_seal_recognitionuse_table_recognitionuse_formula_recognitionuse_chart_recognitionuse_region_detection
  • 输出控制format_block_content(是否将块内容格式化为 Markdown)、markdown_ignore_labels(Markdown 输出中忽略的版面标签列表)、langocr_version

这些用户参数最终通过_get_paddlex_config_overrides方法映射到 PaddleX 流水线的层级化配置路径上,从源码结构看,整个流水线配置树为:

SubPipelines.DocPreprocessor ├── use_doc_orientation_classify / use_doc_unwarping └── SubModules: DocOrientationClassify, DocUnwarping SubPipelines.GeneralOCR └── SubModules: TextDetection, TextLineOrientation, TextRecognition SubPipelines.TableRecognition ├── SubModules: TableClassification, WiredTableStructureRecognition, │ WirelessTableStructureRecognition, Wired/WirelessTableCellsDetection, │ TableOrientationClassify └── SubPipelines.GeneralOCR(表格内文字复用同一套文本检测/识别模型) SubPipelines.SealRecognition └── SubPipelines.SealOCR → TextDetection / TextRecognition SubPipelines.FormulaRecognition SubModules: LayoutDetection, ChartRecognition, RegionDetection

值得注意的一处实现细节:表格识别子流水线内部复用了与全局 OCR 相同的text_detection_model_name/text_recognition_model_name(见 L446-L487),即替换通用 OCR 模型时表格内文字识别也会同步切换,无需单独配置。

4.2 语言与 OCR 版本映射:_get_ocr_model_names

当用户只提供lang+ocr_version而不指定具体模型名时,_get_ocr_model_names负责解析默认模型。从源码看:

  • ocr_version仅支持PP-OCRv3PP-OCRv4PP-OCRv5(由_SUPPORTED_OCR_VERSIONS约束,传其他值直接抛ValueError);
  • lang为 None 时默认取"ch";未指定版本时,中/繁/英/日/韩/泰/希腊语及拉丁、斯拉夫语系默认走PP-OCRv5(检测统一用PP-OCRv5_server_det,识别按语种选择PP-OCRv5_server_rec*_PP-OCRv5_mobile_rec),阿拉伯、西里尔、天城文及其他特定语种回退到PP-OCRv3的语种 mobile 识别模型(如arabic_PP-OCRv3_mobile_rec);
  • PP-OCRv4仅支持chPP-OCRv4_mobile_det+PP-OCRv4_mobile_rec)与enPP-OCRv4_mobile_det+en_PP-OCRv4_mobile_rec);
  • 若已显式传入检测/识别模型名或模型目录,langocr_version会被忽略(仅打印警告)。

这解释了文档基准表中"Server / Mobile"两档 OCR 模型的来源——它们对应 PP-OCRv5 系列的 server 与 mobile 型号。

4.3 CLI 子命令与测试验证

PPStructureV3CLISubcommandExecutor注册了pp_structurev3子命令,除通用推理参数(输入、设备、引擎等)外,逐一暴露了上文 4.1 节的全部参数,其中--markdown_ignore_labels支持多值列表(nargs="+")。参数帮助文本也给出了语义说明,例如text_det_thresh是"输出概率图中高于该阈值的像素视为文本像素",text_det_unclip_ratio是"文本区域扩张系数,值越大扩张区域越大"。

测试侧的 tests/pipelines/test_pp_structurev3.py 提供了两层验证:

  • test_predict对含公式的文档图片执行推理,断言结果中overall_ocr_resdt_polysrec_textsrec_polysrec_boxes均非空,可据此了解返回结果的最小字段结构;
  • test_predict_params通过 monkeypatch 验证 18 组参数被正确转发到底层 PaddleX 流水线,覆盖use_*开关、layout_threshold标量/列表/字典三种写法(字典按类别索引,如{0: 0.45, 2: 0.48, 7: 0.4})、layout_unclip_ratio同构写法、layout_merge_bboxes_mode"large"或按类别字典)、text_det_limit_side_len+text_det_limit_type、检测/识别阈值等。这说明阈值类参数支持"全局标量、按范围列表、按类别字典"三种粒度,是调参时容易忽略但很有用的能力。

5. 实战使用:CLI 快速上手与关键调参

5.1 安装前提

本地使用 PP-StructureV3 前需按 安装文档 完成 wheel 安装,该流水线对应的依赖组为doc-parser。若运行中出现程序无响应、意外退出、内存耗尽或推理极慢,文档建议的处置方式是按配置文档调整:关闭不需要的功能开关、或改用更轻量模型。

5.2 命令行方式

# 一条命令体验默认流水线(输入可为本地路径或 URL) paddleocr pp_structurev3 -i https://paddle-model-ecology.bj.bcebos.com/paddlex/imgs/demo_image/pp_structure_v3_demo.png # 开启文档方向分类 paddleocr pp_structurev3 -i ./pp_structure_v3_demo.png --use_doc_orientation_classify True # 开启文档矫正(unwarping) paddleocr pp_structurev3 -i ./pp_structure_v3_demo.png --use_doc_unwarping True # 关闭文本行方向分类 paddleocr pp_structurev3 -i ./pp_structure_v3_demo.png --use_textline_orientation False # 指定 GPU 推理 paddleocr pp_structurev3 -i ./pp_structure_v3_demo.png --device gpu

示例默认使用本地 Paddle 推理引擎:仅支持动态图的模型使用paddle_dynamic,静态/动态图均支持的模型优先paddle_static。如需切换推理引擎,可参考 推理引擎与配置文档 配置环境后追加--engine参数:

# 使用 transformers 引擎 paddleocr pp_structurev3 -i ./pp_structure_v3_demo.png --engine transformers # 使用 onnxruntime 引擎 paddleocr pp_structurev3 -i ./pp_structure_v3_demo.png --engine onnxruntime

5.3 Python API 与 Markdown 页面合并

从源码定义看,Python 侧的入口类为paddleocr.PPStructureV3,提供predict/predict_iter(批量/迭代)两个推理入口,以及concatenate_markdown_pages方法用于将多页 Markdown 结果合并为整份文档的 Markdown。基本用法:

from paddleocr import PPStructureV3 pipeline = PPStructureV3( use_formula_recognition=True, # 开启公式识别 use_chart_recognition=False, # 关闭图表解析以降低时延(见 3.2 节数据) ) result = pipeline.predict("page.png") # 逐页输出 Markdown;多页场景可调用 # pipeline.concatenate_markdown_pages(markdown_list) 合并

predict的所有关键字参数与 CLI 的--参数一一对应(见 4.1 节),因此基准测试中的"Mobile OCR + PP-FormulaNet-M +max_side_limit=1200"组合在 Python 中即写作text_detection_model_name="PP-OCRv5_mobile_det"formula_recognition_model_name="PP-FormulaNet-M"text_det_limit_side_len=1200

5.4 关键调参策略(结合第 2、3 节数据)

目标推荐操作依据
降低时延use_chart_recognition=False;关闭use_formula_recognition

【免费下载链接】PaddleOCRTurn any PDF or image document into structured data for your AI. A powerful, lightweight OCR toolkit that bridges the gap between images/PDFs and LLMs. Supports 100+ languages.项目地址: https://gitcode.com/GitHub_Trending/pa/PaddleOCR

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/12 1:52:06

BingSNS多社群平台拆解:ASP社群电商+群等级权限+分销佣金设计

简介:一套基于ASPMySQL的BingSNS多社群平台系统源码,定位为社群、商城、直播、分销一体化的社交电商平台,适合需要搭建私域社群裂变体系的开发人员或运营团队。系统以群规等级为骨架,覆盖建群数量、人数上限、群收款、付费提问、商…

作者头像 李华
网站建设 2026/9/12 1:52:02

APTED树编辑距离算法Python实现解析与工程实践

简介:APTED算法的Python实现,面向从事树结构比较、句法解析、程序分析等方向的开发者与研究人员,用于高效计算两棵有序标签树之间的编辑距离。该算法是目前已知最先进的树编辑距离求解方案之一,性能优于早期RTED算法,适…

作者头像 李华
网站建设 2026/9/12 1:50:44

darwin-vm:用QEMU仿真Apple芯片,搭建XNU内核调试实验床

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/12 1:50:42

《Linux/UNIX系统编程手册》课后习题代码实践全程指南

简介:《Linux/UNIX系统编程手册》课后习题代码是一份面向系统编程学习者的实践代码包,适合正在攻读本书、希望巩固文件I/O、进程控制、信号、线程、网络套接字及I/O复用等核心API的开发者。资源共561个文件,以359个C源文件为主,辅…

作者头像 李华
网站建设 2026/9/12 1:49:45

解决R包DiffBind编译失败的完整指南

1. 解决 ERROR: compilation failed for package DiffBind 的完整指南遇到 R 包安装失败的问题总是让人头疼,特别是当错误信息像 "ERROR: compilation failed for package DiffBind" 这样模糊时。作为一名长期使用 R 进行生物信息学分析的研究人员&#x…

作者头像 李华