news 2026/9/28 20:06:36

TeleOCR到底有多强?OmniDocBench等5大基准实测对比PaddleOCR-VL、MinerU与GPT-5

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
TeleOCR到底有多强?OmniDocBench等5大基准实测对比PaddleOCR-VL、MinerU与GPT-5

TeleOCR到底有多强?OmniDocBench等5大基准实测对比PaddleOCR-VL、MinerU与GPT-5

【免费下载链接】TeleOCR项目地址: https://ai.gitcode.com/hf_mirrors/StarDoc-AI/TeleOCR

TeleOCR 是一个仅约1.2B 参数的开源轻量级文档解析模型(视觉-语言模型,VLM),单个框架就能同时处理数字 PDF 文档和手机拍照的纸质文档。这篇文章将用 OmniDocBench、Wild_OmniDocBench、PureDocBench、Dr.DocBench 挑战赛和 ICDAR2026 Sci-ImageMiner5 大公开基准的实测数据,把它与 PaddleOCR-VL、MinerU 以及 GPT-5 系列大模型放在一起对比,帮你快速判断它到底值不值得用。🔍

📊 一图速览:TeleOCR 是什么?

在跑分之前,先花 30 秒认识一下这个模型:

项目说明
参数规模约 1.2B,消费级显卡即可部署
开源协议Apache-2.0
模型底座基于 Qwen2.5-VL 架构(见 config.json 中的Qwen2_5_VLForConditionalGeneration)
核心卖点数字文档 + 拍照文档统一解析,拍照件无需矫正预处理
可解析内容文本、公式、表格、代码、版式(布局)

它和传统 OCR 工具最大的不同是:一张弯弯曲曲的手机照片直接丢进去,它不需要先做"去畸变"矫正,就能直接输出解析结果,这是很多竞品都做不到的。项目介绍详见 README.md,模型实现位于 modeling_naviocr.py。

🏆 基准一:OmniDocBench v1.6 官方榜——1.2B 打赢 235B

OmniDocBench 是文档解析领域最权威的公开基准之一,同时考核文本、公式、表格和阅读顺序。实测结果如下(节选自 README.md 中的实验数据):

模型参数Overall ↑Text Edit ↓Formula CDM ↑Table TEDS ↑
TeleOCR1.2B96.870.02796.3697.05
OvisOCR20.8B96.580.02597.5394.76
PaddleOCR-VL-1.60.9B96.330.03397.4994.76
MinerU2.5-Pro1.2B95.750.03697.4593.42
GLM-OCR0.9B95.220.04497.1892.83
PaddleOCR-VL0.9B94.110.04095.7090.65
Gemini 3 Pro未知92.850.06495.8389.15
Qwen3-VL-235B235B89.780.06392.5383.07
GPT-5.2未知86.520.11488.0082.95

三个关键结论:

  1. 综合分 96.87 登顶,超过同为 1.2B 的 MinerU2.5-Pro(95.75)和 PaddleOCR-VL-1.6(96.33);
  2. 表格解析是最大杀器:Table TEDS 97.05 全场最高,PaddleOCR-VL 系列只有 90~95;
  3. 降维打击通用大模型:参数只有 GPT-5.2 的几百分之一的 TeleOCR,综合分领先 10 分以上。文档解析这件事上,"专"确实能胜"大"。💪

📷 基准二:Wild_OmniDocBench——真实场景才见真章

官方基准里的文档都"太干净了"。Wild_OmniDocBench 专门收集真实世界里的复杂文档(复杂背景、光照不均、排版混乱),是更贴近实际使用的考试:

模型类型Overall ↑Text Edit ↓Table TEDS ↑
TeleOCR解耦式 VLM88.530.117389.05
PaddleOCR-VL-1.6解耦式 VLM87.360.136985.76
MinerU2.5-Pro解耦式 VLM87.330.136285.46
OvisOCR2端到端 VLM87.910.12985.13
GLM-OCR解耦式 VLM85.080.151481.31

在"难度拉满"的题库里,TeleOCR 依然保持第一,且文本和表格两项均为全场最佳——差距虽小,但五项指标没有一项落后,说明它不是靠某一项刷分。

🔬 基准三:PureDocBench——抗退化能力碾压大模型

PureDocBench 把同一份文档分别放在干净、数字退化、真实退化三种条件下考察模型。这正是"拍照文档解析"的核心考验:

模型干净 Overall数字退化 Overall真实退化 Overall
TeleOCR86.9077.4770.85
OvisOCR282.1477.7766.61
MinerU2.5-Pro75.8771.7762.56
PaddleOCR-VL-1.573.0166.7360.50
Gemini-3.1-Pro70.0469.2871.98
  • 干净文档:TeleOCR 以 86.90 领先第二名 OvisOCR2 约 4.8 分;
  • 真实退化(模糊、光照差、拍摄角度歪斜):TeleOCR 70.85 第一,连 Gemini-3.1-Pro 这类旗舰通用模型都拿它没办法——退化的纸质扫描件恰恰是通用大模型的软肋。📉

🥇 基准四:Dr.DocBench 挑战赛(EMNLP 2026)

在 EMNLP 2026 举办的 Dr.DocBench 文档解析挑战赛中,TeleOCR 以原始权重直接参赛:

模型overall ↑Text edit ↓formula cdm ↑Table teds ↑
TeleOCR67.960.19030.0264.97
MinerU 2.5 Pro62.260.34020.0467.75
OvisOCR259.250.38830.0061.59
PaddleOCR-VL 1.655.110.43640.2151.34

领先第二名 MinerU 2.5 Pro 约5.7 分,PaddleOCR-VL 1.6 则是 12.8 分的大胜。文本识别(Text edit 0.1903,越低越好)优势尤其明显。

🧪 基准五:ICDAR2026 Sci-ImageMiner——科学图表提取冠军

这个赛道考核的是从科学插图中提取隐含表格数据的高难任务(论文配图里的曲线、柱状图 → 结构化数据):

排名队伍RMSTEDS加权总分
1TeleOCR17.2366.3941.81
2VLMinators17.2964.3140.80
3Ricoh_SRCB16.2361.1238.67
6Qwen3-VL 8B14.0857.8635.97

TeleOCR 以加权总分41.81 夺得冠军,领先第二名接近 1 分。这意味着处理科研论文时,它不仅能解析正文里的表格,还能把"图"里藏的数据捞出来。

🧩 一个模型,解析文档的所有内容

TeleOCR 把"文档解析"拆成 5 个可单独调用的能力,用不同提示词(prompt)即可切换:

任务说明官方示例素材
文本识别正文、段落直接转文本assets/text.png
公式识别公式图片 → LaTeXassets/formula.png
表格识别输出 OTSL 格式,可转 HTML 表格assets/table.png
代码识别代码截图 → 源码assets/code.png
版式分析整页布局定位(含畸变文档)assets/layout.jpg、assets/layout_distorted.jpg

上图是一个典型的多行数学公式解析示例——TeleOCR 能将此类公式图片识别为可渲染的 LaTeX 源码,公式 CDM 分数在 OmniDocBench 上高达 96.36。

对于畸变的拍照文档,TeleOCR 还内置了**"多点版式分割分析"**能力:直接对弯曲、倾斜的页面做布局定位,无需专门的矫正模型,这也是它 Wild/PureDocBench 抗退化成绩领先的底气所在。

🧠 为什么 1.2B 能做到?6 项核心技术

跑分领先不是运气,README.md 中列出了支撑成绩的 6 项关键设计:

  1. 多节点共识投票(MCV):自动生产高质量伪标签,解决标注数据不足的老大难问题;
  2. 几何感知文档建模:专为手机拍照文档设计,直接理解弯曲、透视畸变;
  3. 曲率引导 Douglas-Peucker 采样(CGDP):沿文档曲线智能采样,保留关键几何信息;
  4. 图像到图像自验证:模型自己检查自己,自动清洗错误数据;
  5. 渐进式四阶段训练流水线:分阶段训练,从易到难逐步提升;
  6. 内容-结构解耦学习:表格和公式的"内容"与"结构"分开学习,这正是它 Table TEDS 97.05 的第一名由来。

🚀 3 分钟上手:安装与首次文档解析

部署门槛很低,两条命令即可开始。👇

第 1 步:安装依赖

pip install transformers torch pillow

第 2 步:加载模型并解析一张图片

from PIL import Image from transformers import AutoProcessor, AutoModel import torch processor = AutoProcessor.from_pretrained( "StarDoc-AI/TeleOCR", trust_remote_code=True, use_fast=True) model = AutoModel.from_pretrained( "StarDoc-AI/TeleOCR", trust_remote_code=True, torch_dtype=torch.bfloat16).cuda().eval() # 文本解析 image = Image.open("./assets/text.png").convert("RGB") print(infer(image, "Please output the text content from the image."))

完整的推理与后处理代码(含 OTSL 表格转 HTML、公式 LaTeX 规范化)可以直接参考 README.md 中的 Quick Start 部分,模型分词与推理行为定义在 tokenizer_config.json 和 generation_config.json 中。如果想在本地拉取仓库试用:

git clone https://gitcode.com/hf_mirrors/StarDoc-AI/TeleOCR

✅ 谁适合用 TeleOCR?

你的场景推荐度理由
自建文档数字化流水线⭐⭐⭐⭐⭐开源 Apache-2.0,1.2B 可私有化部署
大量手机拍照的票据/表单解析⭐⭐⭐⭐⭐无需矫正预处理,抗退化第一
科研论文表格/插图数据提取⭐⭐⭐⭐⭐ICDAR2026 冠军,科学图表提取最强
消费级显卡本地跑 OCR⭐⭐⭐⭐⭐1.2B 参数,显存占用远低于 30B+ 大模型
通用多模态对话⭐它是文档解析专家,不是聊天模型

❓ 常见疑问快速解答

Q1:1.2B 参数真的够用吗?在 5 个基准上,TeleOCR 的综合成绩普遍领先参数 2~200 倍的通用 VLM(如 Qwen3-VL-235B、InternVL3.5-241B)。文档解析是"专精赛道",小模型反而更优。

Q2:手机拍的弯歪照片要先矫正吗?不用。几何感知建模 + 多点版式分割让它直接解析畸变文档,DocUNet、DIR300 数据集上的可视化结果均验证了这一点。

Q3:表格和公式的输出格式?表格默认输出 OTSL 标记,官方提供一键转 HTML<table>的逻辑(含合并单元格);公式输出 LaTeX(自动补$$定界符)。

📌 总结

  • 5 大基准全部第一:OmniDocBench 96.87、Wild 88.53、PureDocBench 86.90、Dr.DocBench 67.96、ICDAR2026 冠军;
  • 对比结论:表格解析胜 PaddleOCR-VL、整体稳超 MinerU 2.5 Pro、碾压 GPT-5 系列与 Gemini 旗舰;
  • 落地友好:1.2B + Apache-2.0,拍照件免矫正,是目前开源文档解析领域"最强轻量解"。

如果你正在搭建文档解析管线,或对手机拍照场景的鲁棒性有要求,TeleOCR 值得成为你的第一候选。📄

【免费下载链接】TeleOCR项目地址: https://ai.gitcode.com/hf_mirrors/StarDoc-AI/TeleOCR

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/28 20:06:30

询盘留在WordPress后台还是同步CRM?规模是分水岭

询盘记录存在WordPress后台还是同步到CRM&#xff0c;这个问题我被问过不下二十次&#xff0c;答案从来不是非此即彼。先说结论&#xff1a;月询盘量在五十条以内、跟进人少于三个的团队&#xff0c;后台就够用&#xff1b;一旦团队和询盘量往上走&#xff0c;CRM该上就得上。我…

作者头像 李华
网站建设 2026/9/28 20:06:15

论文写作AI工具打分:2026年这6款差距不小

论文写作这事&#xff0c;卡在查重和AI检测上的不在少数。2026年了&#xff0c;市面上的AI写作工具多到挑花眼&#xff0c;但真正能扛住知网、维普那套检测逻辑的&#xff0c;其实没几个。这次我花了三周时间&#xff0c;用经管、计算机、文学三个方向的毕业论文当样本&#xf…

作者头像 李华
网站建设 2026/9/28 20:05:31

使用BP爆破tomcat9用户名+密码 部署jsp后门项目

tomcat官方下载地址如下,此处使用的是tomcat9.0.31 tomcat下载地址 下载后解压即可,然后为了测试使用方便,进行了如下配置 在目录conf下找到文件logging.properties ‌1.打开配置文件‌:用文本编辑器打开 Tomcat 安装目录下的 conf/logging.properties。 ‌2.修改编码‌:找…

作者头像 李华
网站建设 2026/9/28 20:04:33

24年408计组大题深度拆解:Cache映射与指令流水线考点全解析

1. 24年408计组大题到底考了什么先给结论&#xff1a;24年408计算机组成原理的两道大题&#xff08;43题和44题&#xff09;&#xff0c;一道主攻存储器层次与Cache映射&#xff0c;另一道落在指令流水线与数据通路上。这个组合其实不算意外&#xff0c;翻翻过去五年的真题分布…

作者头像 李华
网站建设 2026/9/28 20:04:03

IEPE传感器信号调理:CR隔直电路5个关键参数与避坑指南

IEPE传感器的供电和信号调理&#xff0c;说难不算难&#xff0c;但翻车的概率比很多人想象得高。我调试过一套振动监测采集板&#xff0c;问题就出在CR隔直电路上——一个看似不起眼的电容&#xff0c;直接把低频信号吃掉了一半&#xff0c;当时波形在示波器上怎么看怎么不对。…

作者头像 李华
网站建设 2026/9/28 19:59:35

DCS冗余DI卡CE4031S2T2B1:DeltaV M系列硬件组态与调试全解析

做DCS项目调试这些年&#xff0c;我越来越觉得机柜里最容易被忽略的往往不是控制器&#xff0c;而是那一排排不起眼的I/O卡件。数字量输入卡&#xff0c;听着简单&#xff0c;可它相当于控制系统的“眼睛”——现场阀门开到位没有、泵有没有运行、液位开关有没有动作&#xff0…

作者头像 李华