TeleOCR到底有多强?OmniDocBench等5大基准实测对比PaddleOCR-VL、MinerU与GPT-5
【免费下载链接】TeleOCR项目地址: https://ai.gitcode.com/hf_mirrors/StarDoc-AI/TeleOCR
TeleOCR 是一个仅约1.2B 参数的开源轻量级文档解析模型(视觉-语言模型,VLM),单个框架就能同时处理数字 PDF 文档和手机拍照的纸质文档。这篇文章将用 OmniDocBench、Wild_OmniDocBench、PureDocBench、Dr.DocBench 挑战赛和 ICDAR2026 Sci-ImageMiner5 大公开基准的实测数据,把它与 PaddleOCR-VL、MinerU 以及 GPT-5 系列大模型放在一起对比,帮你快速判断它到底值不值得用。🔍
📊 一图速览:TeleOCR 是什么?
在跑分之前,先花 30 秒认识一下这个模型:
| 项目 | 说明 |
|---|---|
| 参数规模 | 约 1.2B,消费级显卡即可部署 |
| 开源协议 | Apache-2.0 |
| 模型底座 | 基于 Qwen2.5-VL 架构(见 config.json 中的Qwen2_5_VLForConditionalGeneration) |
| 核心卖点 | 数字文档 + 拍照文档统一解析,拍照件无需矫正预处理 |
| 可解析内容 | 文本、公式、表格、代码、版式(布局) |
它和传统 OCR 工具最大的不同是:一张弯弯曲曲的手机照片直接丢进去,它不需要先做"去畸变"矫正,就能直接输出解析结果,这是很多竞品都做不到的。项目介绍详见 README.md,模型实现位于 modeling_naviocr.py。
🏆 基准一:OmniDocBench v1.6 官方榜——1.2B 打赢 235B
OmniDocBench 是文档解析领域最权威的公开基准之一,同时考核文本、公式、表格和阅读顺序。实测结果如下(节选自 README.md 中的实验数据):
| 模型 | 参数 | Overall ↑ | Text Edit ↓ | Formula CDM ↑ | Table TEDS ↑ |
|---|---|---|---|---|---|
| TeleOCR | 1.2B | 96.87 | 0.027 | 96.36 | 97.05 |
| OvisOCR2 | 0.8B | 96.58 | 0.025 | 97.53 | 94.76 |
| PaddleOCR-VL-1.6 | 0.9B | 96.33 | 0.033 | 97.49 | 94.76 |
| MinerU2.5-Pro | 1.2B | 95.75 | 0.036 | 97.45 | 93.42 |
| GLM-OCR | 0.9B | 95.22 | 0.044 | 97.18 | 92.83 |
| PaddleOCR-VL | 0.9B | 94.11 | 0.040 | 95.70 | 90.65 |
| Gemini 3 Pro | 未知 | 92.85 | 0.064 | 95.83 | 89.15 |
| Qwen3-VL-235B | 235B | 89.78 | 0.063 | 92.53 | 83.07 |
| GPT-5.2 | 未知 | 86.52 | 0.114 | 88.00 | 82.95 |
三个关键结论:
- 综合分 96.87 登顶,超过同为 1.2B 的 MinerU2.5-Pro(95.75)和 PaddleOCR-VL-1.6(96.33);
- 表格解析是最大杀器:Table TEDS 97.05 全场最高,PaddleOCR-VL 系列只有 90~95;
- 降维打击通用大模型:参数只有 GPT-5.2 的几百分之一的 TeleOCR,综合分领先 10 分以上。文档解析这件事上,"专"确实能胜"大"。💪
📷 基准二:Wild_OmniDocBench——真实场景才见真章
官方基准里的文档都"太干净了"。Wild_OmniDocBench 专门收集真实世界里的复杂文档(复杂背景、光照不均、排版混乱),是更贴近实际使用的考试:
| 模型 | 类型 | Overall ↑ | Text Edit ↓ | Table TEDS ↑ |
|---|---|---|---|---|
| TeleOCR | 解耦式 VLM | 88.53 | 0.1173 | 89.05 |
| PaddleOCR-VL-1.6 | 解耦式 VLM | 87.36 | 0.1369 | 85.76 |
| MinerU2.5-Pro | 解耦式 VLM | 87.33 | 0.1362 | 85.46 |
| OvisOCR2 | 端到端 VLM | 87.91 | 0.129 | 85.13 |
| GLM-OCR | 解耦式 VLM | 85.08 | 0.1514 | 81.31 |
在"难度拉满"的题库里,TeleOCR 依然保持第一,且文本和表格两项均为全场最佳——差距虽小,但五项指标没有一项落后,说明它不是靠某一项刷分。
🔬 基准三:PureDocBench——抗退化能力碾压大模型
PureDocBench 把同一份文档分别放在干净、数字退化、真实退化三种条件下考察模型。这正是"拍照文档解析"的核心考验:
| 模型 | 干净 Overall | 数字退化 Overall | 真实退化 Overall |
|---|---|---|---|
| TeleOCR | 86.90 | 77.47 | 70.85 |
| OvisOCR2 | 82.14 | 77.77 | 66.61 |
| MinerU2.5-Pro | 75.87 | 71.77 | 62.56 |
| PaddleOCR-VL-1.5 | 73.01 | 66.73 | 60.50 |
| Gemini-3.1-Pro | 70.04 | 69.28 | 71.98 |
- 干净文档:TeleOCR 以 86.90 领先第二名 OvisOCR2 约 4.8 分;
- 真实退化(模糊、光照差、拍摄角度歪斜):TeleOCR 70.85 第一,连 Gemini-3.1-Pro 这类旗舰通用模型都拿它没办法——退化的纸质扫描件恰恰是通用大模型的软肋。📉
🥇 基准四:Dr.DocBench 挑战赛(EMNLP 2026)
在 EMNLP 2026 举办的 Dr.DocBench 文档解析挑战赛中,TeleOCR 以原始权重直接参赛:
| 模型 | overall ↑ | Text edit ↓ | formula cdm ↑ | Table teds ↑ |
|---|---|---|---|---|
| TeleOCR | 67.96 | 0.1903 | 0.02 | 64.97 |
| MinerU 2.5 Pro | 62.26 | 0.3402 | 0.04 | 67.75 |
| OvisOCR2 | 59.25 | 0.3883 | 0.00 | 61.59 |
| PaddleOCR-VL 1.6 | 55.11 | 0.4364 | 0.21 | 51.34 |
领先第二名 MinerU 2.5 Pro 约5.7 分,PaddleOCR-VL 1.6 则是 12.8 分的大胜。文本识别(Text edit 0.1903,越低越好)优势尤其明显。
🧪 基准五:ICDAR2026 Sci-ImageMiner——科学图表提取冠军
这个赛道考核的是从科学插图中提取隐含表格数据的高难任务(论文配图里的曲线、柱状图 → 结构化数据):
| 排名 | 队伍 | RMS | TEDS | 加权总分 |
|---|---|---|---|---|
| 1 | TeleOCR | 17.23 | 66.39 | 41.81 |
| 2 | VLMinators | 17.29 | 64.31 | 40.80 |
| 3 | Ricoh_SRCB | 16.23 | 61.12 | 38.67 |
| 6 | Qwen3-VL 8B | 14.08 | 57.86 | 35.97 |
TeleOCR 以加权总分41.81 夺得冠军,领先第二名接近 1 分。这意味着处理科研论文时,它不仅能解析正文里的表格,还能把"图"里藏的数据捞出来。
🧩 一个模型,解析文档的所有内容
TeleOCR 把"文档解析"拆成 5 个可单独调用的能力,用不同提示词(prompt)即可切换:
| 任务 | 说明 | 官方示例素材 |
|---|---|---|
| 文本识别 | 正文、段落直接转文本 | assets/text.png |
| 公式识别 | 公式图片 → LaTeX | assets/formula.png |
| 表格识别 | 输出 OTSL 格式,可转 HTML 表格 | assets/table.png |
| 代码识别 | 代码截图 → 源码 | assets/code.png |
| 版式分析 | 整页布局定位(含畸变文档) | assets/layout.jpg、assets/layout_distorted.jpg |
上图是一个典型的多行数学公式解析示例——TeleOCR 能将此类公式图片识别为可渲染的 LaTeX 源码,公式 CDM 分数在 OmniDocBench 上高达 96.36。
对于畸变的拍照文档,TeleOCR 还内置了**"多点版式分割分析"**能力:直接对弯曲、倾斜的页面做布局定位,无需专门的矫正模型,这也是它 Wild/PureDocBench 抗退化成绩领先的底气所在。
🧠 为什么 1.2B 能做到?6 项核心技术
跑分领先不是运气,README.md 中列出了支撑成绩的 6 项关键设计:
- 多节点共识投票(MCV):自动生产高质量伪标签,解决标注数据不足的老大难问题;
- 几何感知文档建模:专为手机拍照文档设计,直接理解弯曲、透视畸变;
- 曲率引导 Douglas-Peucker 采样(CGDP):沿文档曲线智能采样,保留关键几何信息;
- 图像到图像自验证:模型自己检查自己,自动清洗错误数据;
- 渐进式四阶段训练流水线:分阶段训练,从易到难逐步提升;
- 内容-结构解耦学习:表格和公式的"内容"与"结构"分开学习,这正是它 Table TEDS 97.05 的第一名由来。
🚀 3 分钟上手:安装与首次文档解析
部署门槛很低,两条命令即可开始。👇
第 1 步:安装依赖
pip install transformers torch pillow第 2 步:加载模型并解析一张图片
from PIL import Image from transformers import AutoProcessor, AutoModel import torch processor = AutoProcessor.from_pretrained( "StarDoc-AI/TeleOCR", trust_remote_code=True, use_fast=True) model = AutoModel.from_pretrained( "StarDoc-AI/TeleOCR", trust_remote_code=True, torch_dtype=torch.bfloat16).cuda().eval() # 文本解析 image = Image.open("./assets/text.png").convert("RGB") print(infer(image, "Please output the text content from the image."))完整的推理与后处理代码(含 OTSL 表格转 HTML、公式 LaTeX 规范化)可以直接参考 README.md 中的 Quick Start 部分,模型分词与推理行为定义在 tokenizer_config.json 和 generation_config.json 中。如果想在本地拉取仓库试用:
git clone https://gitcode.com/hf_mirrors/StarDoc-AI/TeleOCR✅ 谁适合用 TeleOCR?
| 你的场景 | 推荐度 | 理由 |
|---|---|---|
| 自建文档数字化流水线 | ⭐⭐⭐⭐⭐ | 开源 Apache-2.0,1.2B 可私有化部署 |
| 大量手机拍照的票据/表单解析 | ⭐⭐⭐⭐⭐ | 无需矫正预处理,抗退化第一 |
| 科研论文表格/插图数据提取 | ⭐⭐⭐⭐⭐ | ICDAR2026 冠军,科学图表提取最强 |
| 消费级显卡本地跑 OCR | ⭐⭐⭐⭐⭐ | 1.2B 参数,显存占用远低于 30B+ 大模型 |
| 通用多模态对话 | ⭐ | 它是文档解析专家,不是聊天模型 |
❓ 常见疑问快速解答
Q1:1.2B 参数真的够用吗?在 5 个基准上,TeleOCR 的综合成绩普遍领先参数 2~200 倍的通用 VLM(如 Qwen3-VL-235B、InternVL3.5-241B)。文档解析是"专精赛道",小模型反而更优。
Q2:手机拍的弯歪照片要先矫正吗?不用。几何感知建模 + 多点版式分割让它直接解析畸变文档,DocUNet、DIR300 数据集上的可视化结果均验证了这一点。
Q3:表格和公式的输出格式?表格默认输出 OTSL 标记,官方提供一键转 HTML<table>的逻辑(含合并单元格);公式输出 LaTeX(自动补$$定界符)。
📌 总结
- 5 大基准全部第一:OmniDocBench 96.87、Wild 88.53、PureDocBench 86.90、Dr.DocBench 67.96、ICDAR2026 冠军;
- 对比结论:表格解析胜 PaddleOCR-VL、整体稳超 MinerU 2.5 Pro、碾压 GPT-5 系列与 Gemini 旗舰;
- 落地友好:1.2B + Apache-2.0,拍照件免矫正,是目前开源文档解析领域"最强轻量解"。
如果你正在搭建文档解析管线,或对手机拍照场景的鲁棒性有要求,TeleOCR 值得成为你的第一候选。📄
【免费下载链接】TeleOCR项目地址: https://ai.gitcode.com/hf_mirrors/StarDoc-AI/TeleOCR
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考