news 2026/7/21 8:10:03

MinerU2.5-Pro: Pushing the Limits of Data-Centric Document Parsing at Scale——以数据为中心,大规模推动文档解析的极限

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
MinerU2.5-Pro: Pushing the Limits of Data-Centric Document Parsing at Scale——以数据为中心,大规模推动文档解析的极限

MinerU2.5-Pro 的核心主张是:在模型架构日趋成熟的当下,系统化的数据工程比架构创新能带来更大的性能提升。该工作在不改变 MinerU2.5 任何模型架构(保持 12 亿参数不变)的前提下,仅通过数据层面的优化,在 OmniDocBench v1.6 上实现了 95.69 的总分,比基线提升 2.71 分,超越了所有现有方法(包括参数量大 200 倍以上的模型)。

一、研究动机与核心洞察

1.1 问题发现:瓶颈在于数据而非架构

作者对多种最先进文档解析模型(涵盖不同架构和参数规模)进行交叉分析,发现了一个关键现象:这些模型在相同的困难样本上表现出高度一致的失败模式。这表明系统性错误超越了特定架构的差异,共同根源在于训练数据的缺陷,而非模型设计本身。

1.2 数据瓶颈的两个维度

  • 覆盖率不足:训练数据总量小(MinerU2.5 不足 1000 万页),且集中在高频类别,对复杂嵌套表格、密集公式等长尾场景覆盖严重不足。

  • 标注质量悖论:对模型改进最有价值的困难样本,恰恰是自动标注最不可靠的样本——没有主流模型能稳定正确地解析它们,导致标注噪声在训练中直接传导。

二、三大核心贡献

2.1 数据引擎(Data Engine)

围绕覆盖率(Coverage)信息量(Informativeness)标注准确性(Accuracy)三个维度协同设计,包含三个核心组件:

(1)多样性与难度感知采样(DDAS)

在页面级和元素级两个粒度上联合优化多样性和难度:

  • 页面级:用 ViT-base 对页面做特征嵌入和 K-Means 聚类,结合 CMCV 难度标签调整采样权重,纠正分布偏移。

  • 元素级:分别对文本、公式、表格块进行独立聚类和难度评估。

  • 最终采样在联合的聚类-难度空间中进行平衡采样,提高 Medium 和 Hard 样本的权重。

效果:训练数据从不足 1000 万页扩展到6550 万页

(2)跨模型一致性验证(CMCv)

用三个异构模型(MinerU2.5、PaddleOCR-VL、Qwen3-VL-30B)独立解析候选数据,基于输出一致性将样本分为三个难度等级:

  • Easy:MinerU2.5 与至少一个外部模型一致 → 自动标注可靠。

  • Medium:两个外部模型一致,但 MinerU2.5 偏离 → 外部共识提供伪标签,训练价值最高。

  • Hard:三个模型全部显著分歧 → 需要后续精炼或专家标注。

这解决了单模型方法无法区分"模型特定盲点"与"普遍困难"的问题。

(3)评判与精炼(Judge-and-Refine)标注流程

针对 Hard 样本:

  • 采用"渲染-验证"机制:将 LaTeX 公式编译、HTML 表格渲染为图像,与原始文档图像配对输入模型进行迭代修正。

  • 渲染过程的错误放大效应将文本域中的细微结构缺陷(如缺失对齐符号)转化为显著的视觉异常,使缺陷易于检测。

  • 超出自动修正范围的样本,路由到目标明确的专家标注,标注预算优先分配给错误已定位但未修正、以及当前模型最弱子任务的样本。

2.2 三阶段渐进式训练策略

阶段数据规模作用
阶段 1:大规模 SFTEasy + Medium(CMCV 自动标注)6550 万建立全面的基础能力,贡献最大单阶段提升(+1.31)
阶段 2:困难样本 SFT192K 专家标注 Hard + 按比例混合的重放数据390 万强化困难场景,表格识别提升最显著(TEDS +2.50)
阶段 3:GRPO 对齐专家标注集(中等奖励范围)192K直接优化任务级指标(编辑距离、CDM、TEDS、IoU),公式 CDM 提升最明显(+0.81)

各阶段学习率递减(1×10⁻³ → 5×10⁻⁵ → 1×10⁻⁵),体现从粗调向精调的递进。

2.3 OmniDocBench v1.6 评估协议

升级原有基准的两个缺陷:

(1)多粒度自适应匹配(MGAM)

  • 修正了 v1.5 中固定粒度匹配导致的评分偏差(例如,语义正确的多行公式因分割粒度不同而得低分)。

  • 核心原则:保持真实标签不变,仅在预测端通过直接二分匹配 → 预测分割+匹配 → 分区枚举+匹配三阶段搜索最优粒度方案。

(2)Hard 子集与三层协议

  • 新增 296 页 Hard 样本(选自数据引擎难度分层),覆盖最挑战性场景。

  • 建立Base(1,355页)/ Hard(296页)/ Full(1,651页)三层评估框架,Hard 子集有效区分了模型能力(顶尖模型在此差距明显拉大)。

三、实验结果亮点

3.1 端到端解析(OmniDocBench v1.6 Full)

  • MinerU2.5-Pro总分 95.69,超越同架构基线 2.71 分。

  • 在 Base 子集上,前三名差距 < 0.5 分,表明标准场景已趋饱和。

  • 在 Hard 子集上,MinerU2.5-Pro(94.08)领先第二名 2.07 分,验证了 Hard 子集的区分能力。

  • 在公式 CDM(97.29)、表格 TEDS(93.42)、阅读顺序(0.120)上均取得最佳。

3.2 元素级解析(纯内容识别)

  • 文本识别:编辑距离 0.019,比基线降低 30.5%。

  • 公式识别:在 9 个基准中的 5 个取得第一,OmniDocBench Base 上 CDM 达 99.20(接近上限)。

  • 表格识别:Overall TEDS 91.10,比基线提升 3.16 个百分点,Hard 子集上提升最为显著(+4.18)。

3.3 扩展能力(不影响基准评分,但提升实际可用性)

  • 图像感知解析:对图表、含文本图像等进行分类并差异化提取结构化内容。

  • 截断段落合并:在多栏或复杂布局中,自动判断相邻文本块是否应合并为连续段落。

  • 跨页表格合并:对分页表格进行逐列语义判断,自动拼接完整表格。

  • 表内图像处理:用占位符标记表内图像,最终还原为<img>引用。

四、局限性与未来方向

作者坦诚指出了三个开放问题:

  1. 语义等价评估:MGAM 虽改进了匹配公平性,但相同内容的不同格式/结构表示(如 HTML vs. Markdown 表格、不同 LaTeX 命令)的等价性判断仍是难题。

  2. 领域适应:OmniDocBench 覆盖主流场景,但对金融、法律、医疗等垂直领域需构建专用评估集;且模型接近人类水平时,标注精度本身成为挑战。

  3. 从解析到理解:当前聚焦内容准确性,未来应从"内容提取"推进到"结构化语义理解"(如层级关系、图文引用绑定、跨页连续性)。

MinerU2.5-Pro 的核心贡献是以严谨的实证研究证明:在文档解析领域,系统化的数据工程(覆盖率 + 信息量 + 标注精度)是当前阶段比模型架构更有效的性能杠杆,并通过开源的数据引擎、训练策略和评估协议为社区提供了可复现的实践路径。这里是自己的论文阅读记录,感兴趣的话可以参考一下,如果需要阅读原文的话可以看这里,如下所示:

项目地址在这里,如下所示:

预训练模型权重在这里,如下所示:

当前的文档解析方法主要通过模型架构创新来推进,而对训练数据的系统性工程化研究则相对不足。然而,跨越不同架构和参数规模的最先进模型在相同的困难样本上却表现出高度一致的失败模式,这表明性能瓶颈源于训练数据共有的缺陷,而非架构差异。基于这一发现,我们提出了 MinerU2.5-Pro,它在保持 MinerU2.5 的 12 亿参数架构不变的前提下,仅通过数据工程和训练策略设计就推动了最先进水平的发展。其核心是一个围绕覆盖率(Coverage)、信息量(Informativeness)和标注准确性(Annotation Accuracy)协同设计的数据引擎(Data Engine):多样性与难度感知采样(Diversity- and- Difficulty- Aware Sampling)将训练数据从不足 1000 万样本扩展到 6550 万,同时缓解了分布偏移;跨模型一致性验证(Cross- Model Consistency Verification)利用异构模型的输出共识来评估样本难度并生成可靠的标注;评判与精炼(Judge- and- Refine)流程通过“渲染-验证”迭代修正来提高困难样本的标注质量。一个三阶段的渐进式训练策略——大规模预训练、困难样本微调和 GRPO 对齐——按质量层次依次利用这些数据。在评估方面,我们修正了 OmniDocBench v1.5 中的元素匹配偏差,并引入了一个 Hard 子集,建立了更具区分度的 OmniDocBench v1.6 评估协议。在没有任何架构修改的情况下,MinerU2.5-Pro 在 OmniDocBench v1.6 上达到了 95.69 分,比同架构基线提高了 2.71 分,并超过了所有现有方法,包括那些基于参数规模大 200 倍以上的模型的方法。

图 1: 在 OmniDocBench v1.6 上的性能比较,该基准包含 Base(标准样本)、Hard(挑战性样本)和 Full(整体)三个子集。MinerU2.5-Pro 构建于 MinerU2.5 [25] 之上,其 12 亿参数架构完全保持不变,仅通过数据工程和训练策略设计,将整体得分从 92.98 提升至 95.69,超越了专门的文档解析模型(如 GLM-OCR [11]、PaddleOCR-VL-1.5 [8]、Youtu-Parsing [45])和通用 VLM(如 Gemini 3 Pro、Qwen3-VL-235B [43])。详细结果见表 2。

1 引言

文档解析将 PDF 等非结构化文档转换为结构化的机器可读格式(如 Markdown),是 LLM 训练数据流水线 [49, 29, 35] 和检索增强生成系统 [15, 37, 48] 的关键基础设施。随着基于视觉语言模型(VLM)的端到端方法逐步取代传统的流水线系统 [2, 39, 25],研究主要集中在架构创新和推理效率上,导致顶尖模型在标准基准上的得分迅速收敛。

然而,这种收敛引发了一个更深层次的问题:剩余的性能瓶颈究竟是什么?我们对多种最先进模型——涵盖不同架构和参数规模——在大型真实世界 PDF 上的解析结果进行了交叉分析,揭示出一个显著的模式:这些模型在相同的困难样本上表现出高度相似的失败模式,某些解析错误在所有测试系统中普遍存在。由于这些系统性失败超越了任何特定架构,它们指向一个共同的根源:当前文档解析的性能瓶颈主要源于训练数据共有的缺陷,而非模型架构本身。

这种数据瓶颈体现在两个相互关联的维度。首先,覆盖率不足:例如,MinerU2.5 的训练数据总计不足 1000 万页,且分布集中在高频类别上,严重缺乏对长尾场景(如复杂嵌套表格和密集公式布局)的覆盖。其次,标注质量悖论:对模型改进贡献最大的困难样本,恰恰是自动标注最不可靠的样本,因为没有主流模型能够稳定地正确解析它们。复杂表格的结构化标注和密集公式的 LaTeX 转录极易出错,而这些标注噪声在监督微调过程中会直接传导至模型行为。这两个问题紧密交织:单纯扩大数据规模不足以提升性能上限,因为新增数据只会放大现有的分布偏差和标注噪声。

除了数据问题,我们的交叉分析还揭示了现有评估框架中的盲点。OmniDocBench v1.5 包含的困难样本相对较少,其元素匹配逻辑对特定输出格式存在系统性偏差,引入了评分偏差,使跨系统的公平比较变得复杂。因此,我们引入了 OmniDocBench v1.6,修正了这些匹配偏差,并纳入了一个专用的 Hard 子集,建立了 Base/Hard/Full 三层评估协议。

基于以上分析,我们认为,随着模型架构日趋成熟,系统化的数据工程成为推动文档解析性能提升的主要杠杆。为了验证这一假设,我们构建了 MinerU2.5-Pro——完全保留了 MinerU2.5 [25] 相同的 12 亿参数解耦粗到细架构,并将所有优化聚焦于数据引擎和训练策略,确保所有性能提升都归因于数据层面的改进。在 OmniDocBench v1.6 上,MinerU2.5-Pro 达到了 95.69 分(基线 92.98 分,+2.71),超越了所有现有方法,包括参数规模大 200 倍以上的模型(图 1)。

我们的贡献总结如下:

  • 一个围绕覆盖率、信息量和标注准确性协同设计的数据引擎。它包含三个核心组件——多样性与难度感知采样(DDAS)、跨模型一致性验证(CMCv)以及评判与精炼(Judge-and-Refine)标注流程——共同将训练数据从不足 1000 万页扩展到 6550 万页,同时通过从采样到精炼的闭环流程系统性地提高了标注质量。

  • 一个三阶段渐进式训练策略——大规模预训练、高质量困难样本微调和 GRPO 格式对齐——与数据引擎产生的数据质量层次相匹配。仅凭这些数据和训练改进,相同的 12 亿参数模型就在 OmniDocBench v1.6 上达到了最先进的性能,超越了所有现有方法。

  • OmniDocBench v1.6,一个升级的评估协议,通过多粒度自适应匹配(Multi-Granularity Adaptive Matching)修正了 v1.5 中的元素匹配偏差,并引入了一个 Hard 子集,建立了 Base/Hard/Full 三层框架,以实现更公平和更具区分度的评估。

2 相关工作

2.1 文档解析方法

现有的文档解析方法根据系统架构可分为三种范式。

基于流水线的方法。这些方法将文档解析分解为独立的子任务——布局检测、文本识别、表格提取、公式识别——并以级联方式执行 [35, 50, 21, 28, 7]。这种模块化设计允许对每个组件进行独立优化,但存在错误传播和模块间信息丢失的问题。

端到端 VLM 方法。这些方法直接将文档图像映射到结构化输出,避免了流水线方法中固有的级联错误。Nougat [2] 基于 Donut 架构 [16],为学术文档的图像到标记(image-to-markup)范式建立了强大的基线;GOT-OCR 2.0 [39] 将场景文本和文档 OCR 统一在一个单一模型中。后续工作如 Ocean-OCR [3]、olmOCR [29] 和 dots.ocr [18] 采用原生分辨率视觉编码器以进一步提升性能。然而,原生分辨率处理会产生 O(N2) 的令牌复杂度,给高分辨率文档带来了效率瓶颈。

解耦 VLM 方法。这些方法将布局分析与内容识别分离,结合了流水线方法的可控性和 VLM 的语义建模能力。早期工作如 Dolphin [12] 和 MonkeyOCR [19] 证明了这种范式的可行性,但在分辨率处理或系统复杂性方面面临限制。MinerU2.5 [25] 将布局分析和内容识别统一在一个具有原生分辨率支持的 12 亿参数模型中 [26],平衡了分辨率保真度、效率和部署复杂性。后续工作沿着不同方向扩展了解耦范式:用于提高吞吐量的多令牌预测 [11]、用于提高解析效率和鲁棒性的基于扩散的解码 [9]、非平面文档处理 [8]、野外鲁棒性 [32] 以及高压缩视觉-文本映射 [40]。通用 VLM 如 Gemini 2.5 Pro [5] 和 Qwen2.5-VL-72B [1] 也取得了有竞争力的结果,尽管它们的大参数规模阻碍了在生产规模上的成本效益部署。

在这些工作中,方法论演进的主线集中在架构设计和推理效率上,而训练数据的系统性工程化——协同优化覆盖率、信息量和标注准确性——尚未作为一个独立的研究问题得到充分探索。我们的工作解决了这一维度,并且在很大程度上与上述架构进步是互补的。

2.2 以数据为中心的人工智能

以数据为中心的人工智能范式 [24, 47] 主张在保持模型固定的同时系统性地提高数据质量,并已在视觉-语言预训练 [14] 和大语言模型微调 [53] 中得到验证。然而,在文档解析中,数据工程仍然支离破碎:olmOCR [29] 强调数据规模扩展而非质量分层;DocGenome [42] 仅限于学术论文,缺乏难度区分;现有的技术报告 [25, 11, 8] 描述了训练数据,但将其视为模型训练的先决条件,而非独立的研究课题。

我们的工作将文档解析的数据构建视为一个独立的系统性研究问题,在一个统一的框架内协同优化覆盖率、信息量和标注准确性。在方法论上,我们的 CMCV 方法借鉴了基于集成的主动学习 [30] 和委员会查询(query-by-committee)[13] 的核心原则,利用多模型分歧来量化样本的信息量。除了基于分歧的标准选择之外,CMCV 还将难度信息与下游标注策略在一个闭环中耦合起来,并通过评判与精炼(Judge-and-Refine)流程解决了文档解析特有的困难样本标注不可靠的挑战。

2.3 文档解析评估

文档解析评估涉及指标设计和评估协议两个层面。在指标层面,文本识别常用编辑距离 [17],表格结构恢复使用 TEDS [51],公式识别最近从 BLEU 转向了 CDM(字符检测匹配)[36]。OmniDocBench [27] 整合了所有三种指标,提供了迄今为止最全面的文档解析评估框架之一;OCRBench [20] 和 CC-OCR [44] 则侧重于评估多模态模型的整体 OCR 能力。

图 2:数据引擎流程概览。该系统通过三个协同阶段——多样性与难度感知采样(DDAS)、跨模型一致性验证(CMCV)和困难样本标注流程(Annotation Pipeline for Hard Case)——协同优化三个维度:覆盖率、信息量和准确性。

然而,在协议层面,元素匹配策略对评估公平性的关键影响在很大程度上被忽视了。端到端系统在输出粒度、分割策略和格式约定方面各不相同,匹配算法的选择会系统性地影响评估分数。我们识别出 OmniDocBench v1.5 中存在的此类系统性偏差,并在 v1.6 中通过多粒度自适应匹配(Multi-Granularity Adaptive Matching,详见第 5 节)进行了修正。

3 数据引擎

为了解决上述数据缺陷,我们首先检查了现有数据流程的局限性。MinerU2.5 [25] 构建了一个包含基于聚类的采样、迭代模型推理一致性(IMIC)困难样本挖掘和基于模型的标注优化的数据流程,但这些组件独立运行,没有对覆盖率、信息量和准确性进行联合优化:采样不受难度信息指导,标注优化对样本难度采用统一策略,而 IMIC 挖掘出的困难样本仍然面临不可靠的自动标注。类似的局限性也存在于 PaddleOCR-VL-1.5 的不确定性感知聚类采样(UACS)[8] 中。

MinerU2.5-Pro 的数据引擎是围绕这三个维度协同设计的。DDAS 通过任务感知聚类扩展数据覆盖率并缓解分布偏移(第 3.1 节)。CMCV 通过多模型交叉验证对采样数据进行难度分层,识别出高信息量样本(第 3.2 节)。困难样本的标注流程通过“渲染-验证”迭代修正来提高标注准确性,对于超出自动修正范围的残余样本,则交由目标明确的专家标注以保证最终质量(第 3.3 节)。这些组件共同形成了一个从粗到细的质量递进,实现了数据规模化(小于 1000 万 →→ 6550 万)和标注质量提升的同步进行。整个流程如图 2 所示。

图 3:DDAS 流程在两个粒度级别上运行。上方:用于布局检测数据的页面级采样——来自 PDF 池的页面通过 ViT-base 进行嵌入、聚类,并通过联合加权聚类多样性和 CMCV 推导的难度进行重采样,产生约 6000 万页分布和难度覆盖均衡的数据。下方:元素级采样——选中的页面由布局检测模型解析为文本、公式和表格块;每种元素类型独立聚类并由 CMCV 评估,然后在元素粒度上采样以平衡多样性和难度。两个级别相结合,产生用于布局、文本、公式和表格子任务的最终训练数据。

3.1 多样性与难度感知数据采样

文档解析的训练数据存在典型的長尾分布问题:高频类别(如标准学术论文、单栏报告)主导数据池,而长尾场景如复杂嵌套表格、密集公式布局和非常规多栏布局则严重缺乏代表性。如上所述,现有方法 [25, 8] 依赖单模型信号进行难度估计,无法区分模型特定的弱点与普遍困难的样本。

我们提出了多样性与难度感知采样(DDAS),它在页面和元素两个粒度上联合优化多样性和难度。DDAS 的核心是跨模型一致性验证(CMCv,详见第 3.2 节),它利用异构模型间的预测一致性将样本分为 Easy/Medium/Hard 三个难度等级。整体流程如图 3 所示。

阶段 1:页面级采样。文档池中的页面使用 ViT-base 特征(512 维)进行嵌入,并通过 K-Means 聚类分组。然后,从每个聚类中进行初步均匀采样,并通过页面级 CMCV(第 3.2 节)评估以获得难度标签。基于每个聚类内得到的难度分布,调整采样权重:以 Easy 样本为主的聚类权重降低,难度分布多样的聚类权重提高,而以无效内容(非目标语言、空白页等)为主的聚类则被过滤掉。使用调整后的权重,我们从原始文档池中扩展采样,以获得带有 CMCV 难度标注的完整页面级候选集。

阶段 2:元素级采样。从页面级候选集中,我们使用 MinerU2.5 和 PaddleOCR-VL 布局检测模型提取单个元素(文本、公式和表格块)。对于每种元素类型,提取视觉特征并独立聚类,同时元素级 CMCV 分配难度标签。在此阶段,所有四个子任务——布局、文本、公式和表格——都拥有沿多样性(聚类)和难度(CMCv)两个维度的标注。

最终采样。在联合的聚类-难度空间中对所有四个子任务进行平衡采样:沿多样性维度,对大聚类进行下采样,对小聚类进行上采样以纠正長尾偏移;沿难度维度,提高 Medium 和 Hard 样本的权重以增强训练信号的信息量。最终输出是一个覆盖所有子任务并平衡多样性与难度的 SFT 训练集。

通过在页面和元素粒度上将聚类与 CMCV 相结合,DDAS 使得采样决策能够同时考虑数据分布和训练价值,在控制总数据量的同时最大化训练信号的密度。

3.2 跨模型一致性验证

DDAS 依赖难度标签来指导采样权重分配,并且后续的标注优化和专家标注也需要难度信息来确定资源投入策略。然而,对于海量无标签数据,真实标签是不可得的。MinerU2.5 [25] 中的 IMIC 和 PaddleOCR-VL-1.5 [8] 中的 UACS 使用单模型多次推理的输出一致性作为难度代理。这种范式仅捕捉了单模型的认识不确定性,无法区分模型特定的盲点和普遍困难的问题——前者可通过跨模型共识直接修正,而后者则需要额外的质量优化甚至人工干预。这种区分对于标注策略的选择至关重要。

我们提出了跨模型一致性验证(CMCv),它将难度评估从单模型内省扩展到多模型交叉验证。其基本前提是直观且有经验支持的:当多个异构模型对给定样本产生一致的输出时,结果极有可能是正确的;当所有模型都出现显著分歧时,该样本确实困难,且没有一个模型能够可靠地解析它。基于此前提,我们让三个异构文档解析模型(MinerU2.5 [25]、PaddleOCR-VL [6]、Qwen3-VL-30B [43])独立运行于 DDAS 产生的候选数据上,计算特定于任务的成对一致性指标(文本:编辑距离;表格:TEDS;公式:CDM),并根据一致性模式将每个样本分为三个难度等级。由于 MinerU2.5 是待改进的目标模型,我们将其相对于外部模型的性能作为锚点来定义难度分类:

  • Easy: MinerU2.5 的输出与至少一个外部模型高度一致。模型共识表明解析结果是可靠的,任何模型的输出都可以直接作为标注。

  • Medium: 两个外部模型彼此一致,但 MinerU2.5 与两者都有显著差异。外部共识提供了一个可靠的伪标签。

  • Hard: 所有三个模型的输出均存在显著的成对分歧,无法通过模型共识获得可靠标注。

这三个数据类别在训练中扮演不同角色。Easy 数据丰富且标注可靠,构成了基础能力建设的支柱,但模型已基本掌握这些场景,其边际训练价值有限。Medium 数据具有最高的训练价值——它精确指出了 MinerU2.5 相对于同类模型的能力差距,而外部模型的成功解析证明了这些样本是可学习的,且外部共识可直接提供无需进一步修正的可靠标注。Hard 数据对于能力突破至关重要,但其标注不可靠,需要后续的评判与精炼(Judge-and-Refine)修正或专家标注后才能安全使用。这三类数据各自的优势和局限自然引出了下文描述的标注流程。

因此,CMCV 能够在无需人工标注的情况下对海量无标签数据进行快速的难度评估,使得大规模数据扩展和迭代成为可能。由于 Medium 数据稀缺但最有价值,我们在 DDAS 采样中优先提高其比例。这三类数据的最佳比例因子任务而异——公式和表格识别对 Hard 样本更敏感,而文本识别则从 Medium 样本中获益更多。

3.3 困难样本的标注流程

CMCV 为 Easy 和 Medium 样本提供了可靠的自动标注。然而,Hard 样本——所有模型都无法达成共识的数据——如果直接用于训练,会引入标注噪声,反而降低模型性能。在不依赖大规模人工标注的情况下,提高这些关键样本的标注质量,是推动数据引擎从“过滤”走向“精炼”的核心挑战。为此,我们设计了一个两阶段流程:一个自动化的“评判与精炼”(Judge-and-Refine)修正循环,随后对残余失败案例进行有针对性的专家标注。

评判与精炼(Judge-and-Refine)标注流程。提高 Hard 样本标注质量的一个自然方法是引入测试时计算,通过一个迭代的“评判-修正”机制让模型检查并优化自身的解析结果。然而,朴素的自我反思存在系统性偏差,倾向于接受自身输出:当被要求检查自己的输出时,模型往往确认结果为正确,而忽略存在的错误。根本原因在于跨模态映射的不对称性——模型擅长从文档图像生成结构化序列,但难以从结构化序列推断视觉外观。对于复杂的结构映射,如 LaTeX 公式和 HTML 表格,模型无法在隐式空间中准确判断输出序列渲染后的视觉效果,这严重削弱了其检测结构错误的能力。

为了打破这一瓶颈,我们将“渲染-验证”融入迭代修正循环:我们将 LaTeX 公式编译、HTML 表格渲染成图像,然后将原始文档图像和渲染后的图像作为配对输入,连同评判与精炼提示一起提供给模型。这种设计有两个优势。首先,它弥补了从结构化文本到视觉布局的缺失映射,降低了跨模态推理的负担。其次,渲染的错误放大效应将文本领域中细微的结构缺陷(如缺失对齐符号、未闭合标签)转化为显著的视觉异常或布局崩溃,使得缺陷通过视觉比较易于检测。

基于此设计,我们构建了一个视觉比较驱动的“评判与精炼”迭代修正流程。该流程使用 Qwen3-VL-235B 作为评判-精炼模型——选择它是因为其强大的多模态推理能力,以及它独立于 CMCV 模型池,避免了错误检测中的系统性偏差。通过原始文档图像和渲染图像之间的直接视觉比较,进行多轮错误定位和针对性修正。经过此流程处理后,仍有部分极其复杂的案例超出自动修正能力;这些样本将被送入专家标注工作流。

有针对性的专家标注。对于仍超出自动修正范围的 Hard 样本,我们引入专家人工标注以保证最终质量。标注预算根据评判与精炼的中间输出,沿着两个优先轴进行分配:

  1. 修正效率:评判阶段以高置信度定位了错误但精炼阶段未能修正的样本获得最高优先级——标注员只需在已识别位置进行局部修正,从而最大化标注吞吐量。

  2. 边际影响:在上述池内,进一步优先处理当前模型最弱的子任务类别(由 CMVC 分歧模式确定),以最大化有限标注预算对整体性能的边际贡献。

人工标注遵循 AI 预标注和专家审核修正的工作流。对于预标注,我们使用 Gemini 3 Pro——选择它是因为其强大的多模态推理能力及其独立于 CMVC 模型池,从而避免数据泄露。自动化的质量保证工具进一步确保标注一致性。与 MinerU2.5 的人工标注过程 [25] 相比,标注目标从随机采样转变为经过三阶段筛选精确定位的子集,显著提高了标注资源的利用率。

数据引擎产生一个分层数据集:约 6550 万个 Easy 和 Medium 样本,通过 CMVC 自动标注,用于阶段 1 的预训练;19.2 万个专家标注的 Hard 样本,用于阶段 2 的微调和阶段 3 的 GRPO 对齐。

表 1:三阶段渐进式策略的训练配置。所有三个阶段共享相同的模型架构和分辨率设置;它们在数据源、数据规模和优化超参数上有所不同,反映了从广泛覆盖(阶段 1)到针对性精炼(阶段 2)再到指标级对齐(阶段 3)的递进。

4 渐进式训练策略

MinerU2.5-Pro 继承了 MinerU2.5 [25] 的 12 亿参数解耦粗到细架构(NaViT-675M 视觉编码器 + Qwen2-0.5B 语言模型),未做任何结构修改。模型从 MinerU2.5 的阶段 0 检查点初始化,该检查点提供了基础的视觉-语言对齐和 OCR 能力 [25]。

从这个共同的起点出发,MinerU2.5-Pro 采用三阶段渐进式训练策略,依次利用数据引擎产生的不同质量层次的数据:阶段 1 在大规模 CMVC 自动标注数据上进行预训练,以建立全面的基础能力;阶段 2 在高质量的专家标注数据上进行微调,以强化困难场景下的性能;阶段 3 通过强化学习对齐输出格式和结构规范。三个阶段从数据规模向数据质量递进,训练配置总结在表 1 中。

4.1 阶段 1:文档解析预训练

训练数据。训练集由数据引擎产生的 Easy 和 Medium 样本组成,标注源自 CMCV 多模型共识。数据涵盖四个核心子任务,总计约 6550 万个样本:文本识别(2100 万)、布局分析(1400 万)、公式识别(1300 万)和表格识别(1150 万),外加 600 万图像分析样本(图表、含文本图像等)。子任务比例根据其在 OmniDocBench 总分中的权重和基线模型在各任务上的性能差距进行调整。

训练配置。所有参数均可训练。语言模型使用学习率 1×10−3,视觉编码器使用 1×10−4,批次大小为 256,训练 1 轮。与 MinerU2.5 的阶段 1 预训练(690 万样本/轮 ×× 2 轮)[25] 相比,此阶段将数据规模扩大了近一个数量级(690 万 →→ 6550 万),同时通过 DDAS 分布修正和 CMCV 标注过滤,数据质量也得到了系统性提升。

4.2 阶段 2:高质量监督微调

阶段 1 建立了全面的基础能力,但在 Hard 样本上仍存在性能差距。此阶段使用高质量的专家标注数据进行针对性微调,在强化困难场景的同时,通过混合阶段 1 的重放数据来保持常规场景的泛化能力。

训练数据。训练集包含两部分:(1)通过专家标注流程产生的 19.2 万个高质量 Hard 样本;(2)从阶段 1 训练集中按比例采样的重放数据,以防止灾难性遗忘。混合比例(Hard:重放)根据子任务有所不同:布局分析 6:1,文本识别 1:50,公式识别 1:25,表格识别 1:10,图像分析 1:4。这种非均匀的混合策略反映了不同子任务在 Hard 样本数量和基线性能上的差异——布局分析有更多 Hard 样本且阶段 1 基础较强,需要较少重放;文本识别的 Hard 样本稀缺,需要更多重放以保持泛化能力。

训练配置。在阶段 1 模型的基础上,我们采用较低的学习率 5×10−5,批次大小为 128,训练 1 轮。降低的学习率旨在保护阶段 1 习得的基础能力,同时在困难场景上微调决策边界。

4.3 阶段 3:基于 GRPO 的强化学习

前两个阶段通过监督学习优化内容识别准确性。然而,交叉熵损失独立优化每个令牌的预测,并平等地加权所有令牌,没有直接反映序列级或结构级的评估指标(编辑距离、CDM、TEDS、IoU)。此阶段通过直接优化任务级指标的强化学习来弥合训练目标和评估指标之间的差距。

我们采用组相对策略优化(Group Relative Policy Optimization, GRPO)[31] 进行对齐。对于每个输入,采样 G 组候选输出,直接使用特定于任务的自动评估指标计算奖励,并通过组内相对优势来指导策略更新,无需单独的训练奖励模型。

奖励设计。为四个子任务分别设计奖励函数,直接采用与评估中相同的指标作为奖励信号:文本识别使用编辑距离,公式识别使用 CDM,表格识别使用 TEDS,布局检测使用类别 IoU。这种设计直接将训练优化目标与最终评估指标对齐。

图 4:OmniDocBench v1.5 中元素匹配偏差的示例。由于预测分割与真实分割之间的粒度不匹配,语义正确的预测得分较低。

训练数据。训练数据由阶段 2 模型生成(rollout),并根据奖励分布进行过滤:移除奖励过高(模型已饱和,无有效学习信号)和奖励过低(样本过难或标注有误)的样本,保留中等奖励范围,以最大化有效的策略梯度信号。所有训练数据均来自高质量专家标注集,以确保奖励信号的可靠性。

训练配置。在阶段 2 模型的基础上,我们采用学习率 1×10−5,批次大小为 512,训练 1 轮,每个样本采样 G=16 次生成(rollout)。遵循 DAPO [46],我们应用 clip-higher 以稳定优势估计,并采用动态采样丢弃零方差的生成组。

5 OmniDocBench v1.6

5.1 动机

随着领先的文档解析模型在 OmniDocBench v1.5 上趋于收敛,两个根本性问题限制了其作为基准的有效性:

匹配策略偏差。v1.5 采用固定粒度的一对一元素匹配,这会无形中惩罚那些输出分割与真实标签不同的系统——即使解析的内容完全正确。如图 4 所示,考虑一个跨 k 行的多行公式被标注为一个块:如果模型生成了完全相同的 LaTeX 但将其分割成 k−1 或 k 个独立的块,分数会从满分急剧下降到接近零,尽管语义上输出完美。类似的问题也出现在密集文本上:一个被标注为一个块的区域可能被逐行预测,甚至被识别为表格;在后一种情况下,v1.5 因为没有文本元素可以匹配而给予零分。这种依赖于粒度的评分偏差使得跨系统比较不可靠。

困难样本覆盖不足。通过我们数据引擎提供的大规模难度分层(第 3 节),我们发现被标记为 Hard 的样本在 v1.5 评估集中几乎不存在。该基准主要衡量低到中等难度文档的性能,导致顶尖模型得分紧密聚集,区分能力日益减弱。

为了解决这些问题,我们将 OmniDocBench 升级到 v1.6:我们提出了多粒度自适应匹配(MGAM)以消除匹配偏差(第 5.2 节),并用一个专用的 Hard 子集扩展了评估集(第 5.3 节)。

5.2 多粒度自适应匹配

密集文本匹配。粒度不匹配问题不仅限于公式。对于密集文本区域,预测方和标注方在是否将多个文本段合并为一个大文本框或拆分为多个小文本框方面同样存在差异。我们对文本元素复用 MGAM 算法,使用编辑距离作为相似度度量。此外,如果模型将某个区域中的文本识别为表格(对于密集的结构化文本来说并不少见),我们会将表格转换回纯文本,并将其纳入相同的匹配流程,避免因格式偏好不同而产生的不公平惩罚。

通过 MGAM,评估对输出粒度和格式偏好保持中立,消除了跨系统评分差异的一个系统性来源。

5.3 Hard 子集与三层评估协议

为了填补困难场景的覆盖空白,我们构建了一个包含 296 页的 Hard 子集,这些页面选自数据引擎难度分层过程中被标记为 Hard 的数据池。样本的选择涵盖了文档解析中最具挑战性的场景类别,包括复杂嵌套表格、密集数学公式布局和非常规布局结构。所有 Hard 子集样本均被排除在 MinerU2.5-Pro 的每个训练阶段之外(包括评判与精炼的训练数据),并由专业团队进行标注,通过标注者间交叉验证确保真实标签的质量。

OmniDocBench v1.6 建立了 Base/Hard/Full 三层评估协议:

  • Base (1,355 页):保留原始 v1.5 评估集,以保持与历史结果的可比性。

  • Hard (296 页):新增加的困难样本子集,在标准评估中顶尖模型趋于饱和时,提供更灵敏的测量。

  • Full (1,651 页):两者的完整并集,提供全面的性能评估。

6 实验

本节评估 MinerU2.5-Pro 与领先的通用 VLM 和当前 SOTA 文档解析专用模型 [5, 43, 33, 11, 8, 32, 41, 40, 25] 的性能对比。所有竞争模型均在统一环境下使用相同的评估代码重新评估。

6.1 评估设置

OmniDocBench v1.6。我们在 OmniDocBench v1.6 上使用第 5.3 节所述的 Base/Hard/Full 三层协议进行评估。总分遵循与 MinerU2.5 [25] 相同的公式,即平均文本(编辑距离)、表格(TEDS)和公式(CDM)指标。我们额外报告子指标:文本编辑距离(Text Edit)、公式 CDM↑、表格 TEDS↑、表格 TEDS−S↑、阅读顺序编辑距离(Read Order Edit)。

元素级评估。为了更准确地衡量内容识别能力(排除布局检测误差的混杂影响),我们基于真实布局框裁剪文档图像,并分别评估文本识别、公式识别和表格识别作为独立模块。

表 2:文档解析方法在 OmniDocBench v1.6 Full 上的性能对比,涵盖文本、公式、表格和阅读顺序提取任务。

6.2 端到端文档解析

如表 2 所示,MinerU2.5-Pro 在 Full 上以 95.69 分排名第一,比同架构的 MinerU2.5 基线(92.98)提高了 2.71 分——证实了所有提升均来自数据驱动。在 Base 子集(表 7)上,排名前三的模型(GLM-OCR 96.19,MinerU2.5-Pro 96.12,PaddleOCR-VL-1.5 95.72)差距在 0.5 分以内,表明标准场景已接近饱和。在 Hard 子集(表 8)上,MinerU2.5-Pro 以 94.08 领先,超过 GLM-OCR 和 PaddleOCR-VL-1.5(均为 92.01)2.07 分,展示了数据引擎在困难场景鲁棒性上的优势,并验证了 Hard 子集的区分能力。

在子指标方面,MinerU2.5-Pro 在公式识别(CDM 97.29)、表格识别(TEDS 93.42, TEDS-S 95.92)和阅读顺序(0.120)上均取得最佳成绩。值得注意的是,Gemini 3 Pro/Flash 在 OmniDocBench v1.6 修正匹配后受益显著(Full 92.85/92.58),缩小了与专用模型的差距,但参数量仅为 0.9B-1.2B 的专用模型仍保持整体领先。

训练阶段消融实验。表 3 报告了每个训练阶段的增量贡献。

阶段 1(大规模 SFT)贡献了最大的单阶段提升(+1.31),表明数据引擎在数据覆盖率和标注质量上的优化是性能提升的主要驱动力。阶段 2(困难样本微调)增加了 +0.96,在表格识别方面贡献最为显著(TEDS 90.37 → 92.87, +2.50)。阶段 3(GRPO)贡献了 +0.45,主要体现在公式 CDM 的提升上(96.48 → 97.29, +0.81),由强化学习对任务级指标的直接优化驱动。在 Hard 子集上的累计提升(91.65 → 94.08, +2.43)与 Base 子集(93.23 → 96.12, +2.89)相当,表明渐进式训练策略在困难和标准场景上实现了均衡的能力提升。

表 4:在 OmniDocBench v1.6 上的文本识别(编辑距离↓)。

表 5:在多个基准上的公式识别(CDM↑)。CPE、HWE、SCE 和 SPE 分别是 UniMERNet [34] 中的复杂印刷体、手写体、屏幕截图和简单印刷体表达式子集。

6.3 元素级解析

端到端评估中的布局检测精度会级联影响内容识别分数,而不同模型在输出粒度和分割策略上的差异也阻碍了少量元素的精确匹配。为了更公平地评估纯内容识别能力,我们基于真实布局框裁剪文档图像,并将文本、公式和表格识别作为独立模块进行测试。需要注意的是,端到端模型在此设置中未收到元素类别先验信息,这或许可以部分解释其与解耦的两阶段模型之间更大的性能差距。

文本识别。如表 4 所示,MinerU2.5-Pro 在 Full 上以 0.019 的编辑距离排名第一,比 MinerU2.5 基线(0.028)降低了 30.5%。千亿参数规模的通用 VLM(Qwen3.5-397B, Qwen3-VL-235B)表现出与专用模型相当的文本识别性能,而端到端模型(DeepSeek-OCR 2, FireRed-OCR)在缺乏类别先验的情况下性能显著下降。

公式识别。表 5 报告了在 9 个基准上的 CDM 分数。MinerU2.5-Pro 在 5 个维度上取得最佳成绩,在其余四个维度上排名第二。具体来说,它在 HWE(手写体公式)上逊于 Qwen3.5-397B(95.38 vs. 97.59),在 SCE 上逊于 GLM-OCR(97.04 vs. 97.77),而在 Chinese 和 Fuzzy 子集上仅略微落后于 MinerU2.5。在 OmniDocBench Base 上,CDM 达到 99.20(满分 100),接近公式识别性能上限。

表 6:在多个基准上的表格识别(TEDS & TEDS-S↑)。

虽然 Qwen3.5-397B 在手写体公式上表现出色,但在中文公式上显示出明显弱点(Chinese 78.24)。

表格识别。如表 6 所示,MinerU2.5-Pro 在 Overall TEDS (91.10) 和 TEDS-S (94.48) 上均排名第一,比 MinerU2.5 分别提高了 3.16 和 2.31 个百分点。其优势在 Hard 子集上最为显著(TEDS 92.46 vs. MinerU2.5 的 88.28, +4.18),表明数据引擎的困难样本挖掘和专家标注对表格识别的贡献最大。GLM-OCR 在 OmniDocBench Base (96.14) 和 CCOCR (89.17) 上略胜一筹,但跨基准的稳定性不如 MinerU2.5-Pro。PaddleOCR-VL-1.5 在 CCOCR (TEDS 76.34) 和 Inhouse (TEDS 72.66) 上性能显著下降,表明其表格识别泛化能力有限。

7 结论

我们提出了 MinerU2.5-Pro,在完全固定 12 亿参数模型架构的情况下,仅通过系统化的数据工程就将 OmniDocBench v1.6 的整体得分从 92.98 提升至 95.69,超越了所有现有方法。这一结果表明,在当前架构日趋成熟的阶段,协同优化训练数据的覆盖率、信息量和标注准确性比单纯的架构改进能带来更大的性能提升。为此,我们贡献了一个数据引擎,将训练数据从不足 1000 万页扩展到 6550 万页,同时系统性地提高了标注质量;一个与数据质量层次相匹配的三阶段渐进式训练策略;以及一个修正评估偏差的 OmniDocBench v1.6 三层评估协议。这些工具和方法论为社区提供了一条与架构创新正交且互补的性能提升路径。

局限性与未来方向

评估中的基本挑战。OmniDocBench v1.6 通过修正匹配策略提高了评分的公平性,但元素匹配范式本身存在固有局限性。模糊性有两方面:在格式层面,相同内容可以用多种等价符号表示(例如表格的 HTML 与 Markdown,相同公式的不同 LaTeX 命令);在结构层面,相同的视觉布局可以被合理地表示为不同的元素类型——例如,一个带有对齐中英文列的双语单词列表,既可以等效地表示为逐行的文本对,也可以表示为一个两列表格,甚至人类标注者也可能对哪种表示是“正确”的存有分歧。开发能够兼顾格式和结构模糊性的语义等价感知评估方法仍然是一个悬而未决的问题。

评估覆盖范围与领域适应。OmniDocBench v1.6 旨在覆盖主流应用场景;对于精度要求更高的垂直领域(如金融、法律、医疗),构建领域特定的评估集是必要的补充。此外,随着模型能力接近人类水平,确保评估集标注本身的精确度成为一个日益紧迫的挑战。

从解析准确性到结构理解。本工作侧重于文档解析中的内容准确性。然而,对于下游应用,文档内的结构关系——如标题与正文之间的层级关系、图表与引用文本之间的语义绑定、跨页内容的连续性——对于文档检索和下游语义理解同样至关重要。将解析从“内容提取”推进到“结构化语义理解”是文档解析研究自然而然的下一步。

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/7/21 8:09:10

Windows系统文件dsuiext.dll丢失找不到问题解决

在使用电脑系统时经常会出现丢失找不到某些文件的情况&#xff0c;由于很多常用软件都是采用 Microsoft Visual Studio 编写的&#xff0c;所以这类软件的运行需要依赖微软Visual C运行库&#xff0c;比如像 QQ、迅雷、Adobe 软件等等&#xff0c;如果没有安装VC运行库或者安装…

作者头像 李华
网站建设 2026/7/21 8:09:01

Windows系统文件DTSPipelinePerf120.dll丢失找不到问题解决

在使用电脑系统时经常会出现丢失找不到某些文件的情况&#xff0c;由于很多常用软件都是采用 Microsoft Visual Studio 编写的&#xff0c;所以这类软件的运行需要依赖微软Visual C运行库&#xff0c;比如像 QQ、迅雷、Adobe 软件等等&#xff0c;如果没有安装VC运行库或者安装…

作者头像 李华
网站建设 2026/7/21 8:06:36

技术路线选择:以大模型为核心的战略强化

在国家战略性协调的框架下&#xff0c;美国在AGI 技术路线选择上&#xff0c;正从开放市场主导转向由国家引导的发展路径&#xff0c;这一变化最突出地体现在围绕大模型能力的国家级战略布局中&#xff0c;美国政府主动介入引领AGI 的技术选择&#xff0c;而不是单纯地依靠市场…

作者头像 李华
网站建设 2026/7/21 8:05:21

大促后,智能安防卖家如何在“售后战场”守住利润?

大促后&#xff0c;智能安防卖家如何在"售后战场"守住利润&#xff1f;今年六月到七月&#xff0c;各大平台的年中大促接连落地。亚马逊Prime Day四天收官&#xff0c;全美线上消费约264亿美元&#xff08;Adobe Analytics数据&#xff09;。Walmart、Target同期跟进…

作者头像 李华
网站建设 2026/7/21 8:04:09

Windows系统文件CscMig.dll丢失找不到问题解决

在使用电脑系统时经常会出现丢失找不到某些文件的情况&#xff0c;由于很多常用软件都是采用 Microsoft Visual Studio 编写的&#xff0c;所以这类软件的运行需要依赖微软Visual C运行库&#xff0c;比如像 QQ、迅雷、Adobe 软件等等&#xff0c;如果没有安装VC运行库或者安装…

作者头像 李华