这篇论文提出了WeVisDoc,一个面向鲁棒端到端文档解析的两阶段数据-centric 框架。其核心思想是:文档解析器的性能提升不应只靠扩大数据覆盖,还需要在训练后诊断模型残余弱点,并据此有针对性地补充数据和重新分配训练预算。
一、研究背景与问题
文档解析需要把文档图像转换为结构化文本,同时保留文本、公式、表格、阅读顺序等信息。现有方法面临两个问题:
训练数据偏置:语料多偏向常见文档类型和干净数字页面,对退化、长尾、复杂版面覆盖不足。
仅扩大覆盖不够:残差错误可能来自标注错误、视觉不可读、解码失败或模型能力限制,不一定是数据覆盖缺失。因此需要区分“缺少数据支持”和“已有数据但暴露不足”。
论文将文档数据扩展分为两个阶段:
阶段 I:覆盖构建——建立广泛训练支持;
阶段 II:能力感知改进——诊断残余弱点,验证新增数据,并重新分配监督暴露。
二、方法框架
1. 任务与训练目标
统一文档解析:文本用 Markdown,公式用 LaTeX,表格用 HTML。解析器自回归建模目标序列,训练目标按监督目标 token 长度归一化,而非按记录数平均。论文强调用loss-bearing target tokens衡量训练预算,因为长页面和短组件的目标长度差异很大。
2. 阶段 I:广泛覆盖数据构建
阶段 I 构建约4000 万条记录的池,覆盖:
数据源:开源数据集、内部数据、定向爬取、合成文档;
监督粒度:完整页面、文本裁剪、混合区域、孤立表格、孤立公式;
版面:单栏/多栏、侧边栏、浮动元素、脚注、表单、手写、海报等;
语言与采集条件:简中、英文、繁中、混合语言;原生数字、扫描、照片、截图、屏幕重拍;
合成数据:通过“可执行页面程序”生成图像和目标,支持语义 HTML 双重编译;
外观退化增强:按采集路径分组退化算子,模拟纸张、打印、扫描、传输、物理采集、屏幕重拍等效果,同时保证内容可读、目标有效。
阶段 I 还包含多模型联合标注、质量检查、去重、源感知采样和 token 份额到记录采样概率的转换。
3. 阶段 II:能力诊断与针对性改进
阶段 II 构建约500 万条记录的改进池,核心步骤包括:
诊断探针:使用与训练、难例挖掘、最终评估不相交的 held-out probe,测量阶段 I 模型在固定视觉-结构聚类中的残差错误;
高错误审计:区分标注错误、解码失败、不可读内容与真实模型错误;
视觉-结构聚类:用 SigLIP2 嵌入 + PCA + 结构元数据聚类,聚合页面和组件级错误;
残差驱动合成:针对诊断出的低覆盖能力,生成公式丰富、表格丰富、多区域考试、密集报纸等困难样本;
训练重新平衡:在固定阶段 II token 预算下,根据自然 token 份额和标准化残差,通过 KL 散度优化选择最接近提议且满足相对暴露界限的 token 分配;同时结合难例流和阶段 I 重放,减少遗忘。
三、实验设置与主要结果
1. 模型与训练
基于Qwen3-VL-Instruct,实例化2B 和 4B两个规模;
阶段 I 更新 ViT 和 LLM;阶段 II 冻结 ViT,仅更新 LLM;
使用统一系统提示、图像预处理和确定性解码,每个检查点重复推理三次取平均。
2. 评估基准
OmniDocBench v1.6:评估多样文档类型、版面、语言和元素组合下的覆盖能力;
PureDocBench:包含 Clean、Digital Degraded、Real Degraded 三个赛道,使用源派生真实值评估配对退化鲁棒性;
指标:TextEdit、FormulaCDM、TableTEDS、ROEdit,以及 Overall 和 Avg3。
3. 主要结果
WeVisDoc-4B:
OmniDocBench v1.6 Overall95.38,在所比较端到端解析器中排名第一;
PureDocBench Avg375.54,同样领先;
在 TextEdit、FormulaCDM、TableTEDS_S、ROEdit 等指标上也表现领先。
WeVisDoc-2B:
OmniDocBench Overall95.06,PureDocBench Avg373.86;
以一半参数量达到顶级端到端性能。
阶段 II 增益:
2B:OmniDocBench +1.56,Avg3 +1.74;
4B:OmniDocBench +1.16,Avg3 +2.35;
退化赛道增益更大:Digital Degraded +2.38/+2.55,Real Degraded +2.37/+4.03;
Clean 赛道增益较小(+0.46/+0.49),说明阶段 II 主要改善分布尾部和采集退化场景。
四、消融与定性分析
阶段式消融表明:阶段 II 在两个模型规模上均提升 OmniDocBench 和三个 PureDocBench 赛道,且在退化页面上提升更明显。
定性案例显示,阶段 II 能纠正:
表格区域遗漏;
阅读顺序错误;
公式序列化丢失;
表格边界过度扩展;
字段与值分离;
跨文档幻觉等。
但在 Real Degraded 场景中,仍存在字符级和数值级识别错误,说明结构恢复不能完全消除物理采集下的识别误差。
五、结论与局限
主要贡献
提出WeVisDoc两阶段数据-centric 框架:先广泛覆盖,再能力感知改进;
强调训练混合是“语料覆盖”与“模型能力”之间的可测量接口;
在 2B 和 4B 规模上均取得领先的端到端文档解析性能;
在退化鲁棒性赛道上的增益尤为显著。
局限与未来工作
当前证据受基准覆盖和合成退化保真度限制;
手写、历史扫描、严重损坏文档、更广泛采集条件仍未充分测量;
残差重新平衡依赖探针集、表示模型、聚类选择和评估器,计算成本较高;
未来方向:更广泛的真实采集数据、更稳定可解释的能力估计、更低成本的混合更新、更多语言和文档领域评估;
高风险部署仍需结合来源控制和人工审查。
WeVisDoc 通过“先广泛覆盖、再诊断改进”的两阶段数据策略,在固定模型架构和 token 预算下,显著提升了端到端文档解析的精度与退化鲁棒性,并在 OmniDocBench 和 PureDocBench 上取得了领先结果。这里是自己的论文阅读记录,感兴趣的话可以参考一下,如果需要阅读原文的话可以看这里,如下所示:
项目地址在这里,如下所示:
2B模型权重发布地址在这里,如下所示:
4B模型权重发布地址在这里,如下所示:
摘要
文档解析将文档图像转换为结构化内容,需要在多样化的版面和采集条件下保持可靠性能。然而,训练语料偏向于常见文档类型和干净的数字页面,而仅扩大覆盖范围并不能说明如何解决解析器剩余的弱点。我们提出 WeVisDoc,一个面向鲁棒端到端文档解析的两阶段数据-centric 框架。阶段 I 通过异构数据和结构保持的退化合成,拓宽语义、结构和外观覆盖范围。阶段 II 使用一个留出的探针,在固定的视觉-结构聚类内测量阶段 I 解析器的残差错误。这些诊断结果指导有针对性的数据构建和目标 token 预算的重新分配。WeVisDoc-4B 在 OmniDocBench v1.6 上达到 95.38 的总分,在三个 PureDocBench 赛道上的平均总分为 75.54,在所有四个设置中均位列所比较的端到端解析器之首。与阶段 I 相比,阶段 II 在两个基准上均提升了 2B 和 4B 模型的总分,在退化的 PureDocBench 赛道上提升更大,其中 4B 模型在真实退化赛道上提升了 4.03 分。
图 1WeVisDoc-4B 在所有四个报告设置中均领先于所比较的端到端解析器。柱状图显示了在 OmniDocBench v1.6 和三个 PureDocBench 鲁棒性赛道上的得分;WeVisDoc-2B 以一半的参数量提供了顶级的端到端性能。
1 引言
文档解析将文档图像映射为结构化文本,同时保留文本内容、元素类型、结构组织和阅读顺序。现代解析器要么直接解码整个页面 [3, 20],要么结合全局版面理解与区域识别 [12, 37]。尽管架构进展迅速,可靠的解析仍然具有挑战性,因为文档在语言、版面、内容密度、元素组成和采集条件上同时变化。这些变化产生了超出字符识别范围的独特失败模式。OmniDocBench [39] 和 PureDocBench [27] 等基准评估了这种变化的互补方面,并强调了训练数据组成与解析器架构同等重要。
因此,近期工作投入了大量精力来改进文档训练数据。大规模策展、标注修复和可控合成拓宽了语言和结构多样性 [19, 23, 51, 53]。退化流水线扩展了训练的外观变化 [16],而源对齐的采集赛道则衡量了在这种变化下的鲁棒性 [27]。文档解析和语言模型预训练中的模型感知策略使用输出差异、代理混合搜索或表示空间诊断来优先安排训练数据或优化数据混合 [5, 7, 61]。改进的一个核心挑战是区分反映缺失数据支持的弱点和与训练分布中已表示模式的暴露不足相关的弱点。
扩大经验支持和增加对现有支持的暴露是不同的干预措施。收集、检索或合成记录扩大了经验支持,而重放或重新加权现有记录则改变了它们的暴露。对于自回归解析器,我们用承载损失的 target token 而非记录数来刻画监督优化预算,因为记录的目标长度差异很大。仅凭残差错误也不足以证明存在覆盖缺陷:它可能源于不可靠的目标、低视觉可观测性、解码失败或模型限制,而额外附近的示例无法解决这些问题。因此,有效的分配需要明确评估相关训练支持是否缺失。
我们将文档数据扩展组织为两个阶段:覆盖构建和能力感知的改进。第一阶段建立广泛的训练支持;第二阶段诊断残余弱点,验证有针对性的添加,并在修订后的池上重新分配监督暴露。我们提出 WeVisDoc,一个实现此过程的两阶段数据-centric 框架,每个阶段有单独的 target-token 预算。
阶段 I 从约 4000 万条记录中构建广泛、经过验证的覆盖,涵盖监督粒度、版面、语言、数据源和采集条件。它结合异构监督、可执行页面合成和源条件外观生成,使用统一的解析目标和标注质量检查。源感知平衡限制了大型语料库的主导地位,而外观变体扩展了视觉覆盖,但不被视为额外的语义支持。阶段 II 则根据解析器的残余弱点对其进行改进。一个与训练、难例挖掘和最终评估不相交的诊断探针测量残余解析错误。结合对现有支持的审计,这些测量结果指导在添加经过验证的数据和增加对可用记录的暴露之间做出选择。经过验证的添加、阶段 I 重放和单独审计的难例构成一个约 500 万条记录的改进池,所有暴露都计入固定的阶段 II target-token 预算。
我们在 2B 和 4B 规模上从 Qwen3-VL-Instruct [1] 实例化 WeVisDoc,在每个规模内保持骨干、输出序列化和自回归目标不变。图 1 将所得模型与五个代表性端到端系统在 OmniDocBench v1.6 和三个 PureDocBench 赛道上进行了比较。在 OmniDocBench v1.6 上,最终的 2B 和 4B 模型分别达到 95.06 和 95.38 的总分;它们在 PureDocBench 上的相应 Avg3 分数分别为 73.86 和 75.54。4B 模型在所有四个设置中均位列所比较的端到端解析器之首,而 2B 模型以一半的参数量保持竞争力。完整的阶段 II 协议在两个规模上均提升了两个基准,在退化页面上比在干净页面上提升更大。这些分阶段结果与完整改进协议的益处一致,尤其是在退化采集条件下;由于阶段 II 结合了多种干预措施,它们不能单独识别残差感知分配的效果。
2 相关工作
2.1 解析架构
生成式文档解析器将文档图像转换为结构化文本,为文本、表格和公式提供统一的输出接口。早期的图像到序列方法,包括 Donut [20]、Pix2Struct [22] 和 Nougat [3],通过文档理解、截图预训练和科学页面转换确立了这一方向。较新的系统改进了页面信息的表示和编码方式:SmolDocking [36] 使用 DocTags 表达内容和结构,而 DeepSeek-OCR [54] 和 DeepSeekOCR 2 [55] 分别探索了视觉上下文压缩和视觉 token 的语义重排序。
另一条工作线使用页面版面来组织区域识别。Dolphin [12] 和 MonkeyOCR [26] 将解析分解为结构分析和内容识别,而 MinerU2.5 [37] 和 PaddleOCR-VL-1.5 [5] 将页面级版面分析与高分辨率区域处理相结合。PaDoc [59] 将并行区域解码与共享的全页视觉上下文连接起来。这些方法探索了协调全局结构和局部识别的不同方式。WeVisDoc 采用端到端解析,并研究在每个模型规模的相同骨干架构内,训练数据覆盖和分配如何改进解析器。
2.2 文档专家的数据覆盖与策展
监督的覆盖范围和质量决定了专家可以学习哪些文档模式。Vary [53] 强调密集的文档感知,包括非英语内容;mPLUG-DocOwl 1.5 [17] 将结构监督与跨多样视觉领域的文本定位相结合;dots.ocr [25] 使用多语言数据联合学习版面、内容和关系。这些工作共同突出了文档监督的互补维度。OmniDocBench [39] 等基准通过跨异构页面和元素类型的评估使这种多样性可见。
最近的数据-centric 系统将语料库构建作为解析器开发的明确部分。MinerU2.5-Pro [51] 将多样性感知采样与标注验证和修复相结合。DocHumming [23] 和 Infinity-Parser2 [19] 分别通过版面组合和可控渲染拓宽监督,而 Infinity-Parser [49] 将策展的解析语料库与版面感知强化学习配对。这些努力推动了广泛、可靠的覆盖,但有效的训练还需要决定哪些模式需要额外数据或更多暴露。WeVisDoc 通过两个阶段连接这些决策:广泛的覆盖构建,随后由训练后解析器的剩余弱点指导的改进。
2.3 对文档退化的鲁棒性
除了内容和版面多样性之外,文档解析器还必须在扫描、摄影和复制引入的退化下保持可靠。DewarpNet [6] 和 UVDoc [48] 等文档去扭曲方法校正几何畸变,以在识别前恢复平坦视图。数据增强提供了一条互补途径:Augraphy [16] 模拟印刷、扫描及相关过程的伪影,以在训练期间让模型接触退化的文档图像。
最近的解析研究评估了文档退化如何影响解析质量。PaddleOCR-VL-1.5 [5] 和 DocHumming [23] 涵盖了拍摄或屏幕介导文档中的几何畸变和退化。PureDocBench [27] 使用共同的源派生目标评估对齐的干净和退化视图。对于监督解析器训练,退化视图仅在其内容保持可读且与目标一致时才提供有效监督。WeVisDoc 将基于退化的增强纳入阶段 I 覆盖,验证退化图像-目标对并控制其训练暴露,以在保留语义和结构监督的同时提高鲁棒性。
2.4 模型感知的数据分配
数据选择和加权旨在更有效地利用有限的训练预算。课程学习 [2] 按难度组织暴露,而 DoReMi [57] 和 Nemotron-CLIMB [7] 使用代理模型优化领域或聚类混合。Rho-1 [28] 则根据相对于参考模型的超额损失选择 token。在样本级别,Core-Set [43]、JTT [29] 和 LESS [56] 分别优先考虑表示覆盖、初始模型错误和与目标示例的梯度相似性。这些方法提供了决定训练工作应花在哪里的互补方式。
文档特定的方法越来越多地将此类决策与诊断出的解析弱点联系起来。不确定性感知聚类采样 [5] 使用随机输出差异在视觉聚类之间分配样本。MinerU2.5-Pro [51] 和 PaddleOCR-VL-1.6 [61] 将数据分组和模型反馈与有针对性的数据扩展或标注修复相结合,而 HunyuanOCR-1.5 [24] 将长尾弱点转化为数据构建需求。训练反馈也可以直接塑造优化:Infinity-Parser [49] 和 FD-RL [65] 使用具有文档特定奖励的强化学习。这些方法共同推动了将模型诊断与数据构建及后续训练连接起来。
WeVisDoc 在两阶段监督训练中结合了广泛覆盖和模型感知的改进。阶段 I 在多样的文档内容、结构和退化上训练解析器。阶段 II 使用所得模型的剩余弱点来指导进一步的数据构建和训练。我们在一个与训练、难例挖掘和最终评估不相交的诊断探针上,针对真实目标测量页面和组件错误,并在表示空间组上聚合它们。结合对现有数据覆盖的检查,这些信号在固定的监督输出 token 预算下指导有针对性的添加和暴露分配。因此,池扩展和暴露重新分配是监督模型训练中的独立干预措施。在每个模型规模内,训练更新模型参数,同时保持骨干架构、输出序列化和自回归目标不变。
3 方法
我们的方法首先构建广泛的数据覆盖,然后添加数据并调整训练以解决剩余的解析错误。第 3.1 节定义任务和训练目标;第 3.2 和 3.3 节描述两个阶段,第 3.4 节给出实验配置。
3.1 任务表述和方法概述
3.2 阶段 I:广泛覆盖的数据构建
阶段 I 通过组合数据源、转换标注、过滤低质量数据和生成新示例,构建约 4000 万条记录的池。监督转换将源标注转换为完整页面、区域或组件的训练对(第 3.2.1 节)。覆盖范围涵盖文档领域、版面、输出结构、语言和采集条件,这些属性分别跟踪。图 2 总结了构建过程。
3.2.1 数据源和覆盖
多样化的数据源。语料库结合了开源数据集、内部集合、有针对性的网络和 PDF 爬取以及生成的文档。公共数据集为文章、书籍、表单、收据、表格和公式提供广泛的 OCR 覆盖和可重用的标注。内部集合添加了基准中代表性不足的生产文档和采集条件。有针对性的爬取添加来自代表性不足领域和模式的示例,包括教育材料、报纸、手写和混合语言页面。
真实文档保留了内容、版面、字体以及捕获或扫描期间引入的视觉效果之间的关系。合成数据系统地改变收集源中罕见的结构。源信息使收集数据和合成数据保持可分别追踪以用于分析。外观变体保持与其源页面链接,将视觉增强与新文档内容分开。
源和生成元数据支持划分构建、去重(移除或分组重复内容)、源感知采样和错误分析。
页面、区域和组件监督。语料库包括完整页面、纯文本裁剪、混合内容区域、孤立表格和孤立公式。完整页面教授全局阅读顺序以及文本、表格、公式和标题之间的关系。文本裁剪为小或密集字符保留识别分辨率;混合内容区域保留局部交互,例如公式与解释或图与标题。
表格和公式获得针对其结构要求的专门监督。HTML 表格编码单元格内容和结构,包括行和列跨度。LaTeX 公式编码符号、运算符层次和分组。组件记录为这些结构提供更多训练。
监督转换使用每个源中最具信息量的可靠标注。经过验证的页面元素和阅读顺序产生 Markdown 目标,并在有效时产生相应的文本、混合区域、表格或公式裁剪。仅包含表格或公式标注的源使用相应的组件表示,而不虚构页面上下文。裁剪仅接收可见内容目标,并与其页面级对应物一致归一化。源和转换标识符链接派生记录,保持页面、区域和组件目标一致,并限制来自一个页面的重复暴露。
在训练特定采样之前,大约 40% 的记录提供完整页面监督,25% 为文本或混合区域,25% 为孤立表格,10% 为孤立公式。
多样化的文档版面。版面覆盖包括单栏和多栏页面、变化的列数、侧边栏、浮动元素、脚注以及具有基于字段阅读顺序的表单。手写笔记、海报和演示材料增加了没有规则网格的版面。这些示例需要局部分组和阅读顺序推断,而不仅仅是固定的自上而下模板。
密度和尺度在每个版面家族内变化,从稀疏的标题页到密集的学术或法律文档。表格可能占据整个页面,也可能嵌入正文中。版面标签和组件统计支持覆盖分析和批处理,而所有输入保持共享输出表示。
图像来源和语言。采集覆盖范围包括原生数字页面、扫描件、照片、截图和屏幕重拍,引入几何、光照、分辨率、噪声和压缩方面的变化。语言包括简体中文、英文、繁体中文和混合语言页面。
质量检查移除损坏或不可读的图像,并将不确定的目标路由到标注审查。图像哈希检测完全重复;归一化视觉嵌入在源感知阈值下识别近重复。去重在监督转换之前进行,派生视图保留其重复组标识,因此重复内容不会夸大数据覆盖或主导训练。
这些属性指导源感知采样和后续残差分析。
其中 ED 是字符级 Levenshtein 距离,∣⋅∣ 计算字符数。高置信度标注要求所有三个专家都做出预测,且每对 NED 低于标注一致性阈值 δann(ann 表示标注)。
一致性结合 HTML/LaTeX 可解析性和结构检查。转换后的源真实值在有效时仍然优先;否则选择一致专家输出的有效代表。
如果两个专家一致而第三个不同,则一致输出在纳入训练之前需要基于图像的审查。如果三个都不同,该记录则被排除在普通阶段 I 监督之外,并由更强的多模态模型和人工审查员审查以可能用于阶段 II。缺失预测或未解决的分歧同样需要审查:仅一致性并不能确立正确性。
置信度涉及目标可靠性;难度涉及可见内容,由结构复杂性、组件密度和专家分歧来表征。可靠记录根据这些属性被分层为 Easy、Medium 和 Hard 级别;这些分层指导阶段 I 采样和阶段 II 难例挖掘。损坏图像、无效标记、错误阅读顺序、严重重复和重复项被过滤或审查。哈希、视觉嵌入、识别内容和版面支持重复控制。未解决的图像-目标分歧进入第 3.3.1 节的审计。
3.2.3 广泛覆盖的数据合成
广泛覆盖合成创建可执行页面程序——即产生页面图像及其目标的结构化规范——用于收集数据中很少发现的组合。内容和结构在 3.2.4 节的外观增强之前生成。相关工作也使用组合合成进行可控的全页监督 [23]。
组合文档程序。页面程序指定内容依赖关系、语言、版面、阅读顺序、元素和视觉风格。其源和随机状态允许重新生成。联合语义和渲染约束要求表格结构一致、公式与其解释兼容且内容可见。
源和结构元数据在重复控制后识别代表性不足的组合。第 3.2.2 节中的标注审查识别不确定目标,而生成器家族限制防止少数模板主导。
程序在版面之前建立语义关系:论断连接到证据,行项目连接到总计,概念连接到方程。这些关系确定标题、表格、标题附件和跨区域阅读顺序。内容和风格在所得约束内变化。
从语义 HTML 双重编译。语义 HTML 是可执行的中间表示。每个块成为具有元素类型和唯一标识符的文档对象模型(DOM)节点;CSS 控制其视觉布局。一个编译路径渲染图像和节点几何,另一个遍历同一棵树以生成元素标签、阅读顺序 Markdown、HTML 表格和源 LaTeX。共享标识符对齐图像区域和结构化目标,从生成源产生精确监督。
生成的页面经过与收集数据相同的归一化、验证和重复控制。失败的渲染、裁剪内容、无效表格或公式以及不可读文本被拒绝。复杂性和专家分歧表征难度,程序级上限保持多样性。图 3 显示了代表性输出。
3.2.4 外观退化和增强
外观增强遵循源特定的采集路径:原生数字页面可能被调整大小或重拍,纸质文档可能被打印或扫描,历史材料可能受老化影响。应用于收集页面和 3.2.3 节中的干净合成,它扩展了采集覆盖,同时保留有效的语义目标。我们将兼容的退化算子按采集路径分组为算子家族,每个家族指定操作顺序和参数范围。这种组织借鉴了文档图像增强和源感知鲁棒性比较 [16, 27]。
采集场景结合兼容的算子家族、其参数和物理顺序。例如,复印照片经过纸张和墨水形成、设备复制和相机捕获。源介质约束有效路径;内容密度、符号大小、公式笔画和表格线宽约束严重程度。
转换视图仅在所有监督内容保持可见和可读时才保留其源目标。丢失内容的视图被拒绝,或根据 3.2.1 节分配可见内容裁剪目标。
图 3通用数据合成产生的代表性页面。画廊涵盖结构化技术报告、公式丰富的教育页面和长篇学术页面,展示了语义上下文、元素组成、页面密度、排版和版面组织的联合变化。
纸张、复印和传输效果。纸张纹理、老化、污渍和墨水褪色或渗色模拟纸张和印刷的变化。打印、复印和扫描引入半色调图案、模糊、条纹和对比度损失,而数字传输增加调整大小、重新编码和压缩伪影。效果根据分辨率和笔画宽度缩放,保留文本、公式和表格线之间的相关差异。
物理采集。表面图和约束网格改变透视、页面曲率和折痕,遵循文档去扭曲表示 [6, 48]。光照遵循采样几何以产生空间一致的阴影和曝光变化。屏幕重拍建模显示到相机的采样链,产生摩尔纹和彩色边缘;相机效果还包括运动或深度相关模糊。
难度和可观测性控制。内容保留和局部可读性决定准入;专家分歧表示难度,但不确立目标有效性。变体保留其干净页面的重复组标识,因此语义支持统计将源计数一次,而采样控制变体暴露。图 4 说明了这些变换。
阶段 I 将 3.2.1 节中的干净数据采样器 qclean 与经过验证的外观变体相结合。退化流采样一条干净记录和一个保留其目标的变换。期望的退化 token 份额由内部验证选择;公式 5 将干净和退化份额转换为记录选择概率,定义 q1。重复组上限限制重复视图,实际 token 暴露与记录抽取分开监控。
所得解析器 θ1 支持阶段 II 诊断,判断剩余弱点是需要重放、新收集还是有针对性的合成。
3.3 阶段 II:能力诊断和有针对性改进
阶段 II 围绕 θ1θ1 的弱点构建一个约 500 万条记录的改进池。残差错误是阶段 I 之后剩余的解析错误;重放是在高质量阶段 I 示例上的持续训练。我们将页面或组件级错误超过审查阈值的记录称为高错误记录;因为这可能反映标注错误或不可读内容,改进在将其视为难例之前验证目标可靠性。
图 5阶段 II 数据构建。一个不相交的分配探针确定聚类级残差优先级,而训练池挖掘提供单独审计的难例流。经过验证的检索和有针对性页面程序合成随后为代表性不足的模式添加示例,然后在固定预算下根据残差错误分配训练 token。
高错误审计。高错误候选检查其他三种可能的错误原因。不正确的目标可能遗漏内容、错误排序区域或包含无效标记。OCR-EDR 的渲染感知诊断和修复使用 DocEDR 比较图像、可编辑目标和渲染输出 [62];修复必须保持结构有效且视觉一致。重复或未能停止的输出获得解码失败标签。由于裁剪、模糊、遮挡或低分辨率而无法读取的内容被排除在难例训练之外,但仍可能有助于评估鲁棒性。
人工审查员和更强的多模态模型验证困难的图像-目标对和结构化输出。
3.3.2 视觉-结构聚类和覆盖诊断
聚类按视觉结构和组件组成对阶段 I 记录进行分组,以揭示反复出现的失败。这些组在拟合后使用内容、语言、版面 and 采集元数据进行描述。
代表性失败将组优先级转化为数据请求,例如中文数学文本、嵌套表格或跨区域阅读关系。请求通过真实数据检索或有针对性合成(3.3.3 节)满足,添加内容在重新分配之前通过监督、可靠性和重复检查。图 6 显示了两个示例聚类。
图 6全局无监督聚类获得的代表性组。手写页面共享横线纸纹理、笔画组织和自由形式注释模式,而彩色教科书则按章节框架、示例、练习块、图表和插图解释分组。
3.3.3 残差驱动的有针对性数据合成
有针对性合成使用 3.2.3 节中的页面程序家族,为 3.3.2 节中经过验证的请求生成示例。它专注于模型仍然解析不佳的结构,而非广泛覆盖。
请求指定失败的 element 关系、版面或语言组合。候选被渲染、验证,并使用 3.3.2 节中冻结的表示和聚类中心进行分配;渲染后,每个候选被重新编码并分配到最近的冻结聚类中心。优先级指导构建,而内容和风格变化保持多样性。当生成器无法满足请求时,需要新的真实数据或扩展生成器,并进行相同的验证检查。
用于困难元素家族的页面程序。公式程序组合行内记号、显示方程、推导、分段表达式和具有一致变量含义的解释,包括中文数学文本。表格程序改变边框、嵌套表头、合并单元格和混合单元格内容。跨元素程序连接标题、注释、参考文献和方程。版面控制改变列数、密度、邻接和阅读顺序,而内容和风格多样性防止重复模板。
共同生成的监督和聚类验证。语义 HTML 编译器联合生成图像、元素区域和类别、阅读顺序 Markdown、HTML 表格和源 LaTeX。示例仅当其目标与可见内容匹配、包含请求的结构并解决已识别的弱点时才被接受。固定聚类分配本身并不能确立目标难度已被再现。
合成记录保留源信息和程序标识符,并带有家族、程序和重复组上限。因此,它们的贡献可以与新的真实数据、难例和重放区分开来。图 7 说明了代表性构建。
图 7针对诊断出的低覆盖能力的代表性有针对性构建:(a) 公式丰富的组合,(b) 表格丰富的组合,(c) 多区域考试结构,(d) 密集报纸结构。
3.3.4 有针对性数据添加后的训练重新平衡
3.4 实验设置和控制
我们对两阶段方法使用匹配的模型和优化设置。每个模型规模内的比较评估完整训练协议,而不是隔离单个数据变化的影响。
3.4.1 训练阶段和数据分配
阶段 I 使用约 4000 万条记录的广泛覆盖池;阶段 II 使用约 500 万条记录的改进池和高质量阶段 I 重放。训练前,记录经过质量检查、跨源去重和基准重叠筛选。页面和派生视图共享内容组标识以进行划分分配。分配探针被排除在训练、挖掘和最终评估之外,而挖掘样本属于训练划分。
阶段 I 广泛覆盖训练。阶段 I 使用 3.2 节中的页面和组件级监督联合更新视觉编码器和语言模型。源和外观份额以损失中包含的目标 token 指定,并用公式 5 转换为记录概率。优化遵循公式 3,训练份额按输入粒度跟踪,并对每个重复组的重复采样设置限制。所得检查点初始化诊断和受控阶段 II 比较。
阶段 II 能力改进。阶段 II 结合经过验证的难例、有针对性真实和合成添加以及广泛重放。难例来自训练池挖掘或单独审查的标注候选,并针对最终目标进行评估。添加内容解决阶段 I 覆盖中审计出的缺口。
图 8等预算聚类重新平衡。(a) 页面元素聚类支持,(b) 版面和结构难度,(c) 重新平衡前后的外观和采集条件。灰色虚线和绿色实线轮廓分别表示重新平衡前和后的混合;浅灰色单位轮廓表示均匀支持。在每个面板内,期望 target-token 支持归一化为均值 1.0,两个轮廓中的值具有相同总和。
添加和重放形成残差流;分配到单独上限难例流的记录在该采样角色中被排除。公式 10-12 定义重新平衡和流组合,公式 5 提供 token 到记录的转换。采样角色改变暴露而不改变目标。
池大小计算唯一合格记录并排除探针;重复抽取不增加这些计数。预算 B1 和 B2 反而约束每个阶段消耗的监督目标 token。
暴露。训练日志记录源、输入粒度 and 重复组标识符、目标份额和采样概率、重放和增强策略以及总 token 预算。计划与实际 token 份额与记录抽取计数一起跟踪,以区分语料库大小和训练暴露。
3.4.2 骨干、输出表示和训练控制
WeVisDoc 使用 2B 和 4B Qwen3-VL-Instruct 骨干 [1]。两个规模都保留原生动态分辨率视觉 Transformer(ViT)、自回归大语言模型(LLM)、分词器和位置编码,且均未引入外部文档检测器、OCR 引擎、表格解析器或专用解码器。
训练目标和预测共享 3.1 节中的表示:阅读顺序 Markdown、HTML 表格和 LaTeX 公式。裁剪保留其可见内容表示。训练归一化与基准特定评分转换保持分离。
表 1 报告了 2B 和 4B 运行使用的共享优化设置,并仅标注了按阶段不同的设置。阶段 I 更新完整模型,而阶段 II 冻结视觉编码器并从相同模型规模的阶段 I 检查点改进语言模型。不同的设备和累积配置在两个规模上保持全局批量 512 个序列。
这里 β1 和 β2 是 AdamW 的一阶和二阶矩衰减率,ϵϵ 提供数值稳定化。
3.4.3 推理和评估
训练池推理支持错误分析和难例挖掘;单独的分配探针估计组残差(3.3.2 节)。阈值和混合设置在预先指定的训练池折上校准,而非最终基准。这些诊断结果指导数据构建,不是额外的评估集。
表 1报告的检查点的训练设置。阶段特定设置明确标注;所有未标注设置由阶段 I 和阶段 II 共享。
| 项目 | 设置 |
|---|---|
| 初始化 | 阶段 I:Qwen3-VL-Instruct;阶段 II:相应的阶段 I 检查点 |
| 可训练模块 | 阶段 I:ViT 和 LLM 骨干;阶段 II:仅 LLM 骨干(ViT 冻结) |
| 优化器 | Fused AdamW, β1 = 0.9, β2 = 0.95, ε = 10−8 |
| 学习率 | 5×10−6,余弦衰减,500 步预热 |
| 权重衰减 / 梯度裁剪 | 0.1 / 1.0 |
| 全局批量大小 | 512 |
| 序列长度 | 8,192 |
| 数值和系统设置 | bfloat16、梯度检查点、FlashAttention、DeepSpeed ZeRO-2 |
公共基准推理仅在数据集内容和训练配置固定后执行。在报告的基准上,相同规模的模型使用附录 A 中复现的通用文档解析系统提示,以及共享的图像预处理策略和确定性解码配置。预测直接以共享解析表示生成,无需外部重排序或内容级校正,每个基准在相同评估器下用其官方协议对所有受控变体评分。对于鲁棒性,我们对每个检查点重复推理三次并报告平均基准分数。
4 实验
我们在两个互补层面评估 WeVisDoc。首先,我们将最终的 2B 和 4B 模型与现有系统在 OmniDocBench v1.6 和 PureDocBench 上进行比较。其次,我们通过两个模型规模上的阶段 I-阶段 II 比较评估能力感知改进的总体效果,并检查每个基准划分中代表性预测的相应变化。
4.1 评估设置
OmniDocBench v1.6:文档多样性下的覆盖。OmniDocBench v1.6 [39] 包含 1,651 个文档页面,涵盖多样的文档类型、版面、语言以及文本、公式、表格和阅读顺序结构的组合。我们使用该基准评估异构、自然发生的内容和版面条件下的文档解析。
PureDocBench:配对退化鲁棒性。PureDocBench [27] 用源派生真实值补充基于标注的评估。其审计在 OmniDocBench v1.5 的 21,353 个评估器评分块中发现了 2,580 个确认的标注错误;这一发现并不估计 v1.6 的错误率,但推动了对独立生成、精确可追踪目标的评估。PureDocBench 包含来自 10 个领域和 66 个子类别的 1,475 个 HTML/CSS 源页面。每个源被渲染为对齐的 Clean、Digital Degraded 和 Real Degraded 视图,共享相同真实值;后两个赛道分别涵盖十种合成退化场景和四种物理或屏幕介导采集流水线。
指标。两个基准报告 TextEdit、FormulaCDM、TableTEDS 和 ROEdit,以及 Overall 分数。公式 13 将 Overall 定义为文本准确率、FormulaCDM 和 TableTEDS 的算术平均:
基线。我们比较三类互补的文档解析系统:通用 VLM、流水线解析器和专用端到端 OCR 模型。这种分组区分了通用多模态规模、模块化解析和文档特定端到端专业化。端到端组包括 FD-RL [65],它使用格式解耦强化学习。在基线中,上标 * 表示用我们的评估流水线在所述基准协议下产生的结果;未标注结果取自先前工作。
4.2 主要结果
表 2 报告了 OmniDocBench v1.6 比较。WeVisDoc-4B 在所比较的端到端专家中建立了新的最先进水平,达到 95.38 Overall,比之前领先结果提高 0.64 分。它还在 TextEdit (0.036)、FormulaCDM (96.81)、TableTEDS_S (95.34) 和 ROEdit (0.125) 上领先。WeVisDoc-2B 以 95.06 Overall 提供顶级端到端性能,同时具有 95.94 FormulaCDM、93.03 TableTEDS 和 95.26 TableTEDS_S。这些结果使两个规模都处于领先的端到端解析前沿,4B 模型设定了最强的聚合结果。由于 OmniDocBench 使用标注派生真实值,此比较以冻结的 v1.6 基准和评估器修订为条件。
表 2OmniDocBench v1.6 上文档解析结果的比较。我们报告 Overall 以及文本、公式、表格和阅读顺序指标;我们的结果是三次推理运行的平均值。上标 * 表示用我们的评估流水线获得的基线结果,而未标注基线结果取自先前工作 [24, 61]。粗体和下划线突出每个模型系列中的两个领先结果。基线行按 Overall 从低到高排序;我们的模型单独报告在端到端系列末尾。
| 模型类型 | 模型 | 规模 | Overall↑ | TextEdit↓ | FormulaCDM↑ | TableTEDS↑ | TableTEDS_S↑ | ROEdit↓ |
|---|---|---|---|---|---|---|---|---|
| 通用 VLM | InternVL3.5-241B [52] | 241B | 83.76 | 0.130 | 89.95 | 74.35 | 79.78 | 0.215 |
| Kimi K2.5 [46] | 1T | 84.53 | 0.107 | 83.50 | 80.76 | 84.00 | 0.211 | |
| GPT-5.2 [38] | – | 86.59 | 0.114 | 88.21 | 82.95 | 87.93 | 0.193 | |
| Qwen3-VL-235B [1] | 235B | 89.78 | 0.063 | 92.55 | 83.07 | 86.75 | 0.166 | |
| Gemini 3 Flash [9] | – | 92.62 | 0.066 | 95.16 | 89.29 | 93.51 | 0.172 | |
| Gemini 3 Pro [14] | – | 92.91 | 0.064 | 95.99 | 89.15 | 92.96 | 0.165 | |
| Ovis2.6-30B-A3B [32] | 30B | 93.70 | 0.035 | 95.17 | 89.44 | 92.40 | 0.135 | |
| 流水线解析器 | Dolphin-1.5 [12] | 0.3B | 86.52 | 0.094 | 87.49 | 81.43 | 84.82 | 0.167 |
| MonkeyOCR-pro-3B [26] | 3B | 88.57 | 0.074 | 88.74 | 84.35 | 88.62 | 0.189 | |
| Dolphin-v2 [13] | 3B | 89.50 | 0.069 | 91.01 | 84.40 | 87.44 | 0.150 | |
| OpenDoc-0.1B [10] | 0.1B | 90.67 | 0.049 | 93.02 | 83.88 | 87.45 | 0.140 | |
| MinerU2.5 [37] | 1.2B | 93.04 | 0.045 | 95.77 | 87.88 | 91.47 | 0.130 | |
| Youtu-Parsing [21] | 2.5B | 93.74 | 0.044 | 93.63 | 92.02 | 95.00 | 0.116 | |
| PaddleOCR-VL-1.5 [5] | 0.9B | 94.93 | 0.038 | 96.89 | 91.67 | 94.37 | 0.130 | |
| GLM-OCR [11] | 0.9B | 95.22 | 0.044 | 97.18 | 92.83 | 95.39 | 0.133 | |
| MinerU2.5-Pro [51] | 1.2B | 95.75 | 0.036 | 97.45 | 93.42 | 95.92 | 0.120 | |
| PaddleOCR-VL-1.6 [61] | 0.9B | 96.33 | 0.033 | 97.49 | 94.76 | 97.11 | 0.127 | |
| 端到端专家 | Nanonets-OCR2* [34] | 3B | 83.20 | 0.108 | 80.35 | 80.10 | 85.26 | 0.211 |
| OCRFlux-3B* [4] | 3B | 83.31 | 0.126 | 88.75 | 73.78 | 77.98 | 0.217 | |
| POINTS-Reader [30] | 3B | 83.37 | 0.096 | 85.72 | 73.98 | 77.40 | 0.198 | |
| Nanonets-OCR-s [33] | 3B | 83.61 | 0.108 | 81.46 | 80.18 | 84.51 | 0.213 | |
| olmOCR-2-7B [41] | 7B | 85.51 | 0.106 | 88.84 | 78.32 | 82.81 | 0.223 | |
| olmOCR [40] | 7B | 85.74 | 0.139 | 88.10 | 83.00 | 87.17 | 0.216 | |
| DeepSeek-OCR* [54] | 3B | 86.31 | 0.077 | 84.71 | 81.87 | 86.07 | 0.171 | |
| OCRVerse [66] | 4B | 88.60 | 0.063 | 89.61 | 82.44 | 86.27 | 0.163 | |
| UniRec-0.1B* [10] | 0.1B | 88.91 | 0.088 | 92.14 | 83.40 | 86.79 | 0.146 | |
| DeepSeek-OCR 2 [55] | 3B | 90.25 | 0.050 | 91.84 | 83.89 | 87.75 | 0.144 | |
| dots.ocr [25] | 3B | 90.77 | 0.048 | 89.95 | 87.18 | 90.58 | 0.138 | |
| FD-RL* [65] | 4B | 91.21 | 0.055 | 92.92 | 86.22 | 90.92 | 0.145 | |
| HunyuanOCR [45] | 1B | 92.03 | 0.048 | 88.60 | 92.37 | 93.99 | 0.138 | |
| dots.mocr* [63] | 3B | 92.57 | 0.042 | 92.09 | 89.78 | 92.92 | 0.133 | |
| FireRed-OCR [44] | 2B | 93.26 | 0.037 | 95.44 | 88.04 | 91.06 | 0.131 | |
| Logics-Parsing-v2 [31] | 4B | 93.33 | 0.041 | 95.65 | 88.42 | 91.98 | 0.137 | |
| Qianfan-OCR [8] | 4B | 93.90 | 0.040 | 95.08 | 90.53 | 93.31 | 0.130 | |
| Unlimited-OCR [58] | 3B-A0.5B | 93.92 | 0.042 | 95.79 | 90.16 | 93.32 | 0.129 | |
| HunyuanOCR-1.5 [24] | 1B | 94.74 | 0.039 | 94.50 | 93.67 | 94.71 | 0.129 | |
| WeVisDoc (Ours) | 2B | 95.06 | 0.038 | 95.94 | 93.03 | 95.26 | 0.130 | |
| WeVisDoc (Ours) | 4B | 95.38 | 0.036 | 96.81 | 92.95 | 95.34 | 0.125 |
表 3 报告了 PureDocBench 比较。WeVisDoc-4B 建立了最高报告的 Avg3 为 75.54,超过领先的广泛领域基线 Qwen3.5-122B-A10B 1.43 分。
在两个规模上,阶段 II 都改善了 OmniDocBench Overall 和所有三个 PureDocBench 赛道。2B 模型在 OmniDocBench 上增益 1.56 分,在 Avg3 上增益 1.74 分,而 4B 模型分别增益 1.16 和 2.35 分。改进最大的是 Digital Degraded(2B 和 4B 分别为 +2.38 和 +2.55)和 Real Degraded(+2.37 和 +4.03)。Clean 性能在 2B 仅变化 +0.46,在 4B 仅变化 +0.49。这种模式与阶段 II 对分布尾部和采集引起的外观偏移的预期重点一致,但分阶段比较并未将残差感知分配与其他阶段 II 干预隔离开来。
附录 B.1 提供了定位代表性结构和识别错误的分阶段定性比较。特别是,图 12(b) 显示了拍摄的中文合同中姓名转录错误的纠正和公式序列化的恢复。附录 B.2 提供了跨通用、公式丰富、表格丰富以及扫描或拍摄文档的额外端到端预测。
5 结论和未来工作
我们提出了 WeVisDoc,一个数据-centric 框架,通过语义覆盖、结构保持退化和能力感知改进来专门化端到端文档解析器。在 2B 和 4B 规模上实例化,WeVisDoc 在 OmniDocBench v1.6 上达到 95.06 和 95.38 的 Overall 分数,在 PureDocBench 上达到 73.86 和 75.54 的 Avg3 分数。4B 模型在所有四个设置中均在所比较的端到端解析器中建立了最先进性能,而 2B 模型以一半参数量提供顶级性能。分阶段比较显示完整能力改进阶段后的一致增益,尽管它们并未隔离其各个干预措施。总之,这些结果支持将训练混合视为语料库覆盖和模型能力之间可测量的接口,而不是数据集的静态集合。
当前证据仍受基准覆盖和合成退化保真度的限制。尽管 4B 模型在 Real Degraded 页面上建立了新的端到端最先进水平,手写、历史扫描、严重损坏文档和更广泛采集条件仍未得到充分测量。残差重新平衡还依赖于探针集、表示模型、聚类选择和评估器,并引入额外计算。因此,未来工作将优先考虑更广泛的真实采集数据、更稳定和可解释的能力估计以及更低成本的混合更新,同时跨额外语言和文档领域进行评估。高风险部署应继续将模型输出与来源控制和适当的人工审查配对。