.

百度打造的文档解析"流水线工厂":让AI读懂一页文档的每个角落|每日视点

来源:科技行者

这项由百度飞桨(PaddleOCR)团队主导开发的研究,以预印本形式发布于2026年7月21日,论文编号为arXiv:2607.18839,感兴趣的读者可通过该编号在arXiv平台查阅完整论文。


(资料图片)

每当你用手机拍下一份合同、一张账单,或者一页教材,然后希望电脑把里面的文字、表格、公式都完整提取出来——这件事听起来简单,背后却藏着一个长期困扰AI工程师的难题。现有的智能文档解析系统,哪怕再聪明,基本上都得一个字一个字地把整页内容"念"出来,就像一个速记员坐在那里,把眼前的文稿从头到尾逐字抄写,不抄完不罢手。文档越长,等待时间越久,效率也就越低下。

百度飞桨团队却从中发现了一个被所有人忽视的机会:一页文档确实需要整体看一遍,搞清楚哪里是标题、哪里是正文、哪里是表格;但一旦结构摸清楚了,每个区域里的具体内容,其实完全可以同时交给不同的"速记员"来分头抄写,不必傻等一个人抄完再抄下一个。这个看似简单的想法,催生了一套名为HPD-Parsing(层级并行文档解析)的新方法,实现了在保持解析质量的前提下,速度提升至少3倍的突破性进展。

一、文档解析为什么像一条效率低下的单行道

要理解这项研究解决的问题,先来想象一个场景:你是一家工厂的管理员,负责把一叠混乱的产品说明书整理成电子档。最传统的做法,是雇一个打字员,让他从第一页第一个字开始,一直打到最后一个字为止。这种方式虽然稳妥,但只要文档稍长,效率就惨不忍睹。

目前主流的智能文档解析系统,本质上就是这样的"单打字员"模式。这类系统基于视觉语言模型(可以把它理解为一种"能看图说话的AI"),在拿到一页文档图片后,先用眼睛扫一遍整页内容,然后开始逐字逐句地生成解析结果——每输出一个字,就要参考前面所有已经输出的内容,形成一条单一的、不可中断的文字流。

研究团队在实验中对这种单打字员模式做了详细的计时测量,使用了一个以InternVL3.5-1B为基础架构的标准解析模型,在16张文档同时处理的条件下观察速度变化。结果非常清晰:随着文档输出字数的增加,"扫图"这个步骤的耗时几乎没有变化,而"打字"步骤的耗时却像坐火箭一样急剧攀升。到了输出内容特别长的文档,打字的时间甚至比扫图的时间长了将近500倍。换句话说,瓶颈根本不在"看懂图片",而完全卡在"一个字一个字地往外念"这个步骤上。

这个发现为研究团队指明了方向:既然扫图不是问题,那就专门对"打字"这个步骤动刀。

二、关键洞察:文档结构需要统一指挥,内容却可以分头完成

研究团队观察到,一页文档其实天然地分成两种任务,它们的性质完全不同。

第一种任务是"看懂整体结构":这一页有几个文字块、几张表格、几个公式,它们分别在哪个位置、按什么顺序阅读——这些信息需要看完整页才能判断,任何一个局部都无法替代全局视角,因此必须统一处理,不能拆分。

第二种任务是"读懂每块内容":当你已经知道左上角那一块是一段正文、右边那一块是一张表格之后,去识别这段正文里写了什么、这张表格里有哪些数字,这两件事其实彼此之间没什么关系——正文里写的内容不影响表格里的数字,反之亦然。两个独立的区域,完全可以同时交给两个人去读。

正是这个"结构需要统一看,内容可以分头读"的本质特征,给了研究团队灵感。他们设计了一套"工厂流水线"式的工作机制,彻底打破了原来单条流水线的模式。

三、HPD-Parsing:工厂长+多条流水线的协作机制

HPD-Parsing的核心设计可以用一家小型工厂来理解。工厂里有一个工厂长(负责布局分析的主分支),还有多条可以同时开工的生产线(负责各区域内容解码的子分支)。

工厂长的职责是先把整页文档扫一遍,依照自然阅读顺序,逐个标出"这里是一个标题区域,坐标在哪里""这里是一段正文,坐标在哪里""这里是一张表格,坐标在哪里"。每标出一个区域,工厂长就在那个位置放置一个特殊的"开工信号"(在系统里叫做FORK标记),意思是:"这个区域的具体内容,可以开一条新生产线去处理了。"

收到开工信号后,调度系统立刻为这个区域创建一条专属生产线。这条生产线会自动"继承"工厂长此前已经建立的所有共享信息——包括整页图片的视觉信息,以及已经标注好的结构信息——就好像新来的工人不需要重新学习工厂的基本规章,直接拿着已经整理好的工作手册上岗。然后,这条生产线聚焦在自己负责的那一小块区域,专心把里面的内容识别出来。

关键在于,工厂长在发出第一个"开工信号"之后,并不需要等第一条生产线完工,而是继续往下扫描,发现下一个区域就再发一个"开工信号",依此类推。最终,多条生产线同时在运转,每条只负责文档的一小块,整体完成时间就大大缩短了。就像一支餐厅团队,前台领班快速把菜单上的菜分配下去,厨房里几口锅同时开火,远比让一个厨师从头到尾炒完所有菜要快得多。

这套机制还有一个额外的好处:每条生产线只需要记住自己负责区域的内容,不需要记住其他生产线在干什么。在原来的单打字员模式里,打字员每打一个字,都要回头看一眼前面所有已经打过的内容,文档越长,这个"回头看"的动作就越耗时。而在HPD-Parsing里,每条生产线只需要看共享的结构信息和自己那一小块的内容,注意力范围大大收窄,处理速度自然更快。

四、让每条生产线更快:渐进式多词预测技术

工厂长加多条生产线的机制,解决了"并行"的问题。但研究团队还嫌不够快,他们又为每条生产线引入了一种叫做"渐进式多词预测"(P-MTP)的加速技巧。

在普通的AI文字生成过程中,系统每次只能"猜"出下一个字,然后把这个字纳入上下文,再猜下下一个字,如此循环。这就像一个打字员,每打完一个字才能想下一个字,哪怕他其实已经大致知道后面几个字是什么。

P-MTP的思路是:既然文档里很多区域的内容相当有规律(比如表格里的数字格式、公式里的符号组合),AI完全可以一次猜多个字,然后快速验证这些猜测是否都正确——猜对了就全部采用,猜错了就从出错的地方重来。就像一个有经验的打字员,看到"北京市朝阳区"这几个字的开头,脑子里已经能自动预填后面几个字,不需要一个一个地打。

在HPD-Parsing的实验中,这套机制平均每步能一次性确认6.6个字,比一次只确认一个字快了很多。工厂长分支和每条生产线分支都使用这个技巧,两种加速手段叠加在一起,效果相当可观。

P-MTP的训练方式也很有意思。它在模型里附加了一个轻量级的"猜字模块",这个模块不是单独训练的,而是和整个系统一起训练。训练时,越近的猜测结果权重越高,越远的猜测结果权重越低,这样模型就学会了"近处猜得准,远处猜得保守"的策略,不至于因为猜太远而出现大量错误。

五、三阶段训练:从"老手艺"到"新流程"的转型

设计好了工厂架构,接下来要训练这个系统真正学会这套新流程。研究团队发现,直接从零开始用新方式训练效果并不好,更合理的做法是分三个阶段循序渐进。

第一阶段是打基础。系统先用传统的"单打字员"方式,对280万份文档进行大规模训练,学会基本的文字识别、表格理解、公式解析和阅读顺序判断。这一步的目的是让系统先成为一个全能选手,把"能做什么"这个问题解决好,不急着考虑"怎么更快"。P-MTP模块也在这一阶段同步训练,学习如何对大量连续文字进行多步预测。

第二阶段是转换模式。在第一阶段训练好的基础上,系统开始学习新的工厂流水线格式。每一份文档被拆成两种训练样本:一种是"工厂长视角",只需要学习标注文档结构;另一种是"生产线视角",只需要学习识别某一小块区域的具体内容。这一阶段专门挑选了10万份较难的文档进行训练,重点强化系统对复杂结构(密集表格、多栏排版、复杂公式、模糊区域)的处理能力。

第三阶段是精细打磨。研究团队为系统引入了强化学习机制,用更直接的"好坏奖惩"信号来纠正系统的常见错误。具体来说,对公式识别质量、表格解析准确性、版面预测正确率分别设计了专项奖惩,同时还有一个"计数一致性奖励"——检查系统标注的区域数量是否和实际文档一致,防止漏标或多标。这一阶段只使用了600份精心挑选的困难样本,体量很小,但针对性很强。

六、数据工厂:自动筛选"有难度的训练题"

巧妇难为无米之炊,再好的训练方法也需要高质量的数据支撑。研究团队为此专门开发了一套自动化的数据处理流水线,分四步完成训练数据的收集和筛选。

第一步是"去重采样"。系统从海量文档图片中提取视觉特征,把长相相似的文档聚成一堆,然后从每堆里选代表性样本。这样做是为了防止训练数据里充斥着大量"长相雷同"的文档,确保系统见识到的文档类型足够多样。

第二步是"多模型打标签"。采样出来的文档被送给两个已有的优秀解析系统(PaddleOCR-VL-1.5和MinerU-2.5 Pro)进行解析,得到初步的参考答案。同时,HPD-Parsing的中间版本也对同一批文档进行解析,把自己的结果和参考答案对比,按照差距大小把文档分成"简单"、"中等"、"困难"三类。那些HPD-Parsing中间版本解析得很准的,归入简单组;出现明显错误的,归入困难组。

第三步是"VLM辅助纠错"。困难样本会被送给一个更强大的通用视觉语言模型,让它仔细检查现有标注里的错误,然后根据错误类型自动调整提示方式,重新生成更准确的标注。这个过程会反复进行,直到标注质量达标,或者达到最大尝试次数为止。对于那些包含密集表格、多栏版面、复杂公式的文档,这一步尤其有帮助。

第四步是"均衡配比"。纠错完成后,系统会调整简单、中等、困难样本的比例,防止训练数据被大量简单文档"稀释"。同时也会平衡不同文档元素(文本块、表格、公式、复杂版面)的出现频率,让系统在各种场景下都得到充分练习。

七、实验结果:速度与质量的双重考验

研究团队在OmniDocBench v1.6这个公认的文档解析测试集上,对HPD-Parsing进行了全面评估,并与业界众多竞争对手做了横向比较。

在解析质量方面,HPD-Parsing以94.91分(满分100分)的综合评分,在所有"端到端统一解析"类方法中排名第一,超越了参数量更大的Qianfan-OCR(4B参数)、Logics-Parsing-v2(4B参数)和FireRed-OCR(2B参数),而HPD-Parsing自身只有1B参数,体量相当轻巧。在阅读顺序预测这一细分指标上,HPD-Parsing得分0.124,甚至和专门针对版面分析优化的流水线类系统不相上下。

在处理速度方面,效果更加突出。与使用相同基础架构的传统单打字员版本相比,HPD-Parsing在批量处理512页文档的条件下,每秒处理的字符数从1554.8个跃升到4752.1个,提升幅度达到3.06倍;每秒处理的页面数从1.02页提升到2.68页,提升幅度2.62倍。与业界其他已知速度最快的解析系统相比,HPD-Parsing的字符吞吐量是其1.62倍。

更有意思的是,文档越长,HPD-Parsing的速度优势越明显。研究团队按输出字数把测试文档分成若干段,分别比较各段的速度差异。在输出字数最多的那一段,HPD-Parsing所需的解码步骤数只有传统方法的1/18;批量处理时的吞吐量是传统方法的3.67倍;单页处理的延迟时间只有传统方法的1/5.8。换句话说,普通文档用HPD-Parsing快3倍,特别长的文档快将近6倍,道理很直观:传统方法的时间随文档长度线性增长,而HPD-Parsing的时间主要取决于最长那一条生产线,而非所有生产线的总和。

尽管HPD-Parsing每页文档需要输入约4800个视觉标记(是DeepSeek-OCR-2的四倍多),但速度依然遥遥领先,这说明HPD-Parsing的效率提升并非靠压缩输入信息换来的,而是真实来自解码机制的改进。

八、并行解析还有哪些额外好处

除了速度,并行解码机制还带来了几个研究团队在定性分析中观察到的附加优势,值得单独说明。

一个典型好处是对版面检测错误的容忍度更高。在传统流水线式系统中,版面分析是第一道工序,一旦某个区域的边界框标注不准确,后续的内容识别就会出错,就像裁缝按照量错的尺寸裁布,再精湛的针线功夫也救不了。HPD-Parsing因为在识别每块内容时,始终能"看到"整页图片,而不是只看被裁出来的那一小块,所以即使区域边界不那么精准,也能借助全局视觉信息纠正局部误差。

另一个好处是对形近字的判断更准。比如数字"0"和字母"O",在视觉上极其相似,只有结合上下文才能分辨。孤立地处理一小块文字,判断往往不准;但如果能看到整页文档的语境——比如这个字出现在一串数字序列里——判断就会准确得多。HPD-Parsing的主分支始终保有全局上下文,这个优势会自然传递给每条生产线。

还有一个好处是错误不会蔓延。在传统单打字员模式里,如果AI某个位置生成了一个错误的字,这个错字会被纳入后续所有字的参考上下文,有时会引发连锁反应,导致后续大段内容陷入反复重复同一错误文字的"死循环"。在HPD-Parsing里,每条生产线只负责一小块区域,即便某条生产线出了错,也只影响那一小块,不会污染其他生产线的输出,将损失控制在最小范围内。

九、系统如何在实际运行中调度这些并行任务

在将这套机制落地为实际可用的服务时,研究团队在主流推理框架vLLM的基础上,专门开发了一套调度算法,解决多条生产线并发运行时的资源管理问题。

调度系统的核心设计原则是优先保障子分支(也就是具体内容解码的生产线)尽快开始运行,不被其他新进来的请求抢占资源。当内存空间紧张时,系统会优先将最晚到来的普通请求暂时挂起,而不是打断正在处理的生产线,保证已经开始的文档能尽快完成。每条子分支创建时,使用的是"零拷贝"的方式继承主分支的共享信息,也就是说共享数据不需要复制一份,多条生产线都指向同一份原始数据,既节省内存,又节省时间。当一条生产线完成任务时,系统会检查同一页文档的所有生产线是否全部完成,全部完成后再将这一页的完整结果按照阅读顺序拼合输出。

这种精细的调度设计,保证了HPD-Parsing在服务器同时处理大量文档请求时,既不会因资源冲突导致系统崩溃,也不会因调度混乱导致某些文档长时间等待。

说到底,HPD-Parsing做的事情用一句话就能概括:把"一个速记员抄完整篇文章"变成"一个统筹协调员加一组专职速记员同时开工",并且让每个速记员都学会了"一次多写几个字"的技巧。这个改变听起来并不复杂,背后的工程实现却相当精密,最终换来了3倍以上的处理速度,而且没有牺牲解析准确性。

归根结底,这项研究提醒我们,AI系统的效率瓶颈往往不在于"看得是否够清楚",而在于"怎么输出结果"。当我们意识到文档本身的结构特征——全局协调加局部独立——恰好和并行计算的优势吻合时,一个简洁而有效的解决方案就水到渠成了。对于实际应用场景来说,这意味着企业在处理大量合同、报告、账单时,可以用更少的计算资源完成更多的文档处理任务,成本和效率都会得到实质性改善。

当然,研究团队自己也坦承,目前的工作还有延伸的空间。他们计划在未来继续扩大训练数据的覆盖范围,并探索一种"结构感知注意力"机制,进一步压缩每一步解码时需要参考的上下文范围,让整个系统在注意力计算这个环节也能更高效。有兴趣深入了解技术细节的读者,可通过arXiv编号2607.18839查阅完整论文,模型也已在Hugging Face平台以PaddlePaddle/HPD-Parsing为名公开发布,代码则托管在PaddlePaddle/PaddleOCR仓库中,均可自由访问。

Q&A

Q1:HPD-Parsing和传统文档解析系统相比,速度提升了多少?

A:HPD-Parsing在批量处理512页文档的条件下,每秒处理的字符数达到4752个,是同架构传统自回归方式的3.06倍,是业界此前已知速度最快模型的1.62倍。文档越长,优势越大,最长文档场景下单页延迟仅为传统方法的约1/6。

Q2:HPD-Parsing解析准确率会不会因为并行处理而下降?

A:整体评分没有明显下降。在OmniDocBench v1.6测试集上,HPD-Parsing综合评分94.91分,在所有端到端统一解析方法中排名第一,超越了参数量更大的多个竞争模型,同时在阅读顺序预测上也与专门优化版面分析的流水线系统持平。

Q3:HPD-Parsing的模型和代码是否公开可用?

A:是的,模型已在Hugging Face平台以PaddlePaddle/HPD-Parsing为名公开发布,代码托管在PaddlePaddle/PaddleOCR仓库,均可免费访问使用。



推荐阅读