image.png

PaddleOCR-VL 是一款先进、高效的文档解析模型,专为文档中的元素识别设计。其核心组件为 PaddleOCR-VL-0.9B,这是一种紧凑而强大的视觉语言模型(VLM),它由 NaViT 风格的动态分辨率视觉编码器与 ERNIE-4.5-0.3B 语言模型组成,能够实现精准的元素识别。

PaddleOCR-VL覆盖多达109种语言,无论是中文、英文等主流语言,还是小语种,都能实现轻松处理。与其他同类模型相比,PaddleOCR-VL不仅识别效果更好,资源消耗也非常低,速度快,效率高。这款模型不仅得分高,还在文本识别、公式识别、表格理解、阅读顺序四大核心能力上全面拿下SOTA。

代码:https://github.com/PaddlePaddle/PaddleOCR

模型:https://www.modelscope.cn/models/PaddlePaddle/PaddleOCR-VL

技术报告:https://ernie.baidu.com/blog/publication/PaddleOCR-VL_Technical_Report.pdf

体验Demo:https://www.modelscope.cn/studios/PaddlePaddle/PaddleOCR-VL_Online_Demo

image.png

核心亮点

传统文档AI模型往往需要在速度与精度间进行权衡,而PaddleOCR-VL实现了二者的平衡。

技术架构

image.png

PaddleOCR-VL将复杂的文档解析任务分解为两个阶段。

阶段1:PP-DocLayoutV2,负责布局分析,定位语义区域并预测其阅读顺序。PP-DocLayoutV2结构由RT-DETR以及一个具有六个transformer层的轻量级指针网络,以准确预测布局元素的阅读顺序。

版式分析:RT-DETR结构

版式分析:RT-DETR结构

训练方法:版式分析(目标检测)初始化权重:PP-DocLayout_Plus-L,使用2w数据量训练100轮。阅读顺序:模型输出一个矩阵,表示任意两个元素之间的成对排序关系。