image.png

报告概述

日前,上海人工智能实验室(上海AI实验室)全面上线新一代文档解析大模型——MinerU2.5,其核心创新在于采用解耦的两阶段解析策略,将全局布局分析与局部内容识别分离,既保证了高精度又显著提升了计算效率。该模型以1.2B参数规模,在布局检测、文本识别、表格识别、公式识别等核心任务上取得全面突破,在文档解析主流评测基准**OmniDocBench、olmOCR-bench及Ocean-OCR上均取得优异成绩,**超越Gemini2.5-Pro、GPT-4o、Qwen2.5-VL-72B等多模态通用大模型以及dots.ocr、MonkeyOCR、PP-StructureV3等文档解析专业模型和工具。

技术报告:https://arxiv.org/abs/2509.22186

开源项目:https://github.com/opendatalab/MinerU

开源模型:https://huggingface.co/opendatalab/MinerU2.5-2509-1.2B

在线使用:https://mineru.net/OpenSourceTools/Extractor

模型架构与核心设计

MinerU2.5的架构基于Qwen2-VL框架,包含三个核心组件:

▲MinerU2.5 技术架构

▲MinerU2.5 技术架构

两阶段解析策略

  1. 阶段一(布局分析):将输入图像统一降采样至1036×1036像素,快速提取文档结构(如段落、表格、公式区域),避免高分辨率计算开销——过小会导致细节丢失,过大则会触发NaViT的二次复杂度
  2. 阶段二(内容识别):根据布局结果裁剪原图区域(最高分辨率2048×28×28像素),分别进行文本、公式和表格的精细识别,保留细节信息——避免了因裁剪区域过小而导致的细节丢失,又防止了因区域过大而产生的冗余计算

训练与数据引擎

三阶段训练流程

  1. 模态对齐:使用视觉问答(VQA)数据对齐视觉与语言表征;
  2. 文档解析预训练:在大规模自动标注数据上学习布局分析与内容识别;