
日前,上海人工智能实验室(上海AI实验室)全面上线新一代文档解析大模型——MinerU2.5,其核心创新在于采用解耦的两阶段解析策略,将全局布局分析与局部内容识别分离,既保证了高精度又显著提升了计算效率。该模型以1.2B参数规模,在布局检测、文本识别、表格识别、公式识别等核心任务上取得全面突破,在文档解析主流评测基准**OmniDocBench、olmOCR-bench及Ocean-OCR上均取得优异成绩,**超越Gemini2.5-Pro、GPT-4o、Qwen2.5-VL-72B等多模态通用大模型以及dots.ocr、MonkeyOCR、PP-StructureV3等文档解析专业模型和工具。
技术报告:https://arxiv.org/abs/2509.22186
开源项目:https://github.com/opendatalab/MinerU
开源模型:https://huggingface.co/opendatalab/MinerU2.5-2509-1.2B
在线使用:https://mineru.net/OpenSourceTools/Extractor
MinerU2.5的架构基于Qwen2-VL框架,包含三个核心组件:

▲MinerU2.5 技术架构
两阶段解析策略
三阶段训练流程