dots.ocr是一款功能强大的多语言文档解析器,它将布局检测和内容识别功能统一在一个视觉语言模型中,同时保持良好的阅读顺序。尽管其 LLM 基础紧凑,拥有 17 亿参数,但它仍达到了最佳性能 (SOTA)。
- 强大的性能: dots.ocr在OmniDocBench上实现了文本、表格和阅读顺序的 SOTA 性能,同时提供与 Doubao-1.5 和 gemini2.5-pro 等更大的模型相当的公式识别结果。
- 多语言支持: dots.ocr 展示了对低资源语言的强大解析能力,在我们的内部多语言文档基准测试中,在布局检测和内容识别方面都取得了决定性的优势。
- 统一且简洁的架构:dots.ocr 利用单一视觉语言模型,相比依赖复杂多模型流程的传统方法,其架构显著简化。只需更改输入提示即可轻松切换任务,这证明了 VLM 能够取得比 DocLayout-YOLO 等传统检测模型更出色的检测效果。
- 高效快速的性能:dots.ocr 基于紧凑的 1.7B LLM 构建,比许多其他基于更大基础的高性能模型提供更快的推理速度。
性能比较

技术实现
从技术实现来看,dots.ocr基于Qwen2.5-VL架构,使用了aim-v2的设计思路。项目团队还特别感谢了MonkeyOCR、OmniDocBench等开源项目的贡献。项目的开源协议也很友好,商业使用基本没有障碍。
性能评估与效果评估

OmniDocBench

olmOCR-bench
局限性
- 复杂表格和公式的解析还不够完美
- 文档中的图片暂时还不能解析
- 对于字符密度特别高的图片可能会解析失败
- 在大批量PDF处理时性能还有优化空间