dots.ocr是一款功能强大的多语言文档解析器,它将布局检测和内容识别功能统一在一个视觉语言模型中,同时保持良好的阅读顺序。尽管其 LLM 基础紧凑,拥有 17 亿参数,但它仍达到了最佳性能 (SOTA)。

  1. 强大的性能: dots.ocr在OmniDocBench上实现了文本、表格和阅读顺序的 SOTA 性能,同时提供与 Doubao-1.5 和 gemini2.5-pro 等更大的模型相当的公式识别结果。
  2. 多语言支持: dots.ocr 展示了对低资源语言的强大解析能力,在我们的内部多语言文档基准测试中,在布局检测和内容识别方面都取得了决定性的优势。
  3. 统一且简洁的架构:dots.ocr 利用单一视觉语言模型,相比依赖复杂多模型流程的传统方法,其架构显著简化。只需更改输入提示即可轻松切换任务,这证明了 VLM 能够取得比 DocLayout-YOLO 等传统检测模型更出色的检测效果。
  4. 高效快速的性能:dots.ocr 基于紧凑的 1.7B LLM 构建,比许多其他基于更大基础的高性能模型提供更快的推理速度。

性能比较

image.png

技术实现

从技术实现来看,dots.ocr基于Qwen2.5-VL架构,使用了aim-v2的设计思路。项目团队还特别感谢了MonkeyOCR、OmniDocBench等开源项目的贡献。项目的开源协议也很友好,商业使用基本没有障碍。

性能评估与效果评估

OmniDocBench

OmniDocBench

 olmOCR-bench

olmOCR-bench

局限性