论文标题:DeepSeek-OCR: Contexts Optical Compression
论文链接:https://github.com/deepseek-ai/DeepSeek-OCR/blob/main/DeepSeek_OCR_paper.pdf
DeepSeek-OCR探索了一个全新的研究方向:通过光学(视觉)方式压缩文本上下文。简单来说,就是将大量文字转换成图像,然后用少量的"视觉token"来表示,从而大幅减少模型需要处理的token数量。
当前大语言模型(LLM)在处理长文本时面临严重的计算挑战,因为计算复杂度随序列长度呈平方级增长。研究团队提出了一个巧妙的想法:一张包含文档文字的图像可以用远少于等效数字文本的token数量来表示丰富信息。这就像"一图胜千言"的道理——通过视觉模态压缩文本信息,可能实现更高的压缩比。

当前开源VLM主要使用三类视觉编码器,都存在各自的缺陷:
随着VLM的发展,出现了大量端到端OCR模型:

DeepSeek-OCR采用统一的端到端VLM架构,包含: