image.png

核心思想是:不再将文本作为离散的 Token 序列直接输入 LLM,而是先将其渲染(Render)成紧凑的图像,再利用视觉语言模型(VLM)进行处理。 这种方法将文本的“字形”(Glyph)作为信息载体,通过视觉表征实现对原始文本信息的高密度压缩。一个视觉 Token 可以承载多个甚至数十个文本 Token 的信息,从而在不牺牲语义保真度的前提下,大幅降低输入模型的 Token 数量。

deepseek ocr并没有做文本转为图像这一步,重点是对图像视觉压缩然后还原的逻辑验证,而glm的这个框架则是重点在做这个文本转为图像这一前置步骤。

研究背景与核心思想

主流 LLM 依赖于 Transformer 架构,其核心是自注意力机制。该机制允许模型中的每个 Token 与序列中的所有其他 Token 进行交互,从而捕捉长距离依赖关系。然而,这种能力的代价是巨大的:

现有的优化方案,如稀疏注意力、滑动窗口注意力等,通过限制每个 Token 的交互范围来降低复杂度至近线性(如 O(N log N) 或 O(N)),但这可能牺牲模型捕捉全局信息的能力。而像 YaRN 这样的位置编码扩展技术,虽然能让模型“接受”更长的输入,却无法降低推理成本,且在超长外推时性能会下降。检索增强(RAG)则通过外部检索来缩短输入,但面临着检索失败导致关键信息丢失的风险。这些方法都在性能、成本、信息完整性这个“不可能三角”中进行权衡。

image.png

Glyph 的创新之处在于它彻底改变了模型与长文本交互的方式。它将长上下文处理从一维的序列建模问题,巧妙地转化为二维的视觉理解问题,从而绕开了传统方法的固有瓶颈。核心思想:通过将文本渲染为图像,利用 VLM 的视觉压缩能力,实现对原始文本信息的高密度压缩。

这种范式转移带来的直接优势包括:

注:与某些仅进行图像视觉压缩和还原的 OCR 模型不同,Glyph 的重点在于文本到图像的渲染这一前置步骤,并在此基础上构建 VLM 理解框架。

技术架构

image.png

  1. 第一阶段:持续预训练 (Continual Pre-Training)
  2. 第二阶段:LLM 驱动的渲染配置搜索 (LLM-Driven Rendering Search)