全球大模型进展新闻浏览站
中文头版English
输入关键词,快速查找已抓取新闻。

今日版 / 2026年8月12日星期三

limbo logolimbo

数据更新时间

7月5日 15:25

启用来源

17

抓取状态

真实抓取

研究进展The Decoder

百度“无限OCR”单次处理数十页文档,内存消耗恒定

摘要

百度提出“无限OCR”技术,通过改进注意力机制,使模型单次可处理数十页文档,而内存消耗不随页数增加。该技术当前在关键OCR基准测试中排名第一。

背景解释

传统OCR系统一次最多处理约十页文档,且内存随页数线性增长。百度通过模拟人类遗忘机制,优化注意力机制,实现了内存消耗恒定,大幅提升处理效率。这一突破对文档数字化、自动化办公等领域有重要意义。

原文译文

以下为抓取到的原文内容译文,已统一为站内阅读格式。

阅读原文

广告

跳转到内容

[仅限订阅者](https://the-decoder.com/subscription/ "仅限订阅者")

百度“无限OCR”通过模拟人类遗忘机制,一次处理数十页文档

![Jonathan Kemper](https://the-decoder.com/author/jonathan-kemper/ "查看 Jonathan Kemper 的所有文章")

Jonathan Kemper[查看 Jonathan Kemper 的 LinkedIn 资料](https://www.linkedin.com/in/jonathankemper/ "查看 Jonathan Kemper 的 LinkedIn 资料")

2026年7月5日

图片描述

Nano Banana Pro 由 THE DECODER 提示生成

目录

  • [固定窗口限制内存使用](#a-fixed-window-caps-memory-use)
  • [基于 Deepseek OCR 构建](#built-on-top-of-deepseek-ocr)
  • [有限注意力下取得更好分数](#better-scores-despite-limited-attention)
  • [尚未真正无限](#not-truly-unlimited-yet)

百度研究人员构建了一个 OCR 模型,能够在单次推理中处理数十页文档,无论文本长度如何,内存使用和速度都保持恒定。重新设计的注意力机制使其成为可能。

百度研究人员在其技术报告中写道,目前没有 OCR 模型能在单次推理中处理超过约十页。瓶颈在于 KV 缓存,这是一种语言模型在生成过程中存储所有已处理 token 的缓冲区,以便后续查找。

当前的端到端系统使用语言模型作为解码器,因此该缓冲区会随着每一行新文本的增长而扩大。这会推高内存使用并逐渐降低生成速度。在实践中,系统通过循环逐页处理文档,并在每一步后重置缓存来绕过这个问题。

!Unlimited OCR 架构图。左侧是一个人抄写书籍,标注为“聚焦书本”、“工作记忆”和“遗忘(软)”。右侧是架构,显示 DeepEncoder 和 MoE 解码器 LLM-(R-SWA),KV 缓存组织为视觉和提示 token 的队列。百度从其架构中借鉴了人类手抄文本的方式。DeepEncoder 压缩页面,而 MoE 解码器使用 R-SWA 处理它们,将 KV 缓存作为固定长度的队列运行。\| 图片:百度

百度将这个问题用人类类比来阐述。抄写书籍的人不会重读所有已写内容。他们眼睛盯着原文、刚写的几个字符以及下一个要写的字符。较早的段落通过一种软遗忘逐渐淡出。研究人员希望 Unlimited OCR 模仿这种模式。

固定窗口限制内存使用

它通过团队所称的参考滑动窗口注意力(R-SWA)实现。每个生成的 token 仍然能看到所有参考 token(视觉图像 token 和提示)。但对于之前生成的输出,它只回看最后 128 个 token。这使得 KV 缓存在整个过程中保持恒定,而不是随输出长度线性增长。

!两张并排的注意力矩阵图,标题为“标准注意力”和“R-SWA”。彩色单元格区分参考 token、工作记忆和未关注位置,显示 R-SWA 保持恒定 KV 缓存,而完整注意力则不然。使用 R-SWA,每个生成的 token 关注所有参考 token,但只关注最后 n 个输出 token,从而在解码过程中保持 KV 缓存恒定。\| 图片:百度

标准的滑动窗口注意力也会使视觉 token 经历持续的状态变化,逐渐模糊图像特征并降低识别效果。R-SWA 使视觉 token 免于这些转换。它们被编码一次并保持不变。

KV 缓存作为一个队列工作,每个新 token 会推出最旧的 token。使用标准多头注意力时,内存使用随 token 数量增加而无界增长。R-SWA 将其限制在前缀长度和窗口大小的固定总和内。

!折线图显示每次调用 Flash Attention v3 内核延迟,解码步骤从 0 到 6000。DeepSeek OCR 曲线(Ds-Attn)攀升至 16 微秒以上,而 Unlimited OCR 曲线(UoW-Attn)保持在约 9 微秒不变。Deepseek OCR 的内核延迟随每个解码步骤攀升,而 Unlimited OCR 由于 R-SWA 保持平坦。\| 图片:百度

基于 Deepseek OCR 构建

Unlimited OCR 基于开源 Deepseek OCR 模型构建。百度保留了其 DeepEncoder,并将其与混合专家架构配对,该架构拥有 30 亿参数,其中推理时仅约 5 亿活跃。DeepEncoder 将 1024x1024 像素的 PDF 图像压缩为 256 个 token。

两种分辨率模式得以延续。“基础”模式处理多页文档,“高达”模式使用动态分辨率处理单页。解码器中的每个标准注意力层都被替换为 R-SWA。

训练使用了约 200 万个文档样本,单页和多页数据按 9:1 分割。Paddle OCR 负责单页的标注。多页数据通过将单页拼接成 2 到 50 页的文档合成构建。

所有数据被打包成 32,000 个 token 的序列;训练在 8 组 16 块 Nvidia A800 GPU 上运行了 4,000 步。DeepEncoder 保持冻结,仅更新语言模型参数。

有限注意力下取得更好分数

根据作者的说法,Unlimited OCR 在 OmniDocBench v1.5 文档基准测试中总体得分为 93%,比 Deepseek OCR 基线高出 6 个百分点。该基准测试衡量多个子任务。纯文本识别错误率(以编辑距离衡量,即每字符所需修正次数)略有下降。表格结构识别提升更为显著,提高了近 6 个百分点。在更新的 v1.6 版本上,模型达到 93.92%,位居端到端系统排名榜首。

在长序列测试中,模型单次处理多页,即使超过 40 页,错误率也保持在 0.11 以下。作者将剩余错误归因于 DeepEncoder 在基础模式下文本过小时的分辨率限制,而非上下文丢失。

将单页窗口限制为 128 个 token 不会损害准确性,反而略有帮助。研究人员推测,R-SWA 迫使模型更紧密地聚焦于密集的 OCR 任务,而完整注意力在输出长度增长时倾向于发散。

恒定的缓存也带来了速度优势。在基础模式下,Unlimited OCR 达到每秒 5,580 个 token,而 Deepseek OCR 为 4,951 个 token,提升了 12.7%。在理想并行化的理论上限比较中,模型在约 6,000 个输出 token 时领先基线 35%,而基线的吞吐量随长度增加而稳步下降。

对于长文档解析这一核心优势,根据百度的说法,即使在 40 页以上,模型也保持编辑距离低于 0.11,Distinct-35 分数达到 97%。错误主要出现在小文本上,研究人员将其归因于基础模式的有限分辨率,而非 R-SWA 的方向问题。

尚未真正无限

模型固定的 32,000 个 token 上下文长度限制了其能处理的页数,因为每增加一页,视觉 token 就会累积。百度计划很快训练 128,000 个 token 的模型,并最终构建一个预填充池,让模型能够自行获取相关的 KV 块,就像翻阅书籍一样。作者还认为 R-SWA 可迁移到其他基于参考的任务,如语音识别和翻译。

代码和模型权重已发布在GitHubHugging Face上。该模型可在 ModelScope 以及推理引擎 vLLM 和 SGLang 上运行。您可以在Hugging Face Spaces 上的演示中试用。

OCR 已成为 AI 领域更活跃的战场之一,各模型主要在 token 效率上竞争。这一兴趣远不止于文档识别。由于基于图像的文字比其数字等效物使用的计算资源少得多,该方法可以扩展语言模型记忆,用于长聊天历史或大型文档。开发者已经利用这一点来降低 Anthropic 的 Fable 5 的 token 成本

Deepseek 今年早些时候推出了Deepseek OCR 2,这是一种编码器,它按语义重新排列图像信息,而不是严格地从左上到右下读取。它在 OmniDocBench v1.5 上得分为 91.09%。

Mistral AI 正在通过Mistral OCR 3巩固其地位,宣称对手写、表格和复杂表格的识别能力更强。对于百度来说,这项工作是其更广泛的 AI 布局的一部分。该公司最近发布了Ernie 5.1,这是一个多模态模型,在 LMArena 上被评为中国最佳模型。

可快速扫描的书籍作为新语言模型的训练数据也很有吸引力,这一话题引发了激烈讨论。研究人员已经证明,大型语言模型可以近乎逐字地再现《哈利·波特》和《霍比特人》等受版权保护书籍中的段落。

无炒作 AI 新闻 – 人工精选

订阅 THE DECODER,享受无广告阅读、每周 AI 通讯、每年六次的独家“AI Radar”前沿报告、完整档案访问权限以及评论区的访问权限。

立即订阅

阅读全文,获取完整信息。订阅以获取无炒作报道。

  • 访问所有 THE DECODER 文章。
  • 无干扰阅读 – 无 Google 广告。
  • 访问评论和社区讨论。
  • 每周 AI 通讯。
  • 每年 6 次:“AI Radar” – 深入探讨关键 AI 主题。
  • KI Pro 在线活动最高可享 25% 折扣。
  • 访问我们完整的十年档案。
  • 从 The Decoder 获取最新 AI 新闻。

订阅 The Decoder

BETA-TEST

×

开始新搜索

×\|

发送

wpDiscuz

插入

BETA-TEST

×

开始新搜索

×\|

发送

wpDiscuz

插入

׋›

来源地区

Europe

热度分

73

分类

研究进展

语言

en