全球大模型进展新闻浏览站
中文头版English
输入关键词,快速查找已抓取新闻。

今日版 / 2026年8月12日星期三

limbo logolimbo

数据更新时间

8月10日 18:20

启用来源

17

抓取状态

真实抓取

开源模型The Decoder

旧OCR文本影响模型训练,FineBooks大规模修复

摘要

Hugging Face与EleutherAI的FineBooks项目测试了14个开源OCR模型,在2000多页历史书籍上,最佳模型dots.mocr字符准确率达97.6%,每千页成本低于2美元,足以用于AI训练数据,但尚不足以用于学术转录。

背景解释

旧OCR文本中的错误会污染语言模型的训练数据,影响模型性能。FineBooks项目旨在通过评估和选择高性价比的OCR模型,大规模提升历史书籍的数字化质量,从而改善AI训练数据的质量。这对依赖公开文本数据的AI研究具有重要意义。

原文译文

以下为抓取到的原文内容译文,已统一为站内阅读格式。

阅读原文

旧 OCR 文本阻碍语言模型训练,FineBooks 希望大规模解决这一问题

  • FineBooks 项目是 Hugging Face 与 EleutherAI 的合作项目,对 14 个开源 OCR 模型在超过 2000 页历史书籍上进行了基准测试,以评估它们将扫描文本转换为可用于 AI 语言模型训练的干净文本的能力。
  • 较小的模型通常优于较大的模型,表现最好的模型字符准确率超过 97%,每千页成本不到 2 美元。
  • 尽管研究人员认为输出质量足以用于 AI 训练,但他们指出,这些模型对于学术或科学应用来说仍然过于容易出错。

Hugging Face 和 EleutherAI 的 FineBooks 项目在 2000 多页历史书籍上测试了 14 个开放权重 OCR 模型。最好的模型已经能生成足够好的文本用于 AI 训练,但它们尚未准备好用于学术用途。

在公有领域书籍上训练开源 AI 语言模型意味着要处理糟糕的文本。图书馆多年前使用光学字符识别从扫描件中提取了这些文本,结果往往充满错误。Talkie 项目量化了潜在的损害:一个在 OCR 文本上训练的语言模型,其学习效率仅为在相同书籍的人工转录文本上训练的模型的 30%。

FineBooks 是 Hugging Face 和 EleutherAI 的合作项目,测试了当前开源 OCR 模型能否解决这个问题。团队在 2165 页历史书籍上运行了 14 个开放权重模型,并将结果发布为排行榜。最好的模型字符准确率超过 97%,每千页成本不到 2 美元。

2165 页基准真值页面中的三页:单栏英文自然史文本、多语言目录,以及整个转录只有一行艺术家署名的插图页。| 图片来源:FineBooks / Biodiversity Heritage Library

数百万页公有领域文本需要更好的文字识别

当 EleutherAI 及其合作伙伴去年发布 Common Pile(迄今为止最大的开放许可训练语料库)时,其中包含约 30 万本公有领域书籍,文本来自较旧的 OCR 运行。FineBooks 作者表示,用更好的模型重新处理这些书籍是改进开放 AI 训练数据集最有效的方法之一。

该项目选择生物多样性遗产图书馆(BHL)作为第一个目标,该图书馆拥有超过 30 万份数字化自然历史文献,总计超过 6400 万页。BHL 通过 AWS 提供其馆藏的批量下载。

衡量 OCR 质量需要已知正确转录的页面。团队使用了 IMPACT 项目和 BHL-Europe 的工作:在 2011 年至 2012 年间,专家们以英语、法语、德语和拉丁语转录了六卷 BHL 书籍,错误率约为每 2000 个字符一个错误。这些数据在 CC-BY 许可下可在 GitHub 仓库中获取,并构成了新的基准真值数据集的基础。

小模型胜过更大的竞争对手

所有 14 个模型均可免费获得,并可在本地硬件上运行,无需 API 密钥。指标是字符错误率(CER),即错误识别字符的比例。排行榜将结果分为“外交”变体(将长 s(ſ)等古字符的现代化视为错误)和“阅读”变体(容忍此类变化)。

领先的 dots.mocr 模型仅使用 30 亿参数,而 Qwen3.5-9B 尽管规模几乎是其三倍,得分却更低。OvisOCR2 以 9 亿参数位居第二,每千页成本为 46 美分。对于历史文献,模型大小与 OCR 质量并不相关。

评估仅涵盖四种语言的 Antiqua 字体。它不考虑哥特体、非拉丁文字或手写体,并且 FineBooks 仅限于单栏书页。团队计划使用顶级模型之一重新处理约 20 万份公有领域 BHL 文档,并将文本作为开放数据集发布。新模型会持续添加到排行榜中,评估框架也已开放。

足以用于 AI 训练,但对学术研究来说仍不够准确

FineBooks 作者根据预期用途判断结果。他们写道,对于训练语言模型,顶级模型的表现已经足够好。这些模型产生的错误远少于旧流程,并且以测得的成本重新处理 BHL 规模的馆藏是可行的。

团队指出,图书馆面临不同的问题。他们的系统依赖 ALTO XML,这是一种带有词级坐标的格式。新模型输出 Markdown 或纯文本,没有词位置,因此无法接入现有的图书馆基础设施。

对于学术转录,准确性仍然不足,但原因不是模型误读字符。它们会静默地现代化字符,将长“s”或连字替换为现代等价物。团队表示,针对性的微调可以解决这个问题。

无炒作 AI 新闻——由人类策划

订阅 THE DECODER 以获得无广告阅读、每周 AI 通讯、每年六次的独家“AI Radar”前沿报告、完整档案访问权限以及评论区的访问权限。

来源地区

Europe

热度分

68

分类

开源模型

语言

en