top of page

Ibteda Digital Library 保存了 1,800 本珍稀书籍,但十次人工修正胜过更大的 AI

8月31日
讀畢需時 13 分鐘

三位巴基斯坦朋友使用两台入门级 Nikon 相机,累计按下约 902,000 次快门,保存珍稀乌尔都语书籍,Ibteda Digital Library 也因此登上 Google News。根据一份项目记录及后续报道,他们历经十年的努力,拍摄了 526,000 张打开书页的跨页照片。

惊人的相机快门数让这个故事迅速传播。然而,更重要的成果出现在日常数字化工作停止之后:一名团队成员将多年的 Photoshop 手工编辑转化为神经网络的训练标签。

这项实验得出了一个颇为尴尬的结论——对于习惯期待更大模型和更多数据带来提升的行业而言尤为如此。增加训练书籍、提高输入分辨率,以及采用 ResNet-50 骨干网络,都没有解决核心裁切问题。十次人工操作修正却做到了。

因此,这个项目的意义不止于一次格外坚定的扫描行动。它表明,文化保存工作不能简单照搬大型商业 AI 系统背后的假设。档案必须保留特殊标记、页边批注、标点和材料瑕疵,而通用模型可能会将这些归类为噪声。

它也与工业化图书扫描项目形成鲜明对比。近期调查指出,有公司购买纸质书籍并以破坏性方式扫描,用于 AI 训练。Ibteda 的工作节奏缓慢,保留了实体书册,并让读者能够访问至少部分数字化馆藏。

Google News 标题背后的数字

相机快门数讲述的是坚持,而尚未处理完的队列则解释了 Ibteda 为什么必须改变方向。

Ibteda 大约始于 2015 年,当时其创始人正在研究 Ghalib《Diwan》的历史版本。他们很难找到一些重要书册:这些书要么已经绝版,要么无法在大学馆藏中获取,要么由私人收藏。

团队随即在巴基斯坦建立了自己的档案库。他们没有机构级数字化实验室、商业扫描服务机构,也没有专门的设备预算。其装置起初由平桌、廉价 Philips LED 灯、架设在书本上方的相机,以及从复印机中回收的玻璃组成。

一次快门即可拍下左右相对的两页。这种方法加快了拍摄速度,但每张图像也都包含桌面、页边、书脊阴影、不均匀留白、污渍和手写添加内容。

Nikon D5300 最终累计约 576,000 次快门。D3300 又增加了约 326,000 次,使常见报道中的总数达到约 902,000 次。这些数字来自与相机相关的快门数据,而非仅根据已发布页面数量作出的估算。

团队拍摄了约 526,000 张打开书页的跨页照片。一张跨页包含两个相对页面,因此不能将其视为 526,000 本已完成的书籍,甚至也不能视为 526,000 个已完成的单页文件。拍摄只是第一阶段。

项目更详细的记录称,操作人员已完成对 1,765 本书中 575,729 个单页的裁切。这些已完成工作随后成为机器学习实验的基础。

一些报道将馆藏四舍五入为 1,800 本书,而当前图书馆介绍则提到通过更广泛计划汇集的规模大得多的目录。这些衡量指标描述的是不同事物:已处理书册、已拍摄材料、目录馆藏,以及合作方托管的精选内容。

例如,Rekhta 馆藏称 Ibteda 始于 2016 年,并将其目录描述为超过 5,000 本书和 300 万页。Rekhta 目前呈现的是这一更大馆藏中的精选部分,而非每一张原始或已处理照片。

这一差别很重要,因为广泛传播的标题可能让人以为每张已拍摄的跨页照片都已完成转换。实际上,处理负担超过了团队维持日常运作的能力。

据报道,Ibteda 在近十年后于 2026 年 4 月逐步停止了常规工作。该团队成功保存了大量乌尔都语文学资料,但数十万张已拍摄的跨页照片仍需要仔细处理。

团队的相机承受的工作量早已远超一个临时组建的社区项目所能预期。人工注意力成了更稀缺的资源。

拍下书籍是最容易的部分

Ibteda 的瓶颈不在于拍照,而在于将不规则的历史页面转化为档案可以信赖的文件。

每次曝光后,操作人员都会在 Photoshop 中打开照片。他们分离相对页面、校正页面角度、选择合适边界,并处理污渍或其他视觉干扰。

这并非普通的批量裁切。许多书册采用 Nastaliq,一种常与乌尔都语和波斯语文学传统相关的流动书写体。其点、斜向字形、紧凑标记和附加符号,都会增加自动清理的难度。

一个小黑点可能是灰尘,也可能是改变字母含义的重要点号。边缘附近的一条线,可能是意外阴影、印刷边框,或值得保留的手写批注。

石版印刷进一步增加了变化。页面可能包含不规则的印迹、老化纸张、变形几何结构、深重的书脊阴影、页边书写、表格或装饰元素。没有一个单一矩形能代表每一本书的正确裁切范围。

操作人员还需要作出审美和编辑判断。一本书使用较窄留白或许效果最佳;另一本则需要保留更多周边空间,以留住笔记、装订痕迹或特殊印刷边框。

这些选择形成了一个隐藏变量。理想留白并不总能从像素中看出来。两位胜任的档案工作人员面对同一页,可能会选择略有不同、但都可接受的边界。

这个问题使档案处理区别于许多商业图像任务。购物应用可以容忍轻微的视觉标准化;保存系统却不能仅因某些痕迹看起来像瑕疵,就轻率地将其移除。

Ibteda 的档案还必须支持未来核查。据报道,其工作流程将已完成材料存储在 ZFS 池中,这是一种采用校验和及相关完整性功能的存储系统。BLAKE3 清单记录了加密指纹,可用于发现后续文件变更。

这种对可追溯性的强调很重要。一页看起来干净,并不自动意味着它是可信赖的档案对象。研究人员必须知道,软件没有在无声无息中改写源材料。

同样的原则也适用于现代知识管理。只有当人们能够将信息追溯至稳定、易理解的源材料时,搜索和自动化才能创造价值。

对 Ibteda 而言,自动化节省的每一小时都伴随着相应风险。一个模型若能正确擦除一处污渍,却在别处删除一个乌尔都语标记,便可能引入永久性的文本错误。

因此,该项目所需的不只是图像增强模型。它需要一个保守的系统,知道何时提出修改建议,何时保留原始像素,以及何时将页面交还给人工处理。

这一要求促使团队为裁切和修图分别采用不同模型与处理规则。它也解释了为何大量历史 Photoshop 工作会成为有价值的训练数据。

十年的 Photoshop 编辑变成了训练数据

团队最可复用的资产不是相机硬件,而是在日常生产工作中作出的 575,729 次人工决策记录。

每个完成的 Photoshop 页面都编码了有关页面起止位置的选择。然而,这些决策最初并不是可直接用于机器学习的结构化标签。

团队必须将完成页面重新关联到原始照片。其公开技术讨论称,他们在这一恢复过程中使用了 SIFT 和 MAGSAC。

SIFT,即尺度不变特征变换,可识别即使在缩放或旋转后仍能匹配的独特视觉特征。MAGSAC 是一种稳健估计方法,在拟合图像几何关系时有助于排除错误匹配。

这些技术结合使用,使项目能够估计完成页面与原始相机图像之间的关系。保守的接受规则会筛除可疑匹配,而不是强行将每个文件纳入数据集。

所得几何信息成为裁切预测模型的监督信号。实际而言,团队将多年的人工编辑转化为示例,展示操作人员如何设定页面边界。

这为其他小型档案机构提供了一个有价值的模式。一个组织或许缺乏正式标注的 AI 数据集,却拥有多年的编辑、修正、审批和生产输出。这些记录包含的领域知识,可能比通用图像集合更有用。

然而,历史工作流程数据并不会天然可靠。它可能包含不一致的操作人员偏好、标准变化、重复文件、失败编辑以及未记录的例外情况。

Ibteda 的案例尤其具有挑战性,因为部分不一致反映的是合理判断。较窄的裁切对一本书可能是正确的,而同样的留白对于另一本书则可能造成损害。

裁切模型仍然学会了可见结构。它可以识别可能的页面边界、书脊和周围桌面空间。然而,团队发现,其剩余误差往往在每本书内几乎保持恒定。

这一模式颇具启发性。模型并非只是无法检测页面,而是没有捕捉到操作人员针对特定书册偏好的内缩边距。

在一份技术讨论中,项目作者表示,将训练书籍从 378 本扩展至 572 本,并未改善模型在未见书册上的表现。ResNet-50 模型对训练数据拟合得更好,但在留出的测试材料上表现依然持平。

将输入分辨率提高到 1,024 像素,也未能带来预期提升。空间预测头同样没有解决问题。

这些负面结果之所以重要,是因为它们挑战了 AI 开发中一种常见的惯性反应:当性能停滞时,团队往往会增加数据、算力、分辨率或采用更大的架构。

当缺失信号存在于训练输入中的某处时,这种策略确实有效。Ibteda 的实验表明,决定性的偏好并不体现在一本新书的像素中。

再大的骨干网络也无法可靠推断图像本身不包含的信息。系统需要少量新的人工上下文。

十次修正胜过更大的神经网络

Ibteda 通过针对每本书进行校准来改进裁切模型,而不是要求更大的网络去猜测一个不可见的偏好。

对于一本新书,操作人员会修正十个预测裁切结果。系统将这些修正与原始预测进行比较,并计算中位残差,也就是机器输出与人工偏好之间的典型偏移量。

随后,它会将这一调整应用到该书其余页面。同一书册中的页面通常共享纸张尺寸、印刷风格、装订几何特征,以及操作人员期望的留白。

该项目报告称,这种校准使其在留出卷册上的 pass@80 指标从 0.71 提升至 0.83。Pass@80 指至少 80% 页面符合项目验收标准的书籍占比。

这一提升来自十次操作员修正,而不是更大的模型。它支持一种务实的人机协同自动化形式:由人工提供有限示例,引导系统处理特定批次。

与通用视觉模型相比,这一机制并不起眼。但正因如此,它适合这项任务。它针对的是模型无法直接观察到的、稳定的书籍级偏差。

该系统并未取代档案工作者。它将档案工作者的注意力集中在一册书的开头,随后将这一判断一致地应用到后续页面。

这种方法也限制了失败成本。如果校准看起来有误,操作员可以停止处理该卷册。全自主系统则可能在无人察觉前,将同一种细微的裁切错误重复到数百页上。

这一结果的意义不限于书籍。许多文档工作流中都存在与客户、项目、馆藏、设备或报告周期相关的偏好,而这些偏好通常并不体现在原始内容中。

通用模型可以识别可见结构,而少量修正则提供本地政策。与在彼此不兼容的偏好上训练出的更大模型相比,这种组合可能表现得更好。

Ibteda 的修复工作同样遵循了谨慎保守的理念。U-Net 是一种为像素级图像分割设计的神经网络架构,它用于识别包含污渍、印章或不需要痕迹的候选区域。

该模型仅负责检测。经典 OpenCV 例程会在获准的蒙版内重建纸张纹理,而该区域之外的像素保持不变。

训练标注采用三种状态:REMOVE、KEEP 和 IGNORE。REMOVE 标示被认为可以安全擦除的痕迹。KEEP 保护那些看似噪点、但属于文档内容的部分。IGNORE 则将模糊区域排除在训练之外。

项目作者报告称,更严格的标注将痕迹的交并比从 0.56 提高至 0.60。交并比衡量预测区域与人工标注目标之间的重叠程度。

更重要的是,据称这一更严格的流程将评估材料中乌尔都语变音符号的误删降至零。团队将任何被擦除的变音符号都视为部署否决条件,无论模型的平均得分如何。

这条规则体现了一项核心的保护原则:较高的总体指标不能成为删除有意义文本的理由。一次具有文化意义的失败,其重要性可能超过数千个被正确清理的像素。

这种保护模型挑战了破坏性扫描

Ibteda 使用 AI 延长档案寿命,而工业扫描项目往往侧重于尽可能快地获取文本。

这种对比在 2026 年 8 月变得更加鲜明。调查报道指出,科技公司正在购买实体书籍、拆除装订、扫描页面,然后丢弃剩余部分。

此前的法庭记录显示,Anthropic 在建立内部研究图书馆时购买并破坏性扫描了数百万本书。Anthropic 表示,其收购计划并不针对稀有书籍或古董书籍。

较新的报道聚焦于 Amazon。据称,一件被追踪的包裹到达 Amazon 设施后,工作人员在扫描前切除了书脊。Amazon 未就该计划的完整规模或扫描文本的用途作出公开回应。

工业扫描调查引发了书商的担忧,因为部分购入书目似乎较为稀缺。现有证据并不能证明每一位批量买家都故意瞄准独一无二或不可替代的副本。

不过,背后的动机很明确。大型 AI 开发商希望获得大量长篇人类写作内容。拆除书籍装订后,单页就能快速通过自动扫描设备。

Ibteda 面对的目标恰恰相反。其实体书籍是文化对象,而非承载训练文本的临时容器。该项目需要保留版式、手写内容、印刷痕迹,以及文字之外的其他证据。

这种差异影响每一项工程决策。破坏性扫描优先考虑速度、平整页面和干净的文本提取;档案成像则必须在可读性与材料保真度之间取得平衡。

Ibteda 还选择分发访问权限,而不是将扫描件锁在专有训练管线中。部分内容可通过 Rekhta 查看,相关材料也通过 Internet Archive collection 得到保存。

开放访问并不能解决所有版权或保管责任问题。数字化绝版材料可能涉及复杂的权利、隐私和所有权问题。社区档案仍需制定关于访问、下架、捐赠者预期和敏感记录的政策。

Ibteda 的工作流也不能证明每一本脆弱书籍都能安全承受玻璃压板。保护要求会因装订方式、纸张状况、墨水和历史价值而异。有些卷册需要专业书托、更低压力或专门的成像方式。

该系统的机器学习发现仍属于项目自行报告的结果。作者公开讨论这些成果时,代码和权重仍在接受档案审查。独立团队尚未在不同文字系统和馆藏中复现完整管线。

评估指标体现的是 Ibteda 自身的验收标准。其他档案馆可能会选择不同的边距、错误阈值,或对不可接受文本变化作出不同定义。

这些限制并未抹杀其贡献。它们界定了在其他人将该工作流视为可迁移的保护标准前必须完成的工作。

最有力的主张比 Google News 标题所暗示的范围更窄。Ibteda 找到了一种颇具前景的方法:从历史编辑中恢复监督信号,并将通用预测与逐书人工校准结合起来。

档案工作者和 AI 团队接下来应关注什么

该项目的价值如今取决于可复现性、跨馆藏测试,以及其保障措施能否经受日常使用的检验。

第一个信号是公开技术发布。团队已描述训练方案、标签恢复阈值、路由规则和复现契约。发布代码、权重、评估样本或经过审慎治理的数据集,将使其他人能够审查这些细节。

一项有价值的发布必须包含困难案例,而不仅仅是成功页面。研究人员需要看到书沟阴影、手写注释、密集的 Nastaliq、受损石版印刷品、印章、边框,以及自动化被拒绝的页面。

独立复现将强化该项目的核心发现。如果其他团队同样发现,少量本地修正优于无差别地扩大模型规模,这一结果可能影响众多专业文档系统。

即使无法复现,结果仍具有参考价值。这种改进可能依赖于 Ibteda 的采集设备、操作员一致性、书籍格式或特定验收指标。

第二个信号是在不同机构和文字系统之间进行测试。乌尔都语保护是该项目的核心应用场景,但波斯语、阿拉伯语、奥斯曼土耳其语和南亚手稿馆藏中也存在类似挑战。

跨馆藏试验不应只衡量裁切重叠度,还应考察丢失的变音符号、被改动的边注、错误页序、意外文本删除、操作员耗时、拒绝率以及审查失败案例的成本。

最有价值的基准测试应将可见几何结构与编辑偏好区分开来。这样的设计可以检验校准是否因捕捉到真正的卷册级模式而发挥作用,而非仅仅是在补偿某个数据集的特性。

第三个信号是运营层面的采用。有前景的模型不会自动清除积压任务。档案馆需要用于录入修正、审查不确定页面、追踪变换过程和恢复原件的界面。

操作员应能准确看到模型改动了什么。他们还需要不可变的源图像,以及每个衍生页面的记录参数。

Ibteda 将神经检测与受限重建分离,提供了一个有用的起点。它限制了改动可能发生的位置,并比不受限制的图像生成建立了更清晰的审计边界。

未来实验可能会测试基于扩散模型的修复,由生成式模型填补受损区域。这种方法能够生成视觉上可信的纸张效果,但档案团队需要保证获准蒙版之外不会发生改动。

因此,现实可行的标准应当鼓励系统弃权。系统必须能够表明某一页面存在歧义,需要人工处理。当高自动化率掩盖不可逆的文本错误时,其价值就会降低。

该项目也为 AI 产品团队提供了更广泛的启示。领域专业知识往往以真实工作中积累的修正、例外和偏好形式出现。将这些痕迹视为结构化反馈,可能比持续扩大模型更有效。

对档案工作者而言,下一步不是取代判断力,而是识别出十个审慎决策能够安全引导接下来一千页的环节。

对于通过 Google News 发现 Ibteda 的读者而言,相机数量是一个令人印象深刻的切入点。更持久的问题在于:在类似馆藏消失于难以访问的书架或私人训练数据集之前,机构是否会测试、资助并复现这一工作流。

寻找现有的 Ibteda 馆藏,将处理后的页面与其材料复杂性进行比较,并关注公开技术发布。如果另一家档案馆能够在保护每一处有意义痕迹的同时,复现从 0.71 到 0.83 的校准提升,那么这个小项目将带来一项更大型 AI 系统常常忽略的成果:能够适应人类判断、却不会抹去这种判断原本要保护之证据的自动化。

 
 

免费开始

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

你的 AI 工作伙伴

remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page