top of page

Ibteda Digital Libraryは1,800冊の希少本を保存したが、大規模AIを上回ったのは10件の人間による修正だった

8月31日
読了時間: 18分

Ibteda Digital Libraryは、希少なウルドゥー語書籍を保存するため、パキスタンの3人の友人が2台の低価格Nikonカメラで約90万2,000回シャッターを切ったことでGoogle Newsに取り上げられた。プロジェクトの記録とその後の報道によると、10年にわたる取り組みで、見開きページを撮影した写真52万6,000枚が生み出された。

印象的なカメラのシャッター回数が、この話題を広く伝播させた。しかし、より重要な成果は、日々のデジタル化作業が止まった後にもたらされた。チームの一員が、長年にわたる手作業のPhotoshop編集を、ニューラルネットワークの訓練ラベルへ変換したのである。

この実験は、大規模モデルとデータ増量による改善を期待する業界にとって、気まずい結果を示した。訓練用書籍の追加、高解像度入力、ResNet-50バックボーンのいずれも、中心的なトリミング問題を解決できなかった。解決したのは、人間のオペレーターによる10件の修正だった。

したがって、このプロジェクトは並外れた粘り強さを持つスキャン作業以上の意味を持つ。文化保存では、大規模な商用AIシステムの前提をそのまま持ち込むことができない理由を示している。アーカイブは、一般的なモデルであればノイズと分類しかねない、珍しい印、欄外注記、句読点、物理的な欠損も保存しなければならない。

また、産業規模の書籍スキャン事業との対照も際立つ。近年の調査報道では、AI訓練のために印刷本を購入し、破壊的にスキャンする企業があるとされる。Ibtedaはゆっくり作業し、物理的な書籍を保存し、完成したコレクションの少なくとも一部を読者に公開した。

Google Newsの見出しを支える数字

カメラの回数は持久力の物語を伝えるが、未処理キューこそが、Ibtedaが方針転換を迫られた理由を説明する。

Ibtedaは、創設者たちがGhalibのDiwanの歴史的版を調査していた2015年ごろに始まった。彼らは、絶版になった重要な書籍、大学コレクションで利用できない書籍、個人所蔵の書籍を見つけるのに苦労した。

チームは、パキスタンに独自のアーカイブを築くことで対応した。制度的なデジタル化ラボも、商用スキャン業者も、専用機材の予算もなかった。装置は平らなテーブル、安価なPhilips LEDライト、書籍の上に設置したカメラ、コピー機から回収したガラスで始まった。

1回のシャッターで、向かい合う2ページを同時に撮影した。この方法は撮影を高速化したが、各画像にはテーブル面、ページ端、綴じ目の影、不均一な余白、染み、手書きの追加内容も含まれていた。

Nikon D5300は最終的に約57万6,000回のシャッター作動回数に達した。D3300は約32万6,000回を加え、一般に報じられる合計は約90万2,000回となった。これらの数値は、公開ページ数だけからの推計ではなく、カメラに関連付けられたシャッターデータに基づく。

チームは見開きページを約52万6,000枚撮影した。見開きには向かい合う2ページが含まれるため、この数を52万6,000冊の完成書籍、あるいは52万6,000個の完成ページファイルとみなすことはできない。撮影は最初の段階にすぎなかった。

プロジェクトのより詳細な記録によれば、オペレーターは1,765冊にわたり、個別ページのトリミング57万5,729件を完了した。この完成作業が、後の機械学習実験の基盤となった。

一部の報道ではコレクションを1,800冊と丸めている一方、現在のライブラリー説明では、より広範な取り組みを通じて構築されたはるかに大きなカタログに言及している。これらの数値は、処理済みの冊子、撮影済み資料、カタログ所蔵、提携先で公開された選集という、異なる対象を表している。

たとえば、Rekhta collectionは、Ibtedaが2016年に始まったとし、5,000冊・300万ページを超えるカタログを説明している。Rekhtaは現在、この広範なコレクションの中から選ばれた一部を公開しており、すべての未処理または処理済み写真を掲載しているわけではない。

この区別は重要である。拡散した見出しは、撮影されたすべての見開きが完全に変換されたかのような印象を与えかねない。実際には、処理負担は、チームが日常業務を維持できる期間を超えて残った。

報道によれば、Ibtedaは約10年を経て2026年4月に通常業務を縮小した。グループは相当量のウルドゥー語文学を保存することに成功したが、撮影済みの見開き数十万枚には、なお慎重な処理が必要だった。

チームのカメラは、即席のコミュニティ運営として想定される作業量をはるかに超えて稼働した。より希少な資源となったのは、人間の注意力だった。

書籍の撮影は簡単な部分だった

Ibtedaのボトルネックは写真撮影ではなかった。不規則な歴史資料のページを、アーカイブが信頼できるファイルへ変換することだった。

各露光後、オペレーターは写真をPhotoshopで開いた。向かい合うページを分離し、傾きを補正し、適切な境界を選び、染みやその他の視覚的干渉を処理した。

これは通常の一括トリミングではなかった。多くの冊子は、ウルドゥー語やペルシア語の文学的伝統と広く結び付く、流麗な書体であるナスタアリーク体を使用していた。その点、斜めの形状、密集した記号、ダイアクリティカルマークは、自動クリーンアップを複雑にする。

小さな黒い斑点は汚れかもしれない。しかし、文字を変える意味のある点である可能性もある。端近くの線は、偶発的な影、印刷された罫線、あるいは保存すべき手書き注記かもしれない。

石版印刷はさらに多様性を加えた。ページには、不規則な刷り、経年した紙、歪んだ形状、深い綴じ目の影、欄外の書き込み、表、装飾要素が含まれ得る。どの冊子にも正しいトリミングを表す単一の長方形は存在しなかった。

オペレーターは美的・編集上の判断も行った。狭い余白が最適な書籍もあれば、注記、綴じの痕跡、珍しい印刷罫線を残すために、より広い周辺空間が必要な書籍もあった。

こうした選択は隠れた変数を生んだ。望ましい余白は、常にピクセルから読み取れるわけではない。同じページを見ても、有能なアーキビスト2人が、わずかに異なるものの、どちらも許容できる境界を選ぶ場合がある。

この問題は、アーカイブ処理を多くの商用画像処理タスクから分ける。ショッピングアプリケーションは、軽微な視覚的正規化を許容できる。保存システムは、欠損に見えるというだけで印を安易に削除できない。

Ibtedaのアーカイブは、将来の検証も支える必要があった。報道によれば、ワークフローは、チェックサムなどの整合性機能を使用するストレージシステムであるZFSプールに完成資料を保存した。BLAKE3マニフェストは、後から生じたファイル変更を検出できる暗号学的フィンガープリントを記録した。

この追跡可能性の重視は重要である。見た目がきれいなページが、自動的に信頼できるアーカイブ資料になるわけではない。研究者は、ソフトウェアが元資料を密かに書き換えていないことを知る必要がある。

同じ原則は、現代のknowledge managementにも当てはまる。検索と自動化が価値を生むのは、人々が情報を安定し理解可能なソース資料まで追跡できる場合に限られる。

Ibtedaにとって、自動化で節約される1時間には、それに対応するリスクが伴った。1つの染みを正しく消しても、別の場所でウルドゥー語の記号を1つ削除するモデルは、恒久的なテキスト上の誤りを招きかねない。

そのためプロジェクトに必要だったのは、単なる画像強調モデル以上のものだった。変更を提案すべき時、元のピクセルを保存すべき時、そしてページを人に戻すべき時を判断できる保守的なシステムが求められた。

この要件が、チームをトリミングとレタッチで別々のモデルおよび処理規則へと導いた。また、長年にわたるPhotoshop作業が貴重な訓練データになった理由も説明している。

10年分のPhotoshop編集が訓練データになった

チームにとって最も再利用可能な資産はカメラ機材ではなかった。通常の制作作業で行われた57万5,729件の人間による判断の記録だった。

完成したPhotoshopページの一つひとつには、ページの開始・終了位置に関する選択が埋め込まれていた。ただし、これらの判断は当初、機械学習にそのまま使える構造化ラベルとして存在していたわけではない。

チームは、完成ページを元の写真へ結び付ける必要があった。公開された技術的説明では、この復元工程でSIFTとMAGSACを使ったとされる。

SIFT、すなわちScale-Invariant Feature Transformは、拡大縮小や回転の後でも照合できる特徴的な視覚特徴を特定する。MAGSACは、画像の幾何学的関係を当てはめる際に、誤った一致を除外する堅牢な推定手法である。

これらの手法により、プロジェクトは完成ページが生のカメラ画像とどのように対応するかを推定できた。保守的な採用規則により、疑わしい一致は、すべてのファイルを無理にデータセットへ入れるのではなく除外された。

得られた幾何学情報は、トリミング予測モデルの教師データとなった。実務的には、チームは長年の人間による編集を、オペレーターがページ境界をどこに置いたかを示す例へ変換したのである。

これは、他の小規模アーカイブにも有用なパターンである。組織は正式にラベル付けされたAIデータセットを持たなくても、何年にもわたる編集、修正、承認、制作物を保有している場合がある。こうした記録は、汎用的な画像コレクションより多くの有用な領域知識を含み得る。

ただし、過去のワークフローデータが自動的に信頼できるわけではない。オペレーターごとの一貫しない選好、基準の変化、重複ファイル、失敗した編集、記録されていない例外が含まれることがある。

Ibtedaのケースは、とりわけ困難だった。一部の不一致は正当な判断を表していたからである。ある冊子では狭いトリミングが正しくても、同じ余白が別の冊子では損傷につながる場合がある。

トリミングモデルは、それでも可視的な構造を学習した。ページの境界、綴じ目、周囲のテーブル空間を推定できた。しかしチームは、残る誤差が各書籍内でほぼ一定であることを発見した。

このパターンは示唆的だった。モデルは単にページ検出に失敗していたのではない。特定の冊子について、オペレーターが好む内側の余白を見逃していたのである。

技術的な議論で、プロジェクト著者は、訓練対象を378冊から572冊へ拡大しても、未知の冊子に対する性能は改善しなかったと述べた。ResNet-50モデルは訓練データへの適合度を高めたものの、ホールドアウト資料では横ばいだった。

入力解像度を1,024ピクセルへ上げても、期待された改善は得られなかった。空間予測ヘッドも問題を解決しなかった。

これらの否定的な結果は、よくあるAI開発の反射的な対応に疑問を投げかけるため重要である。性能が停滞すると、チームはデータ、計算資源、解像度、またはモデル規模を追加しがちだ。

この戦略が有効なのは、欠けている信号が訓練入力のどこかに存在する場合である。Ibtedaの実験は、決定的な選好が新しい冊子のピクセルには現れていなかったことを示唆する。

より大規模なバックボーンでも、画像に含まれない情報を確実に推論することはできない。このシステムには、少量の新たな人間の文脈が必要だった。

10件の修正がより大規模なニューラルネットワークを上回った

Ibtedaは、より大きなネットワークに見えない選好を推測させるのではなく、各書籍に合わせてトリミングモデルを較正することで改善した。

新しい冊子では、オペレーターが予測されたトリミング10件を修正した。システムは、それらの修正を元の予測と比較し、中央値残差、つまり機械出力と人間の選好の間にある典型的なずれを計算した。

その後、この調整を冊子内の残りのページに適用した。同じ冊子のページは、通常、用紙寸法、印刷スタイル、綴じの形状、そしてオペレーターが望む余白を共有している。

プロジェクトによると、このキャリブレーションにより、ホールドアウトしたボリュームにおけるpass@80の値は0.71から0.83へ上昇した。Pass@80は、ページの少なくとも80%がプロジェクトの受け入れ基準を満たした書籍の割合を表す。

この向上は、より大規模なモデルではなく、オペレーターによる10件の修正によってもたらされた。これは、人が限定的な例を提供し、特定のバッチを通じてシステムを導く、実用的なヒューマン・イン・ザ・ループ自動化を支持する結果だ。

その仕組みは、汎用ビジョンモデルと比べれば控えめだ。だからこそ、このタスクに適している。モデルが直接観測できない、書籍単位で安定したバイアスを対象としている。

このシステムはアーキビストを不要にするものではない。アーキビストの注意をボリュームの冒頭に集中させ、その判断を後続ページへ一貫して適用する。

このアプローチは、失敗時のコストも抑える。キャリブレーションに問題があるようなら、オペレーターはそのボリュームの処理を止められる。完全自律型のシステムでは、誰かが気付くまでに、同じ微妙なトリミングミスを数百ページにわたって繰り返すおそれがある。

この結果が示唆する範囲は書籍にとどまらない。多くの文書ワークフローには、顧客、プロジェクト、コレクション、機器、報告期間に結び付いた選好が含まれる。そうした選好は、生のコンテンツにはしばしば現れない。

汎用モデルは可視的な構造を識別できる一方、少数の修正によってローカルな方針を与えられる。この組み合わせは、相容れない選好をまたいで訓練された、より大規模なモデルを上回る可能性がある。

Ibtedaのレタッチ作業も、同様に保守的な思想に基づいていた。ピクセル単位の画像セグメンテーション向けに設計されたニューラルアーキテクチャであるU-Netが、しみ、スタンプ、不要な痕跡を含む候補領域を特定した。

モデルが担ったのは検出のみだ。従来型のOpenCVルーチンが承認済みマスク内の紙の質感を再構成し、その領域外のピクセルは変更されなかった。

訓練ラベルにはREMOVE、KEEP、IGNOREの3状態を使用した。REMOVEは安全に消去できると見なされた痕跡を示す。KEEPはノイズに似ているものの文書の一部であるコンテンツを保護する。IGNOREは曖昧な領域を訓練から除外する。

プロジェクトの著者は、より厳格なラベリングによって、痕跡のintersection-over-unionが0.56から0.60に上昇したと報告した。Intersection-over-unionは、予測領域と人手でラベル付けされた対象領域との重なりを測る指標だ。

さらに重要なのは、評価対象の資料では、より厳格なプロセスによってウルドゥー語のダイアクリティカルマークの誤削除がゼロになったと報告されている点だ。チームは、モデルの平均スコアにかかわらず、ダイアクリティカルマークが1つでも消去されればデプロイ中止の理由とみなした。

このルールは、保存における中心的な原則を捉えている。高い集計指標は、意味のあるテキストの削除を正当化できない。文化的に重要な1件の失敗は、正しくクリーニングされた数千ピクセルよりも重大になり得る。

この保存モデルは破壊的スキャンに異議を唱える

IbtedaはAIを用いてアーカイブの寿命を延ばした。一方、産業的なスキャンプログラムは、可能な限り迅速にテキストを取得することを最適化している場合が多い。

この対照は2026年8月にいっそう鮮明になった。調査報道によれば、テクノロジー企業は物理的な書籍を購入し、製本を外してページをスキャンした後、残りを廃棄していた。

裁判記録では以前、Anthropicが社内研究ライブラリを構築する過程で数百万冊の書籍を購入し、破壊的にスキャンしていたことが示された。Anthropicは、自社の取得プログラムは希少本や古書を対象としていなかったと述べている。

より最近の報道はAmazonに焦点を当てた。追跡された荷物はAmazonの施設に到着し、そこで作業員が書籍の背表紙を切断してからスキャンしたと報じられている。Amazonは、プログラムの全体規模やスキャン済みテキストの利用方法について公に回答していない。

産業的スキャンに関する調査は、一部の購入タイトルが入手困難に見えたことから、書店関係者の懸念を呼んだ。この証拠だけでは、すべての大量購入者が意図的に唯一無二または代替不可能な書籍を狙っていることは立証されない。

それでも、その根底にある動機は明白だ。大手AI開発企業は、大量の長文の人間による文章を求めている。書籍の製本を外せば、個々のページを自動スキャナーに素早く通せる。

Ibtedaが向き合った目的は正反対だった。その物理的な書籍は、訓練用テキストを包む一時的な容器ではなく、文化的な資料だった。プロジェクトには、レイアウト、手書き、印刷上の痕跡、そして言葉以外の証拠を保存する必要があった。

この違いは、あらゆるエンジニアリング上の判断に影響する。破壊的スキャンでは、速度、平坦なページ、そしてクリーンなテキスト抽出が優先される。アーカイブ用イメージングでは、可読性と資料としての忠実性のバランスが求められる。

Ibtedaはまた、スキャンを独自の訓練パイプライン内に閉じ込めるのではなく、アクセスを分配した。一部の資料はRekhtaで閲覧でき、関連資料はInternet Archive collectionを通じて保存されている。

オープンアクセスは、著作権や管理責任に関するすべての問題を解決するものではない。絶版資料のデジタル化には、複雑な権利、プライバシー、所有権の問題が伴い得る。コミュニティアーカイブには、アクセス、削除要請、寄贈者の期待、機微な記録を規定する方針がなお必要だ。

また、Ibtedaのワークフローは、壊れやすいすべての書籍がガラス製プラテンに安全に耐えられることを証明するものでもない。保存の要件は、製本、紙の状態、インク、歴史的価値によって異なる。一部のボリュームには、専門的なクレードル、より低い圧力、または特殊な撮影が必要となる。

システムの機械学習に関する知見も、プロジェクトが報告した結果にとどまる。著者が公に説明した時点で、コードと重みはなおアーカイブレビュー中だった。独立したチームは、異なる文字体系やコレクションをまたいでパイプライン全体をまだ再現していない。

評価指標はIbteda独自の受け入れ基準を反映している。別のアーカイブであれば、異なる余白、エラー閾値、または許容できないテキスト変更の定義を選ぶかもしれない。

こうした制約は貢献を損なうものではない。ほかの組織がこのワークフローを移植可能な保存標準として扱う前に、何が必要かを定めるものだ。

最も強い主張は、Google Newsの見出しよりも限定的だ。Ibtedaは、歴史的な編集から教師情報を回復し、汎用的な予測と書籍ごとの人手によるキャリブレーションを組み合わせる有望な方法を見いだした。

アーキビストとAIチームが次に注目すべきこと

このプロジェクトの価値は今後、再現可能性、コレクション横断の検証、そして安全策が日常的な運用に耐えられることを示す証拠にかかっている。

最初のシグナルは、技術情報の公開だ。チームは、訓練レシピ、ラベル回復の閾値、振り分けルール、再現契約について説明している。コード、重み、評価サンプル、または慎重に管理されたデータセットを公開すれば、ほかの人々がその詳細を検証できるようになる。

有用な公開には、成功したページだけでなく難しい例も含めなければならない。研究者には、のど元の影、手書きの注記、密度の高いナスタアリーク体、損傷したリトグラフ、スタンプ、枠線、そして自動化が却下されたページが必要だ。

独立した再現は、プロジェクトの中心的な発見を強化するだろう。ほかのチームも、無差別なモデルのスケーリングより少数のローカル修正が優れると見いだせば、この結果は多くの専門的文書システムに影響を与える可能性がある。

再現できなかったとしても、有益な情報となる。この改善は、Ibtedaの撮影装置、オペレーターの一貫性、書籍の形式、あるいは特定の受け入れ指標に依存している可能性がある。

2つ目のシグナルは、機関や文字体系をまたぐ検証だ。ウルドゥー語の保存はプロジェクトの中核的なユースケースだが、関連する課題はペルシア語、アラビア語、オスマン・トルコ語、南アジアの写本コレクションにも見られる。

コレクション横断の試験では、トリミングの重なりだけでなく、失われたダイアクリティカルマーク、改変された欄外注、誤ったページ順、テキストの偶発的な削除、オペレーターの時間、却下率、失敗のレビューコストを検討すべきだ。

最も価値のあるベンチマークは、可視的な幾何学と編集上の選好を分離するものになるだろう。その設計により、キャリブレーションがあるデータセットの癖を補償しているのではなく、真にボリューム単位のパターンを捉えて機能しているかを検証できる。

3つ目のシグナルは、運用での採用だ。有望なモデルであっても、バックログを自動的に解消するわけではない。アーカイブには、修正を入力し、不確実なページを確認し、変換を追跡し、原本を復元するためのインターフェースが必要だ。

オペレーターは、モデルが何を変更したのかを正確に確認できるべきだ。また、すべての派生ページについて、変更不能なソース画像と記録済みのパラメーターも必要になる。

Ibtedaが採用した、ニューラル検出と制約付き再構成の分離は、有用な出発点を提供する。変更可能な場所を制限し、制約のない画像生成よりも明確な監査境界を作り出す。

今後の実験では、生成モデルが損傷領域を補完する拡散ベースの復元を試すかもしれない。このアプローチは視覚的に説得力のある紙面を作り出せるが、アーカイブチームには、承認済みマスクの外側が変更されない保証が必要となる。

したがって、現実的な標準は棄権も評価すべきだ。システムは、あるページが曖昧で人の判断を要すると伝えられなければならない。不可逆的なテキストエラーを隠す高い自動化率には、価値が低い。

このプロジェクトはAIプロダクトチームに、より広い教訓も与える。ドメインの専門知識は、実務の中で蓄積される修正、例外、選好として現れることが多い。そうした痕跡を構造化されたフィードバックとして扱うことは、モデルを継続的に大型化するより効果的になり得る。

アーキビストにとって次の段階は、判断を置き換えることではない。10件の慎重な判断が、次の1,000ページを安全に導ける場所を特定することだ。

Google Newsを通じてIbtedaを知った読者にとって、カメラ台数は印象的な入口になる。長期的に重要なのは、同様のコレクションがアクセス不能な棚や非公開の訓練データセットへ消えていく前に、機関がこのワークフローを検証し、資金を提供し、再現するかどうかだ。

利用可能なIbtedaコレクションを探し、処理済みのページをその資料としての複雑さと比較し、技術情報の公開に注目してほしい。別のアーカイブが、意味のあるすべての痕跡を守りながら0.71から0.83へのキャリブレーション改善を再現できれば、この小さなプロジェクトは、大規模AIシステムがしばしば見落とすものを実現したことになる。すなわち、保存すべき証拠を消去せずに、人間の判断へ適応する自動化だ。

 
 

無料で始めましょう

ローカルファーストのパーソナル知識管理付きAIアシスタント

より良いAI体験のために、

remio は現在、 Windows 10+ (x64)M-Chip Mac のみをサポートしています。

仕事のAIパートナー
remioでもっと仕事が進む

計画・作成・仕上げまで
すべてをひとつに

bottom of page