top of page

謎の大量書籍注文、AI学習をめぐる疑問を呼ぶ

Google Newsが注目すべき対立を浮き彫りにした。中古書籍の販売業者に、関連性のない書籍の注文が数百件単位で届いているものの、その背後にいる顧客は誰も特定されていない。英国とアイルランドの販売業者は、AI企業またはその委託先がデジタル化のために希少な書籍を買い集めているのではないかと疑っている。購入パターンは既知のAI向けデータ取得プロジェクトに似ているが、似ていることは証明ではない。

報告によると、注文は主題、言語、版、刊行日が異なる書籍にまたがっている。買い手は英国、カナダ、欧州大陸、米国にいる。販売業者が元の調査報道に語ったところでは、異なる名前を使いながら同じ地域に配送を指示した顧客もいたという。

この謎が重要なのは、Anthropicが以前、Claudeの開発に向けて数百万冊の書籍を購入し、裁断してスキャンしていたからだ。裁判記録は、紙の書籍を取得することが仮説上の戦略ではなかったことを明らかにした。また、AI開発企業が海賊版のデジタル図書館よりも購入済み書籍を選びたがる理由も示した。

したがって、中心的な争点は、書籍販売業者と特定されたテクノロジー企業との対立ではない。記録に残る購入行動と、不透明なサプライチェーンとの対比である。取引自体は実在する一方、その目的とされるものは未検証のままだ。

Google Newsが明らかにした書籍注文の実態

異例なのは単なる注文規模ではない。無関係なタイトルの組み合わせ、繰り返し現れる買い手、集中した配送パターンが重なっている点だ。

AlnwickにあるBarter Booksの共同経営者Stuart ManleyはGuardianに対し、8月の報道の約3カ月前から注文が届き始めたと語った。通常の大量注文には、交通、スポーツ、軍事史、地域研究といった分かりやすいテーマがあることが多い。

しかし、これらの注文は違った。報告されたリストの一つには、John le Carré『The Mission Song』のエストニア語訳、Anne Brontë『Agnes Grey』の特定版、そして雑誌Warshipの1983年10月号が含まれていた。唯一明白な共通点は、どの品も個別に目録化できることだった。

Manleyによれば、同社は3人の買い手に数百冊の本を販売した。選ばれた書籍には、読者層、主題、形式、想定される再販需要の面で関連性が見られなかった。この無作為性から、人間のキュレーターではなく機械がリストを作成したのではないかと考えるようになったという。

ClaregalwayにあるMW Booksの経営者Jim Shaughnessyも、5月に始まった類似のパターンを説明した。依頼には、18世紀のアフリカにおける農業用具に関する書籍から、1950年代のレーシングドライバーの伝記まで含まれていた。

こうした組み合わせは個人収集家にとっては珍しいだろう。一貫性のあるカタログを構築しようとする通常の再販業者にとっても非効率だ。しかし、買い手が大規模なデジタルコーパスの欠落を埋めようとしているなら、より筋が通る。

BookLovers of Bathの経営者David Gower-Spenceは、5月から7月にかけて注文が殺到したと報告した。約200冊が対象となり、一部の買い手は他の書籍販売業者の記録にも現れていたという。

匿名の販売業者の一人はGuardianに対し、別々の顧客名義が同じ住所に配送を指示することがあったと語った。同紙が調べた配送先郵便番号は、Heathrow Airport近くの貨物倉庫を示していた。

この詳細は集約作業を示唆するが、最終的な配送先を確定するものではない。貨物施設は再販業者、リサイクル業者、図書館、輸出業者、民間機関向けの配送を日常的に扱っている。AI委託先は複数ある可能性の一つにすぎない。

地理的な広がりは謎をさらに深める。オーストラリア、ドイツ、オランダ、英国、アイルランドの書籍販売業者が、同様に幅広い注文について語っている。中には、年代のあるマニュアル、地域史、特定の翻訳、絶版本が含まれていた。

通常の図書館による取得でも、風変わりなリストが生まれることはある。機関は包括的なコレクションの構築、欠落巻の補充、寄贈図書館の蔵書目録の購入を行う場合がある。中古書籍のリサイクル業者も在庫を一括購入し、その後に選別、再販、輸出、またはパルプ化を行う。

したがって最も強いシグナルは、複数の販売業者にまたがるパターンだ。最も弱い部分は帰属の特定である。Google Newsの集約によりGuardianの見出しは急速に広まったが、現時点で入手可能な証拠はAI研究所を特定していない。

この区別は、あらゆる結論の前提となるべきだ。この話が記録しているのは中古書籍への異例の需要である。その需要を誰が委託したのか、書籍がどう使われるのかは記録していない。

AI開発企業が希少な書籍を今なお求める理由

書籍には、オープンウェブのデータセットでは確実に代替できない、構造化され編集された、しばしば希少な言語が含まれている。

大規模言語モデルは、膨大なテキスト集から統計的な関係性を学習する。学習は検索可能な本棚を保存するような仕組みではないが、モデルが学習データで出会った文章を再現する場合がある。

開発企業が書籍を重視するのは、そこに継続的な論証、編集済みの文章、専門語彙、そして公のウェブに掲載されたことのない知識が含まれているためだ。古い地域史や技術マニュアルには、オンラインではほとんど扱われていない主題が記されている可能性がある。

希少な書籍は、特に魅力的かもしれない。オープンインターネットはますます反復的になっているからだ。検索最適化されたページは他ページを言い換え、低品質なサイトは参考資料をコピーし、AI生成テキストは新たなオンラインデータセットに入り込んでいる。

スキャンされた書籍は、よりクリーンな歴史的サンプルを提供できる。また、International Standard Book Number、すなわちISBNで特定されたカタログ上の欠落を正確に補うこともできる。ISBNは、特定の書籍版に割り当てられる一意の商業識別子だ。

買い手がすでに欠落ISBNのデータベースを持っていれば、自動購入は容易になる。ソフトウェアは対象リストをマーケットプレイスと照合し、入手可能な本を選び、集約施設へ配送できる。

この仕組みなら、販売業者が奇妙な組み合わせを目にする理由を説明できる。ソフトウェアはカタログ網羅性、状態、在庫の有無、送料に基づいて最適化する。2冊の本が人間に読めるテーマを共有しているかどうかは気にしない。

ページ構成、翻訳、挿絵、序文、補足資料は異なるため、特定の版が重要になることがある。包括的な収録を目指すデータベースは、同じタイトルの2つの版を別個の対象として扱う可能性がある。

この需要は、モデルに広範な言語パターンを教える初期工程であるモデル事前学習だけに限られない。デジタル化された書籍は、評価、検索システム、専門データセット、検索インデックス、追加学習の研究にも利用できる。

モデル開発企業が書籍を直接購入するとは限らない。データブローカー、スキャン業者、リサイクル業者、物流企業、データベース運営者が、書店と最終顧客の間に入る可能性がある。

この可能性が帰属の特定を難しくする。小売業者が目にするのはアカウント名と配送先だけかもしれない。直接の購入者でさえ、複数の業界にサービスを提供したり、複数のチャネルを通じて在庫を転売したりする可能性がある。

最も強い先例はAnthropicにある。公開された法廷提出書類は、同社が内部でProject Panamaとして知られる紙の書籍取得プロジェクトを実施していたことを示した。

裁判記録の調査によると、Anthropicは数百万冊の書籍を取得するために数千万ドルを費やした。作業員は背表紙を外し、ページをスキャンし、残った資材をリサイクルに回した。

社内の計画文書には、世界中のすべての書籍をスキャンするという目標が記されていた。この事業は、同社がすでに無許可のオンライン図書館から書籍を収集していた後、合法的に取得した紙の書籍を求めた。

この文書化されたプロジェクトにより、現在の疑念にはもっともらしさが生じる。しかし、Anthropicや他の特定の開発企業が、現在独立系販売業者に届いている注文を委託したことの証明にはならない。

他の買い手にも同じ機会が見える可能性がある。スキャン企業は希少な書籍を集約し、デジタルアクセス、メタデータ、または処理サービスを販売できる。リサイクル業者は、不要な在庫をパルプ化する前に価値あるタイトルを取り出すことができる。

したがってGoogle Newsの読者は、動機と身元を分けて考えるべきだ。AI開発企業には書籍を求める明確な理由がある一方、この特定の買い手の身元は依然として隠されている。

真の争点は、合法的な購入と透明な利用の対立だ

紙の本を購入することは企業の法的立場を強めうるが、著者がAI学習に同意したかどうかという問題には答えない。

Anthropicをめぐる訴訟は、書籍を入手することと、その内容を利用することの重要な違いを明らかにした。William Alsup連邦地裁判事は、同氏の前に示された事情において、書籍を使ったモデル学習は変容的フェアユースに該当し得ると判断した。

判事は、Anthropicが合法的に購入した書籍を、無許可のシャドーライブラリーから取得した数百万のファイルとは異なるものとして扱った。シャドーライブラリーは、権利者の許可なく著作権保護作品を配布する。

2025年6月の意見書は、Anthropicが購入済み書籍を中央ライブラリーとモデル学習のためにデジタル化できると認定した。しかし同社は、コレクションに保持していた海賊版コピーに関連する請求には引き続き直面していた。

Anthropicは後に、海賊版に関する疑惑を対象とする15億ドルの和解に合意した。この和解は、合法的に取得した素材での学習に関する裁判所のフェアユース認定を覆すものではなかった。

この区別は、紙の書籍を購入する直接的なインセンティブを生む。記録に残る取引は、海賊版サイトからの匿名ダウンロードよりも明確なプロベナンスを提供する。プロベナンスとは、素材がどこから来て、どのように取得されたかを記録するものだ。

紙の書籍を所有しても、著作権が自動的に移転するわけではない。小説を購入した人は、その冊子を読んだり、貸したり、転売したり、処分したりできる。しかし、無制限の複製権が与えられるわけではない。

それでも、米国法の下ではフェアユースによって一部の複製が認められる場合がある。裁判所は、目的、著作物の性質、利用された量、市場への影響を考慮する。AI学習をめぐる訴訟は、これらの要素がモデル開発にどう適用されるかを試している。

米国著作権局は、一律の答えに警鐘を鳴らしている。同局の学習に関する分析は、結果は原資料、利用目的、出力に関する保護措置、ライセンス市場への影響などの要因に左右されるとしている。

法的状況は国境をまたぐと変化する。英国またはアイルランドで始まった取引が、別の場所でのスキャン、別の国での保管、米国でのモデル学習を伴う可能性がある。

法域ごとに、テキスト・データマイニングに関する例外規定は異なる。契約条件、データベース権、著作権の存続期間、商業目的も分析をさらに複雑にしうる。

書籍販売業者にとって、目の前の判断はより単純だが、感情的には難しい。彼らは在庫を所有しており、一般に購入意思のある顧客へ販売できる。しかし、多くの人は自らを文化的資料の管理者とも考えている。

依頼された品が希少である場合、懸念はさらに強まる。ありふれたペーパーバックを1冊処分しても、公衆のアクセスに与える影響は小さい。だが、珍しい地域史や専門版を破棄すれば、流通から意味のある1冊を失わせる可能性がある。

「希少」という点にも慎重な扱いが必要だ。絶版であることは、必ずしも代替不能、貴重、あるいは唯一無二であることを意味しない。何千部ものコピーが個人コレクション、図書館、倉庫に残っている可能性がある。

逆に、金銭的には安価な書籍であっても、他では見つけにくい情報を保存していることがある。市場価格は、歴史的価値や研究価値を測る不完全な指標にすぎない。

そのため書店には相反するシグナルが届く。大量注文は滞留在庫を動かし、薄利な事業を支え得る。一方で同じ注文が、書店、コレクター、研究者が価値を見いだす作品の入手可能性を低下させることもある。

法的紛争の焦点は複製と学習にある。書店側の懸念は、保存に関する問いを加える。文化的に重要な資料を購入する際、買い手は破壊を伴うデジタル化について開示すべきなのだろうか。

その開示を求める一般的な規則は存在しない。すべての顧客に購入理由の説明を求めれば、プライバシーや事務処理上の問題も生じる。

より限定的なアプローチはあり得る。販売者は、署名本、アーカイブ資料、固有の書き込み、地域史、機関による所蔵が限られる版について、追加審査を行える。

それでも、より広い透明性の問題は解決しない。デジタル化された書籍から価値を得る企業は、書籍を供給する店舗から契約上いくつも隔たった位置にいる可能性がある。

証拠が立証していないこと

AIによる説明は既知の行動と整合するが、公開記録には疑念を帰属の判断へ進めるために必要な文書が欠けている。

名前が挙がったAI企業のうち、報じられた注文を委託したと認めた企業はない。Anthropic、OpenAI、Google、Meta、その他のモデル開発企業と買い手を結び付ける契約を、公表した書店もない。

また、英国またはアイルランドの店舗からスキャン施設まで書籍を追跡する公開の配送記録も存在しない。ヒースロー近郊の倉庫は、最終的な目的を知らないまま国際貨物を集約できる。

一部の販売者は、顧客の中にZoom Booksを特定している。このカナダ拠点の企業は自らを書籍リサイクラーと説明しており、複数国の販売者が同社に関連する注文について話し合っている。

リサイクラーの関与があっても、AIとのつながりを証明することにはならない。中古書籍企業は通常業務の一環として、すでに大量の書籍を購入、仕分け、再販、輸出、寄贈、断裁処理している。

削除されたマーケティング文言、不透明な別名、異例の購買パターンは、さらなる疑問を提起する根拠になり得る。しかし、それらはいずれも、誰が注文の資金を出したのか、配達後に何が起きたのかを単独で立証するものではない。

選定は、自動化された再販分析の結果である可能性もある。買い手が、価格差、機関需要、代替コピーの要望、輸出機会を求めてマーケットプレイスの出品をスキャンしているのかもしれない。

また、生成AIとは無関係な私設図書館やデジタル化プロジェクトを支えるものかもしれない。大学、系譜学サービス、保存団体、専門データベースはいずれも、入手困難な資料を求めている。

規模だけでは証拠として限定的だ。独立系販売者が200冊や500冊単位の急な注文に気付くのは、そうした注文が通常の出荷業務を混乱させ得るためだ。大規模な再販業者にとっては、同じ数量が日常的なものかもしれない。

時系列はより示唆的である。裁判文書がAnthropicの破壊を伴うスキャン事業を明らかにした後、報告は広まり始めた。この開示により、書店は見慣れない注文を解釈する具体的な枠組みを得た。

ただし、確認バイアスを生む可能性もある。あるAI企業が数百万冊の書籍をスキャンしたと販売者が知れば、不規則な注文はすべて同じ業界に結び付いて見えかねない。

これは懸念が的外れだという意味ではない。反復によって仮説を強化するのではなく、記録によって検証すべきだという意味である。

有用な検証の一つは、販売者間で買い手リストを比較することだ。共通する決済処理業者、法人登記、電話番号、倉庫区画、転送アカウントから、一見異なる顧客が同じネットワークに属するかどうかが分かる可能性がある。

別の検証では、適切な同意と法的保護のもと、印を付けるなどして追跡可能にした出荷をたどる。その経路により、国内再販と国際的な集約を区別できる。

記者は通関申告書や企業の調達記録も調べられる。数百万冊を扱うスキャン業者には、施設、機器、労働力、廃棄物処理、物流能力が必要になる。

モデル開発企業は、自主的な開示により不確実性を減らせる。取得方針を公表し、主要なデータ供給者を特定し、保存措置を説明し、購入資料とライセンスを受けたコレクションを区別できる。

現在の不透明さは、どちらの側にも利益をもたらさない。書店は十分な情報に基づく判断を下せず、著者は潜在的な利用を評価できず、AI企業は購入目的が無関係であっても疑念にさらされる。

主要開発企業に対する近年の訴訟は、その不信を強めている。7月には、出版社がGoogleが許可なく著作権保護された書籍をGeminiの学習に利用したと非難した。主張にはなお争いがあるが、Gemini訴訟は、書籍の来歴が現在では重要な法的論点であることを示している。

この文脈は、Guardianの記事がGoogle Newsを通じて広く拡散した理由を説明する。可視化された小売パターンと、AIサプライチェーンの隠れた一部を結び付けているからだ。

ただし、責任ある結論は限定的なままであるべきだ。正体不明の買い手が、異例の書籍コレクションを購入している。AI学習は信頼できる説明ではあるが、確立された事実ではない。

新たな需要から圧力を受けるのは誰か

この注文は、書店を商業的な存続、文化的保存、追跡可能なデータを求めるAI業界の交差点に置いている。

独立系販売者にとって、動きの鈍い在庫を買ってくれる顧客は歓迎すべき存在かもしれない。棚に置かれたままの本はすべて、スペース、労力、目録作成の時間、運転資金を消費する。

急な注文は小規模事業者を圧倒する可能性もある。スタッフは各版を探し出し、状態を確認し、梱包し、出品情報の誤りを修正し、マーケットプレイス上の連絡を管理しなければならない。

別々のアカウントを通じて注文が届く場合、販売者は出荷作業が始まるまで、その合計規模に気付かないことがある。複数の荷物が最終的に転送倉庫へ集まる可能性がある。

マーケットプレイスは別の圧力に直面する。そのシステムは、個々の買い手と分散した在庫を結び付けるために設計された。自動化された不足補完プログラムは、こうしたプラットフォームを調達ネットワークへと変え得る。

プラットフォームは、顧客の詳細を公に明かさずとも、異例の注文クラスターを特定できる。複数のアカウントが同じ配送先を共有している場合や、同一組織に管理されているように見える場合には、販売者に警告できる。

こうした監視では、正当な大量購入を不正行為として扱わないようにしなければならない。図書館、学校、映画制作、インテリアデザイナー、輸出業者は、日常的に大規模または雑多な注文を行う。

出版社と著者は、より根本的な問題に直面する。中古販売は通常、新たな印税を生まないが、拡張可能な派生資産を生み出すこともない。

デジタル化はその構図を変える。購入した一冊が、繰り返しの学習実行、評価、商用モデルサービスで使用されるデータセットの一部になる可能性がある。

AI開発企業には、合法的な取得を文書化する圧力がかかっている。海賊版データセットは安価で包括的だが、訴訟により法的・評判上のコストを無視しにくくなっている。

物理的な書籍を購入することは、より防御しやすい経路を提供する。しかし同時に、物流コスト、スキャンエラー、重複検出、保管上の問題、破壊に対する監視も持ち込む。

図書館とアーカイブは、静かな対抗力となるかもしれない。市場からコピーが消えてもアクセスを保存できるが、その所蔵は普遍的でも恒久的に保証されるものでもない。

希少な地域資料は最も高いリスクを抱える。地域史の書籍は商業的需要が限られる一方で、系譜研究者、歴史家、地域の研究者にとって価値を保つことがある。

デジタル化は言葉を保存できても、物理的な文脈を破壊し得る。余白の書き込み、装丁、紙、献辞、挿入文書、印刷上の違いには、光学式文字認識が見落とす情報が含まれている場合がある。

買い手がすべての本を交換可能な学習素材として扱うとき、この違いは重要になる。テキストコーパスは抽出可能な言語を重視する一方、アーカイブは完全な物体とその歴史を重視する。

すべての書籍破壊を受け入れられないと宣言しても、この対立は解決しない。図書館は重複本を除籍し、出版社は売れ残り在庫を断裁し、リサイクラーは毎日損傷した冊子を処理している。

欠けているのは、十分な情報に基づく選別だ。ISBNの網羅性を最適化する大量購入者は、破壊を伴うスキャンの前にどのコピーを保存すべきか認識できない可能性がある。

書店はそうした事例の特定を支援できるが、責任を単独で負うことはできない。誰かが各冊を実際に確認するまで、書店の目録には来歴、書き込み、版に特有の特徴が記載されていない場合がある。

業界標準では、スキャン業者に署名本、固有の原稿、書き込み、希少版の選別を求めることができる。価値ある発見物は、非破壊スキャンまたはアーカイブへの収蔵へ回すことができる。

AI企業は保存用コピーに資金を提供することもできる。プロジェクトが取得した一冊を破壊する場合、別のコピーの寄託、またはアクセス可能な機関への高品質なデジタル代替物の収蔵を支援できる。

こうした保護措置は著作権紛争を解決するものではない。データ取得競争が、珍しい物理的記録をひそかに取り除くことを防ぐという別の懸念に対処するものだ。

ナレッジワーカーにとって、この出来事は、デジタルな回答にもサプライチェーンがあることを思い起こさせる。チャットボットの応答は、ユーザーの目に触れない著者、編集者、販売者、スキャン担当者、目録作成者、物流担当者に間接的に依拠している可能性がある。

出典文書と来歴をパーソナルナレッジベース内に保管することは、実践的な対応策の一つになる。これによりユーザーは、モデルの流暢な回答と、自ら検証できる証拠とを区別できる。

AI説を裏付け、または弱める三つのシグナル

次の段階では、買い手の身元、出荷先、破壊を伴うスキャンの証拠に焦点を当てるべきだ。

第一のシグナルは、確認済みの契約上のつながりである。買い手とAI開発企業を結び付ける請求書、調達契約、支払い記録、供給業者の確認があれば、この説は大幅に強まる。

スキャン業者とのつながりも重要になる。特にその業者が、モデル開発企業向けにデータセットやデジタル化サービスを売り込んでいる場合はなおさらだ。それでも、報じられた書籍がAIプロジェクトに入ったことを示す証拠は必要になる。

調査の結果、購入が通常の再販、リサイクル、私設図書館の顧客につながるなら、中心的な主張は弱まるだろう。その奇妙な選定パターンは、モデル学習ではなく自動化された商取引を反映している可能性がある。

第二のシグナルは、書籍が物理的にたどった経路である。出荷が貨物倉庫に到着しても、調査者が次の目的地を特定できなければ、読者にはほとんど意味がない。

産業用スキャン拠点、データ請負業者、破壊を伴うデジタル化施設への繰り返しの出荷は、書店側の疑念を支持する。一方、再販倉庫への繰り返しの出荷は別の方向を示す。

通関記録、倉庫の賃借データ、物流文書は、その経路の確立に役立つ。販売者は業界団体を通じて、配送の詳細を非公開で比較することもできる。

第三のシグナルは、AI企業または仲介者からの開示である。開発企業は、現在中古書籍を購入しているか、どの業者を利用しているか、スキャンで原本を破壊するかを明らかにできる。

否定する場合も、評価可能なほど具体的であるべきだ。企業が適用法を順守していると述べるだけでは、請負業者がその企業のために書籍を購入・スキャンしているかどうかには答えていない。

新たな裁判書類にも注目すべきだ。著作権訴訟は、企業がそれまで公に議論してこなかった内部の取得慣行を繰り返し明らかにしてきた。

Anthropicの文書は、古書を物理的に取得し、裁断、スキャン、デジタル化したうえで、大規模にリサイクルしていた一連の仕組みを明らかにしたことで、販売者による大量注文の解釈を変えた。

他社に関する同様の記録が見つかれば、中古市場がAI向けデータ調達のインフラとなっているという、より大きな結論を裏付けることになる。

一方で、そうした記録がないからといって、逆のことが証明されるわけではない。非公開契約は表に出ないままの場合があり、仲介業者が最終顧客を覆い隠すこともある。それでも、証拠は最終的にパターン照合を超えて前進しなければならない。

Google News経由でこの報道に触れた読者は、この二つの現実をともに念頭に置くべきだ。AI企業が書籍に強い関心を示してきたこと、そしてある大手開発企業が膨大な規模で破壊的スキャンを実施したことは、すでに示されている。

同時に、現在の英国およびアイルランドでの注文については、依然として発注元が特定されていない。販売者が記録しているのは異例の行動であり、最終購入者の身元や目的ではない。

この検証上の隔たりこそが、この報道で最も重要な特徴だ。デジタルモデルを支える物理的なサプライチェーンの透明性が、いかに乏しいかを浮き彫りにしている。

今後数か月は、共有される購入者記録、追跡可能な貨物の配送先、そして調達に関する開示に注目したい。これらのシグナルが、これがAIの取得ネットワークなのか、それとも世界の中古書籍取引における異例の循環なのかを判断することになる。

それまでは、この大量注文を解決済みの案件ではなく、信頼できる手がかりとして扱うべきだ。一次資料を保全し、物流を追跡し、物理的な書籍が見えない学習データへと変わるとき、誰が利益を得るのかを問う必要がある。

 
 

無料で始めましょう

ローカルファーストのパーソナル知識管理付きAIアシスタント

より良いAI体験のために、

remio は現在、 Windows 10+ (x64)M-Chip Mac のみをサポートしています。

脳内に検索バーを追加

ただremioに尋ねるだけ

すべてを思い出す

何も整理しない

bottom of page