top of page

Anthropicの「書籍破壊」主張は事実、ただし希少本の話は未証明

Anthropicは数百万冊の紙の書籍を購入し、裁断を伴うスキャンを行った。この慣行は現在、AI企業が希少本を消し去っていると警鐘を鳴らすGoogle Newsの見出しを生んでいる。記録で確認されている作業には、製本の除去、ページのスキャン、その後の紙の廃棄が含まれる。ただし、現時点で得られる最も強力な証拠でも、Anthropicが希少本や唯一無二の書籍を標的にしたことは立証していない。

この区別によって、物語は変わる。確認済みの事実が示すのは、合法的に購入した書籍を非公開のAI学習データへと変換する産業規模の取り組みだ。一方で、より広く拡散された主張には、名指しされない複数企業や、文化的に代替不可能な版の破棄など、未証明の要素がいくつも含まれている。

この論争は、より深い対立も浮き彫りにしている。AI開発企業は整然と編集された人間の文章を求め、著者や保存活動家は報酬、アクセス、保護策を求めている。Anthropicの解決策は、購入した各冊を破棄することで一つの法的リスクを抑えたが、まったく別の文化的・倫理的問題を生み出した。

Anthropicが実際に購入し、スキャンし、破棄したもの

中心的な主張はAnthropicについてはおおむね事実だが、最も刺激的な希少本に関する詳細は依然として裏付けられていない。

2025年6月の連邦裁判所の判断は、基本的な一連の流れを認定した。Anthropicは数百万冊の紙の書籍を購入し、それぞれをデジタルファイルに変換したうえで、現物を廃棄した。同社はそれらのファイルを社内の研究ライブラリーに保管していた。

この手法は破壊的スキャンと呼ばれる。委託業者が本の製本を外す、または背を切り落とし、高速の業務用スキャナーに通せるばらばらのページにする。スキャン速度を高める代償として、物理的な本そのものを犠牲にする方法だ。

生成されたファイルには、ページ画像と機械可読なテキストが含まれていた。光学文字認識(OCR)は、撮影した文字をコンピューターが検索・処理できる文字データに変換する。Anthropicはその後、このテキストをモデル開発用に整備できた。

William Alsup判事は、この作業をフェアユースに関する命令で説明した。判断によると、Anthropicは数百万冊の紙の本を取得するために数千万ドルを費やしており、その多くは中古本だった。

命令では、紙の本1冊からデジタルコピー1点が作られたとも述べられている。Anthropicは両方の版を保持せず、デジタルライブラリーを一般公開もしなかった。変換の完了後、紙は廃棄された。

この一対一の置き換えは、法的に重要だった。Alsup判事はこの形式変更を、省スペースのデジタルコピーで物理的な図書館所蔵品を置き換える行為になぞらえた。裁判所に示された具体的な事情の下では、社内での変換はフェアユースに当たると判断した。

裁判所は、AIによるあらゆる書籍スキャンが合法だと宣言したわけではない。判断の対象となったのは、Anthropicが購入したコピー、非公開の保管、そして破壊を伴う置き換えである。配布、海賊版、追加コピーには別の問題が生じる。

Anthropicのプロジェクトは、大規模なデジタル書籍コレクションを入手しようとした初期の試みの後に始まった。同社は2024年2月にTom Turveyを採用した。Turveyは以前、Googleの書籍デジタル化プログラムにおける提携業務に携わっていた。

Turveyは、Anthropicが書籍を大量に調達し、産業規模のスキャンを手配するのを支援した。その後に機密解除された記録に基づく報道では、この取り組みはProject Panamaと特定された。社内文書には、世界中の書籍の非常に広範な部分をスキャンするという野心が記されていた。

Project Panamaの記録は、委託業者、大量発注、油圧式の裁断装置、高速スキャナーを明らかにした。あるベンダーの提案は、6カ月間に50万冊から200万冊を扱う内容だった。

最終的な冊数は、公開されたプロジェクト資料ではなお黒塗りになっている。それでも裁判所自身が、Anthropicの購入とスキャンを説明する際に「数百万冊」と表現した。したがって、全体的な規模はソーシャルメディア上の憶測ではない。

廃棄された紙は、このプロジェクトの成果物ではなかった。価値ある出力は、計算処理用に整備された、組織化されたテキストの集合を意味する、非公開で検索可能なコーパスだった。そのコーパスは研究やモデル学習を支援し得る。

これが、Google Newsの主張の土台にある検証済みの事実だ。Anthropicはデジタル化の過程で、実際に数百万冊の紙の書籍を購入し、破棄した。残る問いは、どのタイトルが含まれていたのか、そして他社も同じ道をたどったのかである。

AIラボがオンラインに存在しなかった書籍を欲しがる理由

書籍は、合成コンテンツが増え続けるオープンウェブでは見つけにくい、編集された人間の言語をAI開発企業にもたらす。

大規模言語モデルは、膨大なテキスト集合から統計的なパターンを学ぶ。開発者は、一貫した論証、持続的な物語、専門用語、注意深く編集された文章を含む多様な資料を求める。書籍は、多数の分野にわたってそれらの性質を兼ね備えている。

ウェブページも有用な資料を提供し得る。しかしオンラインのテキストには、広告、複製コンテンツ、検索エンジン向けの水増し文章、壊れた書式、機械生成コンテンツが含まれる。その出所を確定することはしばしば難しい。

紙の書籍には別の利点もある。近年の生成AIブーム以前に出版された物理的な版は、明らかに人間の時代の資料だ。開発者は、元の段落をチャットボットが生成したかどうかを推測する必要がない。

この懸念は、ときにモデル崩壊や合成データ汚染と呼ばれる。これらの用語は異なる問題を指すが、いずれも、先行するモデルが作った出力からモデルが学習することに関係している。繰り返し再利用されれば、誤りが増幅され、多様性が失われる可能性がある。

書籍には、通常のウェブクローリングには含まれない資料もある。学術モノグラフ、地域史、技術マニュアル、翻訳文学、古いノンフィクションは、検索可能な形でオンラインにほとんど存在しないことがある。オンライン上の希少性は、物理的なコピーをデータ源として魅力的にする。

オンラインで見つかりにくいことは、古書の意味で希少だということではない。絶版になった教科書はデジタルでは探しにくくても、数千冊の中古本が流通している場合がある。知名度の低いタイトルでも、安全に破棄できるほど一般的であることがある。

この区別はソーシャルメディアの投稿で曖昧になっている。「希少」は、高価、文化的に重要、ほかでは入手できない、あるいは単に見慣れないという意味になり得る。これらの意味を同一視することはできない。

Anthropicは、大手の中古書店や流通業者から書籍を購入したと報じられている。大量購入では、販売者が既存の仕組みを通じて特定、価格設定、発送できる一般的なコピーが選ばれやすい。これは、写本や唯一の書き込みがある版を慎重に取得する行為とは異なる。

公開記録には、タイトルごとの目録はない。その目録がなければ、社外の誰もスキャンされた各版の希少性を判断できない。Anthropicは社内のデジタルライブラリーを独立した監査のために公開していない。

モデル開発企業には、購入した紙のコピーを優先する法的理由もあった。物理的なコピーの所有には、特定の物を再販売または破棄する権利を含む、ファーストセール・ドクトリンの下での権利が伴う。

所有権は、基礎となる著作権を移転するものではない。通常、購入者は本を1冊買っただけで著者のテキストを複製・配布できるようにはならない。そのためAnthropicは、取得した物とその社内向け代替物との間に、一冊対一コピーの関係を保った。

破棄はその主張を強めた。もしAnthropicが本と完全なデジタル複製の双方を保持していたなら、原告はそのプロジェクトを利用可能なコピー数を増やす行為だと位置づけることができただろう。

これは奇妙なインセンティブを生む。保存に配慮したスキャナーが存在する場合でさえ、法的に慎重な選択は物理的な本の破棄を促し得る。著作権戦略と文化保存は、逆方向を向いている。

Google Booksは、有用な歴史的対照例を提供する。このプロジェクトは一般に物理的な書籍を返却しながら、図書館の所蔵品をスキャンした。検索可能な索引は長期にわたる訴訟を生き延びたが、その設計と用途はAnthropicの非公開の学習コーパスとは異なっていた。

より最近では、非破壊的な提携が別の道筋を示している。図書館は、原本を保存し、その出所を記録しながら、パブリックドメイン作品をデジタル化できる。ライセンス契約によっても、物理的な破棄を必要とせずにAI開発企業へアクセスを提供できる。

こうした経路には、調整、制約、取引コストが伴う。Anthropicのプロジェクトは、書籍の購入とスキャンを産業的な調達問題へと変えた。個々の物を保存することよりも、速度と規模が重視された。

この仕組みは、損なわれた紙以上にこの出来事が重要である理由を説明している。AIによる書籍破棄は、中古書市場を独自モデル開発のための投入物パイプラインに変える。公に流通していたコピーが、私的に管理されるデータとなる。

Google Newsの主張は利用可能な証拠を超えている

拡散された説明は、確認済みの一つの産業プロジェクトと、希少本および複数のAI企業に関する、はるかに不確かな主張を組み合わせている。

しばしば三つの命題が一緒に語られる。AI開発企業は物理的な書籍を価値あるものと見なしている。Anthropicはスキャンの過程で、購入した数百万冊の書籍を破棄した。AI企業は現在、希少なタイトルを組織的に破棄している。

最初の二つの命題には十分な文書的裏付けがある。三つ目には、まだ同程度の証明はない。

同時代の報道は、知名度が低く、古い、あるいは絶版本について異例の注文を受けた書店を取り上げている。一部の販売者は、仲介業者がAI顧客向けにそれらの本を購入したと考えている。このパターンは調査に値するが、疑念は帰属の証明ではない。

販売者は、最終的な購入者を知らずに異例の需要を観察することができる。仲介業者は複数の業界向けに書籍を調達できる。研究機関、再販業者、コレクター、図書館、デジタル化プロジェクトはいずれも珍しいタイトルを購入し得る。

ISBNdbは、この論争にさらに別の要素を加えた。この書籍データ企業は、大規模言語モデル開発向けに紙の書籍を大量調達するサービスを宣伝するページを公開していた。アーカイブされた宣伝文には、数千冊から100万冊に及ぶ注文が記されていた。

同社は、破壊的スキャンによって生じた評判上の問題にも言及した。ページが注目を集めた後、ISBNdbはそれらを削除し、このサービスは市場の関心を試しただけだったと伝えられている。同社は、そのようなサービスは運用開始に至らなかったと述べた。

この否定は、検証上の空白を残している。宣伝資料は、ある企業がそのサービスの販売を検討したことを示す。だが、AIラボがそのサービスを通じて書籍を購入したこと、または調達されたタイトルを破棄したことの証明にはならない。

この空白が重要なのは、オンライン上の語り直しが、しばしば能力を完了済みの活動へと変換するためだ。ベンダーが書籍を調達できると述べたため、投稿は名前の挙がらないAI企業がそれを利用したと結論づける。書店が異例の注文を見たため、投稿はその購入をAIラボに帰属させる。

どちらの推論も不可能ではない。しかし、契約書、出荷記録、顧客名、または検証済みの管理経路によって、いずれも完全には立証されていない。

希少本に関する証拠は、さらに弱い。2025年のスキャンに関する調査は、Anthropicの裁判記録が希少本の破棄を示していないと指摘した。記録された購入は、主に大量の商業流通経路を通じたものだった。

それでも、希少なタイトルが大量ロットに混入することはあり得る。中古書籍の在庫は雑然としており、高値が付かなくても希少になる版もある。証拠がないことは、破棄されたすべてのコピーが代替可能だったことの証明ではない。

責任ある結論は、より限定的なものだ。AnthropicによるAI向けの書籍破壊は、数百万冊規模で確認されている。希少本や唯一無二の冊子が含まれていたという主張は、信頼できる目録が公開されていないため、依然として検証されていない。

「AI企業」という複数形の表現にも注意が必要だ。Meta、OpenAI、Microsoft、Googleはいずれも、著作権で保護された学習素材をめぐる疑惑に直面してきた。しかし、それらの事案は破壊的な物理スキャンではなく、デジタルファイル、データセット、出版社提供コンテンツに関するものが多い。

Metaは、Llamaの学習に海賊版書籍コレクションを利用したとして非難されている。出版社はまた、Gemini開発での書籍利用をめぐりGoogleを提訴している。これらの争いは、より広範なデータ取得の問題を裏付けるが、同一の書籍破壊プログラムが存在したことを証明するものではない。

Googleの現在のGemini訴訟は、Google BooksやGoogle Play Booksなどのサービス向けに提供された作品の複製疑惑に関するものだ。Googleが希少な物理的版を裁断した証拠ではない。

すべての著作権訴訟を一つの物理的破壊の物語にまとめると、話は共有しやすくなる一方で、検証は難しくなる。企業ごとに、異なるデータソース、取得方法、法的理論を用いていた。

したがって、この拡散した主張全体への最も適切な評価は「一部事実」だ。Anthropicは購入した数百万冊の書籍を破壊的にスキャンした。一方で、数百万冊の希少本が失われたことや、主要なAI開発企業すべてが同じ工程を採用していることは、証拠によって立証されていない。

本当の対立は、私有データと公共の保存にある

最も強い批判は、Anthropicが失われた図書館を焼き払ったことではなく、取得した原本を破壊しながら知識を私有化したことにある。

書籍は単なる入れ物ではないため、物理的な破壊は強い感情を呼び起こす。版には、書体、挿絵、書き込み、装丁、所有者の印、そして人々がテキストをどのように制作し読んだかを示す証拠が残されている。

テキストのみのスキャンでは、そうした特徴の多くが抜け落ちうる。ページ画像が完全であっても、紙、インク、製本構造、あるいは綴じ目近くに隠れた注記までは保存できない場合がある。破壊的スキャンは、言葉を保存する一方で、物としての書籍を失わせる可能性がある。

ただし、図書館や出版社はすでに大量の書籍を廃棄している。傷んだ本、古くなった参考図書、売れ残り在庫、需要の低い重複本は日常的に流通から外れる。破壊という事実だけでは、文化的損失を示すことにはならない。

重要なのは希少性だ。大量に印刷された近年のペーパーバックを1冊処分することと、地域出版物の最後に確認された1冊を裁断することは異なる。拡散された主張は、こうした事例を一つの不安をあおるイメージに押し込めている。

Anthropicは、それらを区別するのに十分な透明性を提供していない。公開目録があれば、書名、版、刊行日、購入元、既知の現存冊数を示せるだろう。そのような包括的な記録は存在しない。

私的な利用先も、さらなる懸念を生む。Anthropicのスキャン済みコーパスは、アクセス可能な保存アーカイブのようには機能していない。研究者、著者、読者は完全なファイルを閲覧できず、紙の本が失われたからといってその本を取得することもできない。

同社は永続的なデータ資産を得た一方で、一般には同等のデジタルコレクションは提供されなかった。Claudeのユーザーは質問できるが、モデルの応答は保存されたテキストではない。不正確に要約したり、文脈を省いたり、根拠のない詳細を生成したりする可能性がある。

言語モデルは、検索可能な図書館目録でもない。そのパラメータは、完全な作品の信頼できる棚ではなく、統計的な関係性を符号化している。学習していても、特定の書籍を忠実に取り出せるとは限らない。

この違いは、書籍の知識が単にモデルへ移行したという主張を崩す。私的なAIシステムは、原ページへのアクセスの代わりにはならない。保存には、安定した複製、メタデータ、来歴、そして将来的な可読性が必要だ。

著者も関連する不均衡に直面している。著者の本は商業的価値の高いモデルを改善したが、著者自身は物理書籍の購入・スキャンの取り決めについて交渉していない。中古本を1冊購入しても、通常は著者や出版社に支払いは届かない。

Anthropicが以前に海賊版デジタルライブラリを取得した件は、異なる法的結果を生んだ。Alsup判事は学習と取得を分け、学習利用は変形的利用に当たると判断する一方、海賊版コピーに関する請求は進行を認めた。

Anthropicはその後、対象となる海賊版作品を対象とした和解に達した。裁判官はその後、総額15億ドルで、対象書籍1冊につきおよそ3,000ドルを割り当てる著作権和解を承認している。

この和解は、購入・スキャンされたライブラリが違法だったことを意味しない。対象となったのは、法的に別個の出所であるAnthropicによる海賊版ファイルの取得だ。両者を混同すると、どちらの問題も弱めてしまう。

法的な対比はなお示唆的だ。購入した書籍は、裁判所のフェアユース分析のもとでスキャン・破棄できた可能性がある。一方、Anthropicがモデル学習のために同様の原テキストを求めていたとされるにもかかわらず、海賊版ファイルは大きな責任を生んだ。

これはAI開発企業に、よりクリーンな取得記録を整備する動機を与える。ただし、物理的な原本を保存したり、書名リストを開示したり、デジタル代替物を一般公開したりする義務を課すものではない。

保存団体は実践的な保護策を提案できる。スキャン受託業者は、署名本、手稿、初版、珍しい装丁、所蔵がほとんど確認されない書名に印を付けられる。専門家は裁断前に、印が付いた本を確認できる。

企業はスキャン後、機密性に配慮した目録を公開することもできる。管理された条件のもと、信頼できる図書館に保存用コピーを寄託することも考えられる。調達契約では、希少版について非破壊的な取り扱いを義務付けることも可能だ。

ライセンスも別の道筋となるが、数百万作品にまたがる交渉は難しい。包括ライセンス組織は権利を集約し、支払いを分配できる。出版社は、物理的なコピーを犠牲にせず、検証済みのデジタルファイルを提供できる。

これらの措置はいずれも、すべての対立を解消するわけではない。図書館は依然としてアクセス制限に直面し、著者は報酬を議論し、開発企業は独自データセットを守るだろう。それでも少なくとも、モデル開発と不必要な文化的損失を切り分けることはできる。

現在の不確実性は、誰の利益にもならない。それは誇張された投稿が、一般的な中古本を唯一無二の宝物として描くことを可能にする。同時に、真に希少な資料が裁断機に入ったかどうかという問いへの回答を企業が避けることも可能にする。

ナレッジワーカーにとって、この教訓は書籍を超える。検索可能な回答は、永続的な情報源と同じではない。優れたパーソナルナレッジマネジメントは、文書を生成された記憶に置き換えるのではなく、文脈、来歴、アクセスを保存する。

Google Newsをめぐる論争後に注目すべきこと

これがAnthropicだけの事案にとどまるのか、それともより広範で継続的な業界慣行の証拠となるのかは、三つのシグナルによって決まる。

第一のシグナルは、書籍調達の仲介業者に関する検証可能な顧客の痕跡だ。契約書、請求書、発送記録、または顧客名があれば、異例の古書店注文を特定のAI研究所と結び付けられる。

この証拠が、破壊的スキャンのための積極的かつ大規模な調達を示せば、より広範な主張は強まる。宣伝されたサービスがマーケティング実験の域を出なかったことが分かれば、主張は弱まる。

広告されたサービスと完了した取引の違いは根本的だ。スクリーンショットは、ベンダーが何を提供していたかを示せる。しかし、誰がそれを購入したか、あるいはその後に本がどうなったかまでは示せない。

第二のシグナルは、Anthropicまたはその受託業者による書名単位の監査だ。限定的な独立レビューであっても、スキャン済み書籍を版、希少性、状態、残存する図書館所蔵数によって分類できる。

このような監査は、希少本の疑惑を直接検証する。唯一無二のコピーや極めて希少な版の証拠があれば、保存に関する懸念は緊急性を帯びる。一般的な商業コピーの証拠であれば、論争の範囲は大幅に狭まる。

Anthropicは、著作権で保護された本文を公開せずともメタデータを開示できる。書名、ISBN、版、購入経路、保存確認を示せば、外部の専門家がリスクを評価できる。編集処理によって、機密のベンダー情報を保護することも可能だ。

第三のシグナルは、裁判所、立法者、出版社が1対1の破壊的変換にどう対応するかだ。現在の判決は、すべての将来のスキャン事業ではなく、特定の記録を扱っている。

後の裁判所は、モデル学習と恒久的なライブラリ保存を区別する可能性がある。立法者も、大規模な商業コーパスに対して開示、ライセンス、保存用寄託を求めるかもしれない。出版社は、そうした規則が整う前に包括的なアクセスシステムを開発する可能性がある。

この第三のシグナルでは、競合他社の行動も重要だ。主要な研究所が、非破壊的スキャンと保存の約束を採用するかもしれない。その動きは、Anthropicの工程を業界の必然ではなく、異議を唱えうるビジネス上の選択へと変える。

企業はまた、出版社のアーカイブを大規模にライセンスすることもできる。そのような契約は、合法的なアクセスに購入書籍の裁断が必要ないことを示す。より秘密主義的な取得方法を採る競合企業には、説明を求める圧力がかかるだろう。

一般の人々は、今後のGoogle News報道で使われる表現に注意を払うべきだ。「数百万冊の本」から「数百万冊の希少本」へと移る見出しは、重要な事実上の飛躍をしている。

読者はまた、物理的なスキャンとデジタル海賊版を分けて考えるべきだ。どちらも著作権で保護された文章へのアクセスに関わるが、行為、証拠、法的結果は異なる。同一視すると、本当のトレードオフが隠れてしまう。

検証済みの事実だけでも深刻だ。Anthropicは数百万冊の書籍を私的なデジタル資源へ変換し、購入した紙のコピーを破棄し、連邦判事がフェアユースとして認めた工程を利用した。

未検証の点も同様に重要だ。数百万件の希少タイトルが失われたことを示す公開証拠はない。また、拡散投稿に含まれるすべての企業に、同一の破壊的プログラムが決定的に帰属されたわけでもない。

次に信頼できる報道が答えるべきなのは、具体的な問いだ。どの企業が注文したのか。どの版が購入されたのか。現存コピーはいくつあるのか。誰がスキャンし、デジタルファイルはどこへ行ったのか。

それらの答えが出るまで、読者は両極端を避けるべきだ。この論争は作り話のデマではないが、その最も警戒をあおる版は証拠を超えている。

Google Newsの各見出しの背後にある一次資料、特に裁判所提出書類や実名企業の記録を追い続けてほしい。決定的な問題は、破壊的スキャンが行われたかどうかではなくなっている。AI企業が何を破壊したのかを開示し、希少作品を保存し、自社システムの価値を高めた著者に補償するのかどうかだ。

 
 

無料で始めましょう

ローカルファーストのパーソナル知識管理付きAIアシスタント

より良いAI体験のために、

remio は現在、 Windows 10+ (x64)M-Chip Mac のみをサポートしています。

脳内に検索バーを追加

ただremioに尋ねるだけ

すべてを思い出す

何も整理しない

bottom of page