top of page

日本のAI向け書籍購入で古書店の売上が5倍に、ただし本は戻らない可能性

59 分前
読了時間: 17分

日本のAI向け書籍購入により、一部の古書店では日次売上が通常の5倍に達したと報じられている。この予想外の活況には、気掛かりな可能性が伴う。購入された書籍の多くがスキャンされ、解体されたうえで、永遠に流通から姿を消すかもしれない。

Tom’s Hardwareが引用した日本の報道によると、店舗には一度に数百冊を注文する発注が届いているという。一見すると別々の複数の購入者が、岡山県の同じ物流センターを配送先に指定しているとされる。確認されたある出荷では、日本の書籍50トンが米国へ送られた。

購入者の身元は公表されておらず、物流事業者も質問への回答を拒んだ。現時点で入手できる証拠から、すべての注文がAI企業に結び付くとは証明できない。しかし、この購入パターンは、Anthropicが米国で用いたことが記録されている手法と似ている。

その手法では、紙の書籍を購入し、製本を外して全ページをスキャンし、検索可能なデジタルコピーを保管した。その後、印刷されたページは廃棄された。連邦判事は後に、この物理的なスキャン経路を、Anthropicによる数百万冊の海賊版デジタル書籍の取得とは異なるものとして扱った。

したがって中心的な対立は、異例の売上急増よりも大きい。日本の書店は今日、歓迎すべき収益を得る一方、研究者や読者は明日、書籍不足に直面するおそれがある。この取引は情報を非公開のデータベース内に保存するが、その情報を提供した一般公開の書籍を破壊する可能性がある。

日本の古書ブーム、その購入者は不明

店舗レベルで報じられた売上急増は実在するが、大量購入者の目的や身元は依然として確認されていない。

日本には、深く多様な中古書籍市場がある。全国チェーン、専門書店、地域の店舗、複数の倉庫に在庫を分散させたオンライン販売者などが含まれる。この分散性により、市場は幅広いコーパスを迅速に構築するのに適している。

コーパスとは、検索、分析、またはAI学習に用いられる大量のテキスト集合である。印刷書籍は、通常のウェブクローリングでは得られないことも多い、編集された人間執筆の資料を提供する。古い書籍は、オンラインで機械生成テキストが広がる以前に刊行されている点でも価値がある。

最近の購入活動は、まさにそのような資料を対象としているようだ。最初の大量注文に関する報道によると、オンライン売上が5倍に増えた日があったと店舗が報告している。一部では、通常の消費者向けの買い物かごとは異なり、数百冊に及ぶ注文を受けた。

対象分野の組み合わせも疑問を生じさせる。小説や漫画は従来、多くの消費者注文で中心を占めるが、報じられた購入は哲学、政治史、医学、法律、社会史にまで及んだ。江戸時代の生活と文化に関する書籍が含まれていた例もある。

この幅広さは、個人的な収集というよりデータセットの構築に近い。読者は通常、著者、ジャンル、時代、あるいは特定の研究課題に沿って選ぶ。一方、データ購入者にとっては、多様性、整理されたメタデータ、統計的な網羅性を高める十分な量が有益となる。

注文は複数のアカウントを通じて行われたとされる。しかし、その多くは岡山県内の一つの物流センターへの配送を指定していた。この共通の配送先は重要な手掛かりだが、最終顧客を特定するものではない。

物流センターは、輸出、再販、保管、図書館処理、またはデジタル化のために書籍を集約する可能性がある。運営者は自らの役割の説明を拒んだと報じられている。請求書、契約書、または顧客名がなければ、注文を特定のAI開発企業に帰することは憶測に過ぎない。

50トンの出荷は、より強い歴史的背景を示している。日本の報道は、Anthropicに関連するスキャンのため、その量の書籍が米国へ送られた記録を説明している。ただし、それはAnthropicが現在の岡山向け注文を行ったことを裏付けるものではない。

同様に、名前の明かされていない外国企業が、西日本の店舗に数万冊の書籍取得について連絡したとも報じられた。この照会は、産業規模での海外需要を示す。それでも、購入者の目的や身元は判明していない。

この区別は重要である。証拠は、不審な大量購入が起きているとの報道を支持している。また、一部の書籍が破壊的なスキャンのために集められている可能性への懸念も裏付ける。しかし、すべての売買をAnthropicによる確認済みの購入と表現する根拠にはならない。

より正確な結論は限定的だ。日本のAI向け書籍購入は、通常の小売行動では容易に説明できない規模に達しているように見える。書籍が不透明な供給網に消える前に、配送経路と分野の選定を精査する必要がある。

AI企業が今なお紙の書籍を求める理由

物理的な書籍は、ウェブ規模のAI開発者自身が生み出したデータ品質の問題を解決しうる一方、海賊版ライブラリよりも明確な取得経路を購入者に提供する。

大規模言語モデルは、膨大なテキスト集合から統計的パターンを学習する。そのテキストの品質は、モデルの推論、文体、専門用語、事実関係の扱いに影響する。書籍は、短いウェブページではめったに得られない、長く構造化された論考を提供する。

書籍には、オンラインで自由にアクセスできるようにならなかった知識も含まれている。地域史、専門マニュアル、学術書、古い翻訳書、絶版タイトルは、紙媒体にしか存在しない場合がある。日本語のコレクションは、英語以外の言語におけるモデル性能を改善するうえで特に価値が高い。

この時期は、合成データによる汚染への懸念の高まりも反映している。生成AIが広く利用可能になって以降、機械生成のページはウェブ上で急増した。クローラーは今や、以前のモデルが生成したテキストを取り込む可能性があり、そこには誤りや反復的な文体パターンも含まれる。

人間が執筆した書籍は、よりクリーンな代替手段を提供する。生成AIブーム以前に刊行された作品には、現代のチャットボット出力が含まれている可能性は低い。多くの場合、その出版過程には編集、ファクトチェック、一貫した構成が含まれていた。

もちろん、すべての印刷書籍が正確または有用という意味ではない。書籍は、意図的に書かれた人間の言語を比較的高密度に提供するということだ。多言語性能で競争するAI開発企業にとって、こうした資料は代替が難しい。

裁判記録は、Anthropicが書籍をどれほど重視していたかを示している。2025年のフェアユース判決で、ウィリアム・アルサップ判事は、同社が書籍を最高水準の言語モデルに至る費用対効果の高い経路と見なしていたと記した。

Anthropicは当初、複数の情報源からデジタルコピーを入手していた。裁判所は、同社がBooks3から196,640冊、Library Genesisから少なくとも500万冊、PiLiMiから少なくとも200万冊をダウンロードしたと認定した。

判決によると、これらのコレクションには無許可のコピーが含まれていた。Anthropicは、特定の書籍が学習用の混合データに選ばれなかった場合でも、恒久的な中央ライブラリを維持していた。この判断は、モデル学習そのものとは別の法的リスクを生んだ。

同社は後に、物理的な取得経路を追求した。2024年には、Googleの書籍スキャンプロジェクトで以前パートナーシップを率いていたTom Turveyを採用した。彼の任務には、先の法的問題を繰り返さずに、極めて幅広い書籍コレクションを取得することが含まれていた。

Anthropicは数百万冊の紙の書籍を購入し、その多くは中古品だった。請負業者が製本を外し、ページを分離してスキャンし、画像を機械可読なテキストに変換した。同社は生成されたデジタルファイルを保管した。

このワークフローは、中古市場が魅力的である理由を説明する。中古本は多くの販売者から調達でき、その購入によって一般的な取引記録が作られる。購入者は、International Standard Book Number、すなわちISBNを用いて版を指定することもできる。

ISBNは、特定の書籍の版と形式を識別する。購入者が重複購入を避け、スキャンとメタデータを結び付け、言語や出版情報を追跡するのに役立つ。注文に無関係な数千タイトルが含まれる場合、こうした機能は重要となる。

破壊的スキャンは、綴じられたページを一枚ずつ撮影するより速い。背表紙を外せば、ばらばらの紙を高速スキャナーに通せる。光学式文字認識は続いて、ページ画像を検索可能なテキストに変換する。

この過程は、保存を処理量と引き換えにする。希少な一冊と一般的なペーパーバックは、誰かが事前に分けない限り、同じ機械的な工程に入る可能性がある。最終的なデータセットは残るが、購入された物体は残らない。

この仕組みにより、日本での注文がAI関連の取得である可能性は理解できるものとなる。ただし、そのつながりを証明するものではない。それでも、クリーンな日本語テキストへの需要と、記録された産業的ワークフローの組み合わせは、書店経営者が懸念を抱く合理的な根拠となる。

日本のAI向け書籍購入、収益を保存リスクへ転換

核心にある逆転は単純だ。書店を助ける購入であっても、その売買を可能にした書籍市場を弱めることがある。

販売者にとって、売上が5倍となる日は通常は朗報である。古書店は限られたスペース、不均一な需要、何年も売れ残る可能性のある在庫のなかで営業している。大量注文は保管容量を空け、動きの遅い在庫を収益に変える。

取得された書籍の多くは、一般的な余剰在庫である可能性もある。よくあるペーパーバックを一冊破棄しても、その内容が世界から消えるわけではない。書店は、保存コストが見込まれる需要を上回る場合、傷んだ在庫や不要な在庫を日常的に処分している。

懸念が強まるのは、購入者が希少性ではなくメタデータに基づいて購入する場合だ。大規模な取得システムは、絶版の地域研究書を他のISBNと同じように扱うかもしれない。掲載された一冊が、今なお入手できる数少ない本の一つであることを認識しない可能性がある。

スキャン後、物理的な書籍はパルプ化される可能性がある。そのテキストは、非公開の企業リポジトリの中でしか利用できなくなるかもしれない。図書館、研究者、収集家、将来の読者が、そのデジタル版に自動的にアクセスできるわけではない。

この結果は、保存プロジェクトとは異なる。図書館は、可能な限り原本を保持しながら、脆弱な資料をデジタル化してアクセスを広げる。非公開のAIコーパスは、公共アーカイブとして機能するためではなく、主に商用モデルを改善するために設計されている。

この違いは検証にも影響する。研究者には、安定した版、ページ画像、注記、図版、物理的な文脈が必要だ。単なる抽出テキストでは、欄外注記、レイアウト、書体、図表、版の来歴を示す痕跡が失われることがある。

日本の出版事情では、この問題は特に繊細である。多くの作品は少部数しか印刷されず、デジタル版が刊行されることもない。地域史や古い技術書は、全国的な注目を集めることなく市場から消える可能性がある。

古書店は非公式な保存ネットワークとして機能している。その棚は、不要になった個人蔵書を、次の読者が見つけるまで利用可能な状態に保つ。すべての個別購入が合法であっても、産業規模で書籍を取り除けば、そのネットワークは変化する。

圧力は均等には分配されない。大手チェーンは、人気タイトルを多くの支店から補充できる。小規模な専門店は、数十年をかけて集めた独自性の高い在庫を抱えている場合がある。一件の幅広い大量注文だけで、その店が提供できるものは恒久的に変わりうる。

これは、大量購入そのものが不適切だという意味ではない。所有者には自らの蔵書を売却する権利があり、多くの人にとってその収入は必要だ。購入者にも、アクセシビリティ、検索、研究、言語技術などを目的に書籍をデジタル化する正当な理由がある。

問題は、十分な情報に基づく選択肢がないことだ。書店は、読者、図書館、あるいはコレクターに本を提供していると考えるかもしれない。しかし購入者が各冊を解体する意図を持っているなら、売り手は独自の保存基準を適用できない。

希少資料であれば、そうした注文を断る所有者もいるだろう。別の所有者は価格を変えたり、1冊を手元に残したり、希少本には非破壊スキャンを求めたりするかもしれない。仲介者が最終用途を隠せば、そうした判断はできない。

したがって、日本におけるAI向け書籍購入は市場情報の失敗を生む。売り手は書名と数量を知っていても、行き先や目的を知らない可能性がある。購入者は意図する処理を把握している一方、複数のアカウントに注文を分散できる。

その結果、短期的な価値移転が起きる。書店は現金を受け取り、購入者は物理的な本と、そのデジタル化された内容に対する排他的な管理の両方を手にする。一般の人々は、損失が生じたことに気づかないままアクセスを失う可能性がある。

だからこの問題は、単にAI企業が学習データに対価を払っているという話ではない。支払いは取得に関する一つの問いには答える。しかし、保存、透明性、ライセンス、継続的な流通が持つ社会的価値の問題までは解決しない。

本を買っても著作権問題は解決しない

物理的な本の所有権と、その文章を複製する許可は別個の権利であり、AI学習は各法域でなお法的に争われている。

購入者は通常、適法に購入した本を再販売、貸与、改変、あるいは廃棄できる。だが著作権法は、保護された表現を複製し利用する行為を依然として制限する。AIスキャンは、この二つの原則を正面から衝突させる。

Anthropicの事案で連邦裁判所は、取得と学習を分けて判断した。Alsup判事は、同社が適法に取得した書籍を学習に用いたことについて、審理対象となった事実関係の下では変容的利用に当たると判断した。この判決は、すべてのAIシステムに普遍的な免除を与えるものではなかった。

判事はまた、Anthropicが行った物理本のスキャンと、海賊版ライブラリからのダウンロードを区別した。印刷版を購入し、社内利用のために変換する行為は、より有利に扱われた。一方、海賊版と認識しながら数百万件のファイルを保持する行為はそうではなかった。

この違いは、物理的な本が現在戦略的価値を持つ理由の一つだ。記録された購入は、法的リスクの一類型を低減しうる。しかし、複製、市場への損害、データ透明性、各国法の違いに関する請求をなくすものではない。

Anthropicは後に、海賊版コピーに関する請求の解決に合意した。提案された和解は推定50万作品を対象とし、争点となったデジタルライブラリから取得した原本ファイルの破棄を求めた。

copyright settlementは、破壊的スキャン自体が違法であると確定したものではない。裁判所がモデル学習を変容的と捉える場合でも、取得方法が重要になりうることを浮き彫りにした。

著者や出版社は、広範な学習利用の主張に依然として懐疑的だ。Authors Guildは、書籍その他の保護対象資料に関わる米国の著作権訴訟をおよそ12件追跡している。被告にはAnthropic、OpenAI、Microsoft、Meta、Nvidia、Google、Bloomberg、Databricksが含まれる。

これらのpending AI casesは、異なるデータセット、モデル、原告、法的理論を扱っている。一つの判決を、すべての事案に自動的に当てはめることはできない。控訴によって現在の解釈が変わる可能性もある。

日本は、この分析に別の法制度を加える。日本の著作権法には、一定の条件下で情報解析を認めうる規定がある。その適用は、目的、著作物の享受、権利者への潜在的な不利益に左右される。

海外向けの輸送には、複数の段階と法域が関わりうる。本は日本で購入され、岡山で集約され、米国でスキャンされ、世界規模で事業を展開する企業に利用されるかもしれない。各段階で異なる事実上の問いが生じる。

現在の報道は、それらの契約を明らかにしていない。書名を選ぶのが誰か、スキャンデータを所有するのが誰か、出版社がライセンス料を受け取っているのかも特定していない。こうした空白により、合法性について確定的な結論を出すことはできない。

同じ注意は破棄にも当てはまる。Anthropicの過去のワークフローに関する報道は、大規模な破壊的スキャンが存在することを示している。しかし、岡山のセンターを経由するすべての本がパルプ化されることを証明するものではない。

一部は非破壊的な画像化の後に再販売される可能性がある。別の本は保管されたり、通常の輸出向けに処理されたりするかもしれない。購入者、物流事業者、スキャン事業者、または輸送記録が詳細を示すまで、最終的な処分は依然として主張にとどまる。

その不確実性は、調査を終わらせる理由ではない。むしろ調査の対象を定めるものだ。最も強い記事とは、裏付けのない犯人を名指しするものではなく、主張を検証するために必要な記録を特定するものだ。

書店は、アカウント情報、注文リスト、発送ラベル、通常と異なるやり取りを保持できる。輸出記録は、仕向地と重量を確認できる。スキャン受託業者は、保護対象となる顧客データを明かさずに保存方針を開示できる。

出版社や著者は、新たに取得された日本語データセットがライセンスを受けているかどうかも問える。モデル開発者は、安全性の手法や計算資源については次第に説明するようになっている。学習データの取得は、依然としてはるかに透明性が低い。

法廷闘争は続くだろうが、裁判所が最終判断を下す前にも透明性は改善できる。購入者は目的を開示し、希少な本を保護し、権利者に意味のある情報を提供できる。これらの措置にモデルアーキテクチャの公開は必要ない。

次の証拠はサプライチェーンから得られなければならない

これが一時的な小売の異常なのか、日本の出版物が民間のAIアーカイブへ移転する産業的な動きなのかを判断するには、三つのシグナルが重要になる。

第一のシグナルは最終購入者の特定だ。すべての発送先が一つの施設に集約されるなら、複数の購入アカウントが複数の顧客を意味するとは限らない。契約書や輸出書類によって、その施設とスキャン会社またはAI開発企業を結び付けられる可能性がある。

顧客が確認されれば、AIによる取得という仮説は強まる。通常の輸出、図書館向け再販売、商業アーカイブ化の証拠があれば、その仮説は弱まる。いずれの結果も、疑念を説明責任のある管理連鎖へと置き換える。

第二のシグナルは、希少本の扱いだ。売り手は、購入者が一般的な重複本を選んでいるのか、一致するISBNをすべて買い集めているのかを追跡すべきだ。絶版の学術書や地域史を含む注文には、特に注意が必要である。

希少本を除外する購入者であれば、保存への懸念は軽減される。非破壊スキャンなら、さらに軽減される。希少性を確認せずに本を破棄するプロセスであれば、恒久的な文化的損失への懸念を裏付けることになる。

第三のシグナルは、AI開発企業による情報開示だ。企業は、日本の印刷コレクションを購入しているか、受託業者が原本を破棄しているか、著作権をどのように扱っているかを明らかにできる。沈黙が続けば、仲介者や書店が評判上の負担を負い続けることになる。

開発企業は、スキャンデータが私的なままなのか、公共の保存用コピーを支えるのかも説明できる。私的なコーパスは一社に商業的価値をもたらす。アクセス可能なアーカイブは、読者や研究者に少なくとも一部の利益を残せる。

これらのシグナルは日本を超えて重要だ。欧州や米国の書店も、AI学習データへの需要に関連する異例の大量注文を報告している。再現可能な国際的パターンが確認されれば、孤立した収集活動ではなく、協調的なデータ調達産業を示すことになる。

それは競争の構図も変える。モデル開発企業はかつて、主として計算能力、エンジニアリング人材、インターネット規模のデータセットをめぐって競争していた。現在は、まだ自由にオンライン流通していない、選別された人類の知識をめぐって競争している。

この競争は書店をなじみのない立場に置く。書店はもはや読者にサービスを提供する小売業者だけではない。その目録は、はるかに大きな予算を持ち、一般からほとんど見えない企業のための上流データ基盤になりうる。

所有者は、すべての大量販売を拒否する必要はない。新たな収益を放棄せずに保護策を導入できる。そうした保護策には、数量の確認、希少性の確認、購入者による申告、破壊的利用に対する個別承認などが含まれうる。

マーケットプレイスは、同じ仕向地を共有する連携アカウントにもフラグを立てられる。無関係な学術分野にまたがる大量注文が、必ずしも不正とは限らない。それでも、希少在庫を手放すかを判断する売り手にとって有用な情報だ。

図書館、出版社、大学も同じパターンを注視すべきだ。専門的な書名が突然姿を消すことは、公式の流通統計が不足を示すずっと前から研究に影響を及ぼしうる。共有の監視リストがあれば、脆弱な作品をより早く特定できる。

読者にも役割がある。相続した蔵書を売る人は、最も早く大量に買い取る相手を選ぶ前に、唯一性のある資料が図書館やアーカイブに収まるべきではないかを考えるべきだ。希少本が破壊的処理に入れば、その判断を覆すことはできない。

現在の取得対象がそろえば、日本での販売急増は収まるかもしれない。そうなれば、書店は所有者が恐れる反動を経験する可能性がある。収集期間中には収益が増える一方、望ましい在庫の補充が難しくなるため、その後に売上が落ちる。

より持続的な問いは、そこで生じる知識を誰が管理するのかに関わる。スキャンされた本は、言語ツール、検索システム、障害のある人々のアクセスを改善できる。そうした利益に秘密主義や不必要な破壊は必要ない。

したがって、日本におけるAI向け書籍購入は、購入後に何が起きるかによって判断されるべきだ。希少作品は保護されているか。創作者は知らされているか。研究者は保存されたコピーにアクセスできるか。購入者は公的な説明責任を受け入れるか。

これらの答えが明らかになるまで、責任ある結論は慎重であり続ける。大量注文は書店の証言によって裏付けられている一方、AIとの関係は強く示唆されるものの、検証は不完全だ。リスクが不可逆的になるのは、本がスキャナーに入ったときだけである。

岡山のサプライチェーン、絶版書の行方、主要モデル開発企業からの情報開示を注視すべきだ。この三つのシグナルが、小売の活況が文化的記憶の隠れた移転へと変わったのかを示す。

 
 

無料で始めましょう

ローカルファーストのパーソナル知識管理付きAIアシスタント

より良いAI体験のために、

remio は現在、 Windows 10+ (x64)とM-Chip Mac のみをサポートしています。

仕事のAIパートナー
remioでもっと仕事が進む

計画・作成・仕上げまで
すべてをひとつに

bottom of page