Hacker Newsが見つけたAI書籍の氾濫、人間の著者は劣勢に
Hacker Newsで、AI生成フィクションに対する最も安易な擁護論――読者は質の悪い作品を単に無視する――に異を唱える、14,419冊を対象とした研究が取り上げられた。研究者らは、検出されたAIテキストを相当量含む書籍は、平均すると販売効率が低いことを明らかにした。それでも、その圧倒的な量によって、他の書籍から売上、収益、そして限られたランキング枠を奪っていた。
2026年7月に投稿され、現在も査読中のこのワーキングペーパーは、主にAmazonで販売される自費出版のジャンル小説を調査している。著者はStony Brook University、Columbia Law School、University of Michigan、MIT Initiative on the Digital Economyに所属している。
彼らの中心的な主張は、AIがより優れた小説を書くというものではない。生成AIは、品質競争に勝つことなく創作市場を変えうる、という点だ。低コストで制作できるため、出版者は十分な数の書籍を出し、限られた読者の関心をはるかに多くのタイトルへ分散させられる。
この違いは、著者、出版プラットフォーム、AI企業にとって重要だ。また、著作権訴訟において「市場希薄化」と呼ばれる論争のある理論を裏付ける新たな証拠にもなる。この理論では、個々の出力の成果が乏しくても、AI出力は規模によって市場を損ないうるとされる。
この研究は異例なほど詳細な証拠を提示しているが、すべての疑問に決着をつけるものではない。AIの分類はテキスト検出器に依存し、市場データもAmazon小説の選定された一部を対象としている。分析は観察研究でもあるため、最も強い傾向であっても、すべての減少をAIだけが引き起こしたとは証明できない。
それでも、ひとつの結論を退けるのは難しい。制作が産業規模に近づけば、平均的な品質の低さは、自動生成コンテンツが経済的に重要になることを妨げない。
Hacker Newsで取り上げられた論文が実際に示したこと
この研究が見いだしたのは、AIベストセラーの台頭ではなく供給ショックだった。
研究者らは、2023年1月から2026年3月に刊行された14,419タイトルを分析した。全文のAI検出結果と、2026年6月までの日次販売観測データを照合している。サンプルは、自費出版ジャンル小説の8つのクラスターを対象とした。
各タイトルは3つのグループのいずれかに分類された。AIテキストが検出されなかった書籍はスコア0とされた。軽度AI書籍は、検出されたAIテキストが25%以下のものを指す。相当量AI書籍は、そのしきい値を超えたものだ。
これらのラベルは、法的な著者性ではなく検出器の出力を表す。特定の著者名義が特定のモデルを使ったことを立証するものではない。また、権利侵害を証明したり、誰が文章を生成したかを特定したりするものでもない。
サンプル内では、相当量AI書籍はタイトル数の20%を占めた。しかし、観測された発売初期ウィンドウの売上では12.1%、収益では11.3%しか生み出していない。AIテキストが検出されなかった書籍はタイトル数の62.9%だったが、売上の71.7%を得ていた。
この結果は、AIを多用した書籍は個別には成果が低いという一般的な批判を裏付ける。しかし、市場全体の傾向は別の方向を示している。観測された売上シェアは、2023年初頭にはほぼゼロだったものが、2026年第2四半期にはおよそ5分の1まで上昇した。
その存在感は市場上位にも及んだ。研究者らはAmazonの販売ランク中央値を用い、各ジャンル内で週次のTop-25グループを構築した。相当量のAIテキストを含む新規参入作は、最終的にそれらのグループへの追加分の31%を占めた。
AIテキストが検出されなかった書籍は、上位タイトルの間で依然として多数派だった。それでも、軽度AI書籍と相当量AI書籍を合わせたシェアは、2026年第2四半期には構築されたTop-25枠の40%近くに達した。
したがって、この研究は平均的な成果と集団的な圧力を分けて捉えている。AIを多用した1冊は売れなくても、何千もの類似作品が集まれば、全体として意味のある関心を奪いうる。これが論文タイトルの背景にある仕組みであり、最も強い発見でもある。
この対比は、研究者らの成長指標を見るとさらに明確になる。累計刊行カタログは、2023年初頭の水準の38.3倍に成長した。四半期ごとの販売タイトル数は19.2倍、販売部数は7.3倍、収益は8.9倍に増えた。
これらの数値は、Amazonのカタログ全体が同じ割合で拡大したことを意味しない。研究で観測された刊行コホートと指数化されたサンプルを示している。ただし、供給の伸びが需要を大幅に上回ったという内部的な乖離は際立っている。
1件の売上をめぐって、より多くのタイトルが競争するようになった。その結果、販売中の書籍1冊あたりの収益は、2023年コホートと2025年コホートの間で8つのジャンルグループ中6つで低下した。AIテキストが検出されなかった書籍に限ると、8つ中7つで低下した。
この最後の結果が、市場希薄化の議論を支えている。分母に低品質なAIタイトルが加わったからだけでは、平均値は低下していない。AIテキストなしと分類された書籍も、後年のコホートでは収益が減っていた。
AI書籍市場の希薄化は量によって起きる
生成AIは、繰り返し見つけてもらうことよりも、繰り返し制作することを容易にすることで出版経済を変える。
従来の書籍制作には、いくつかの自然な制約がある。執筆には時間がかかり、編集には注意力が必要で、各刊行には機会費用が伴う。生成AIは、とりわけ反復する筋書きや馴染み深い人物類型を軸にした定型的なカテゴリーにおいて、執筆の制約を緩和する。
この研究は、AI利用者の全員が高い生産性を得るとは主張していない。最初の相当量AI作品の前後で、824の著者名義を調査した。その後に相当量AI書籍をさらに刊行した385名のうち、287名は月間の刊行量を増やしていた。
この74.5%という割合が、平均的な品質だけでは不十分な指標である理由を示している。著者や制作側は、すべてのタイトルを成功させる必要はない。大規模なポートフォリオなら、ジャンル、ペンネーム、表紙、キーワード、刊行日をまたいでリスクを分散できる。
こうして生まれる競争は複数の段階で起こる。書籍は検索順位、推薦枠、カテゴリーランキング、サブスクリプションでの閲読、広告露出、そして読者の限られた閲覧時間を争う。タイトルが1冊増えるごとに、それらの制約された枠を争う候補が1つ増える。
これは、低コストのコンテンツであふれた他のアルゴリズム市場に出版を近づける。希少な資源はもはや、アイテムを制作する能力ではない。それを適切な瞬間に購入者の前へ置く能力である。
研究者らは、相当量AIタイトルがカタログに占める割合が高いほど、圧力が強まることを見いだした。AIテキストが検出されなかった書籍は、露出が低いグループでは構築されたTop-25の約88%を占めた。そのシェアは、露出が最も高いグループではおよそ63%まで低下した。
この関係は、Kindle Unlimitedの利用比率が高いジャンルでより強かった。Kindle Unlimitedは、読者に共有型サブスクリプションカタログへのアクセスを提供する。この仕組みは、新刊が同じ読書選択肢のプールに入るため競争を激化させる。
Kindle Unlimitedの比重が高いジャンルでは、AIなし書籍が持つ売上シェア上の優位性は8.5ポイント小さかった。収益シェアでは8.4ポイント小さかった。これらは調整済みの関連性であり、実験的な推定値ではない。
この仕組みは、頻繁な刊行スケジュールも後押しする。制作側はより多くのタイトルを試し、どの組み合わせが読者を引きつけるかを観察し、成功したパターンを繰り返せる。より遅いサイクルで活動する人間の著者は、異なるリスク構造に直面する。
小説家は1作を磨き上げるために数カ月を費やすかもしれない。AI中心の事業体は、同程度の制作労力を多くの書籍に分配できる。大半が失敗しても、推薦に入ったり反応のよいニッチを見つけたりする機会は増える。
ここに論文の本当の逆転がある。AIフィクションは、すべての読者に優れた作品だと納得させる必要はない。成功する作品が少数でも、多数の失敗作を補えるほど出版コストを下げればよい。
研究における上位作品は、この裾野に商業的に意味のある例外が含まれうることを示している。相当量AI書籍の上位タイトルは、大きな販売部数に達した。上位15タイトルも、対象サンプル内の相当量AI収益のかなりの割合を獲得した。
こうした勝者は、自動化された制作が成功を保証することを示すものではない。大量の実験から意味のある売上へ至る、実行可能な経路が市場に存在することを示している。この経路は、競合するすべての制作側のインセンティブを変える。
人間の著者が直面するのは、品質だけでなく関心の問題
人間の書き手はより良い本を書いても、プラットフォームが読者の吸収力をはるかに超える在庫を受け取ると、可視性を失いうる。
出版をめぐる議論では、読者の判断がAIコンテンツの問題を解決すると想定されがちだ。この見方では、質の低い本は低評価を受け、ランキングから消え、真剣に執筆する著者は概ね影響を受けない。
この研究は、なぜそのフィルターが不完全なのかを示している。読者が本全体を判断する前に、発見の段階がある。購入者が通常目にするのは、表紙、タイトル、説明文、短い試し読み、カテゴリー配置、推薦、広告だ。
したがって、低品質な本でも販売を完了させずに関心を消費できる。検索結果の枠を占めたり、表示を発生させたり、推薦セットに入ったりすることがある。これらはいずれも、読者が本を読み終える必要はない。
ランキング枠は、さらに厳しいボトルネックを生む。カテゴリーには多くの書籍を表示できても、目立つ位置を得られるのは少数に限られる。AIを多用した作品が1冊上位に入るたび、別のタイトルがその可視性の高いグループから押し出される。
圧力は個々の小説同士の直接競争を超えて広がる。カタログが増えるほど、正当な著者、信頼できる出版社、丁寧に編集された作品を見分けるコストが高くなる。読者は選択の前に、より不確かなシグナルを評価しなければならない。
公開ラベルはこの不確実性を減らせるが、Amazonが設けている区別は現在のところ限定的だ。同社のKDPコンテンツ規則では、AI生成のテキスト、画像、翻訳について、出版者がAmazonに知らせることを求めている。
Amazonは、後から人が大幅に編集した場合でも、AIツールが作成した素材をAI生成コンテンツと定義している。一方で、制作者が最終テキストを書く場合のブレインストーミング、誤り修正、その他のAI支援作業については、開示を求めていない。
開示先は、刊行時のプラットフォームだ。Amazonの規則は、開示されたすべてのタイトルに顧客向けの可視ラベルを付けるとは約束していない。ここに、プラットフォームが知る情報と読者が知る情報の隔たりが生まれる。
この隔たりは研究の中心にある。著者らによると、データセット内の書籍で、AI生成コンテンツを含むかどうかを公に開示していたものはなかった。したがって読者は、購入前に研究で検出されたグループを確実に区別できなかった。
Amazonは、著者や擁護団体が懸念を表明した後の2023年に、この開示要件を導入した。当時、Authors Guildはこの変更を有用な第一歩と評価しつつ、公的な透明性を求めたと、Associated Pressの報道は伝えている。
プラットフォームは難しいモデレーションの問題に直面している。厳格なラベル付けには、制作手法に関する信頼できる情報が必要だ。自己申告は不正確になりうる一方、自動検出は編集済みの作品、翻訳文、あるいは特徴的な人間の文体を誤分類する可能性がある。
より緩やかな方針は誤った非難を減らすが、読者が得られる情報も少なくなる。また、制作側が曖昧さから利益を得ることも可能にする。洗練された表紙ともっともらしい説明文は、元のテキストがどれほど短時間で作られたかを隠しうる。
AIを避ける場合であっても、人間の著者はこの不確実性に対応しなければならない。より強いコミュニティ、読者との直接的な関係、認知されやすいシリーズのアイデンティティ、あるいは著者性を示すより一貫した証拠が必要になるかもしれない。こうした活動は、本来であれば執筆に充てられる時間を消費する。
クリエイターが草稿、情報源、改稿、編集上の判断を記録しなければならないとき、ナレッジマネジメントの重要性も高まる。検索可能なパーソナルナレッジベースは、ライターを別個の管理システムへ追い込むことなく、その創作の軌跡を保持できる。
より深い問題は、AIがライターのワークフローに属するかどうかではない。編集支援と自動化された大量生産は、市場にまったく異なる影響をもたらす。現在のストアフロントでは、その違いが必ずしも読者に見える形になっていない。
著作権をめぐる争いはいま、市場メカニズムを伴っている
この論文は、AI学習をめぐる紛争を、機械生成の代替物が人間の仕事を支える市場を圧迫しうるという証拠と結び付けている。
著作権法では、無許可利用がフェアユースに該当するかを判断する際、複数の要素を検討する。重要な要素の一つは、著作権で保護された著作物の潜在的市場に及ぼす影響である。
生成AIは、この分析を複雑にする。モデルは、単一の出力で書籍一冊を丸ごと再現することなく、書籍を学習する可能性がある。それでも、同じジャンルの書籍と競合する多数の新作の制作を支援できる。
この論文は、その知見を著者とモデル学習をめぐる著作権訴訟、Kadrey v. Metaに結び付けている。この訴訟では裁判所が市場希薄化の理論を検討したが、原告側がそれを裏付ける十分な証拠を示していないと判断した。
研究者らは、その証拠上の空白の一部に取り組んでいる。研究では、大量のAIテキストが検出された書籍が、他の書籍と同じ市場に参入しているかを調べた。そのうえで、AIへの曝露が増加するにつれて、販売数、収益、順位がどう変化するかを測定している。
結果は希薄化と整合的だが、この論文だけで責任の有無を判断することはできない。著作権侵害は、複製、保護される表現、フェアユース、因果関係に関する法的な問いに左右される。市場の相関関係だけでは、これらの問題を解決できない。
上流と下流の行為も分けて考える必要がある。著作権のある書籍でモデルを学習させることは一つの行為である。ユーザーが競合作品となる小説を生成・出版することは別の行為だ。その小説を人間が書いた本と並べてプラットフォームが順位付けすることは、さらに第三の層を加える。
米国著作権局は、市場への影響を学習をめぐる議論の重要な部分として扱ってきた。2025年の分析では、出力が関連する創作市場で競合する場合、商業的な学習はフェアユースとしての保護が弱くなりうると論じた。この評価は政策上の指針であり、普遍的な裁判所判断ではない。
今回の研究は、抽象的な法的懸念と観測された市場行動をつなぐ可能性のある橋を提示している。代替は、複製版が原著を置き換える形である必要はないことを示唆する。緩やかに代替可能なジャンル作品が何千冊もあれば、損害は多くの作家に分散しうる。
この論文は、既存の書籍と共有される特徴的な言語も分析している。希少表現を、Google Booksの巻のうち5冊以下にしか見られない、少なくとも5語からなる連続した表現として定義する。こうした表現は、巨大な一般ウェブのスナップショットにも存在しないことが求められる。
各比較グループで収益が最も高い50冊を見ると、大量のAIを含む書籍では希少表現のカバレッジがより高かった。平均は45%に達し、AIテキストが検出されなかった書籍の37.7%を上回った。
AIを大量に含む上位200冊全体でも、希少表現のカバレッジは収益とともに上昇した。収益が10倍異なるごとに、7.6ポイント増加した。AIなしの書籍では、対応する関係は統計的にゼロと区別できなかった。
このパターンは示唆的だが、慎重な表現が必要である。この指標が検出するのは、集計されたテキスト上の重なりである。どのモデルが一節を生成したか、特定の書籍へのアクセスを証明するか、個別の作品からの複製を立証するかは示さない。
著者らもこの限界を明確に認めている。特徴的な重なりは、一般的なジャンルの影響、学習データの想起、編集上の選択、繰り返し用いられる資料など、複数の過程から生じうる。法的結論には、統計的な類似性を超える証拠が必要だ。
それでも、この組み合わせは重要である。大量生産は人間の著者に経済的圧力をかけうる一方、成功したAI比率の高い作品は既存の言語との重なりをより多く示す。これらの知見を合わせると、誰が価値を供給し、誰がそれを取り込むのかという問いが強まる。
数字が証明していないこと
この知見は注目に値するが、依然として一つの観測市場と一つの分類システムから得られた証拠である。
この論文は査読中の作業草稿であり、完成した査読済み出版物ではない。批判、追試、追加分析を受けて、手法や結論は変わる可能性がある。読者はその主張を、重要な予備研究として受け止めるべきだ。
第一の不確実性はAI検出に関するものだ。研究者らはPangramの全文検出器を使用し、すべての書籍にパーセンテージのスコアを付与した。検出器の出力には、特に編集された散文や変化するモデル群をまたぐ場合、偽陽性と偽陰性が含まれうる。
全文分析は、短いプレビューを判断するよりも強力である。分類器により多くの材料を与え、研究者が複数の閾値を検証できるためだ。それでも、サンプルを大きくしても体系的な検出誤差がなくなるわけではない。
「AIテキストなし」というラベルも、AIテキストが検出されなかったことを意味する。それは完全に人間によるプロセスを保証するものではない。同様に、25%を超えるスコアも、フラグが立ったすべての文章が生成モデルから直接生じたことを証明するわけではない。
研究では、閾値の変更や検出器ドリフトの可能性に関する頑健性チェックも報告されている。これらのチェックは分析を強化する。ただし、著者やプラットフォームの制作記録に照らした独立検証の代わりにはならない。
第二の不確実性はサンプルの境界にある。データセットは、特定の期間に発売されたセルフパブリッシングのジャンル小説電子書籍に焦点を当てている。ロマンス、ミステリー、ファンタジー、ホラー、SF、および関連カテゴリーが分析の中心を占める。
これらの市場は、読者が親しみのある定型や頻繁な新刊を求めることが多いため、量を研究するのに適している。しかし、あらゆる出版分野を代表するものではない。学術書、文芸小説、児童書、ノンフィクション、伝統的な出版社から刊行される作品は、異なる仕組みで動いている。
販売パネルも、大手出版社が維持する独自のものである。論文によれば、これは日次の電子書籍販売冊数の大部分を追跡している。外部の研究者は、公開論文だけでこのシステムを完全に監査することはできない。
第三の不確実性は因果関係である。AIへの曝露が増える一方で一冊あたりの収益は減少し、より曝露の大きいジャンルでは下落幅も大きかった。こうしたパターンは希薄化を支持するが、同時期にはほかの要因も変化していた。
広告環境、サブスクリプション行動、ジャンルの人気、価格設定、季節ごとの刊行、プラットフォームのアルゴリズムは、いずれも販売に影響しうる。著者らは固定効果と比較を用いて、別の説明を減らしている。それでも観測データでは、無作為化された市場を再現できない。
読者は、より大きなカタログから利益を得る可能性もある。書籍が増えれば、より幅広い選択肢、より速い刊行ペース、追加のニッチな作品が生まれうる。研究者らは、その証拠だけでは市場全体の福祉効果を決定できないと述べている。
人間の著者の平均収益が失われる一方で、一部の読者は選択肢の増加から利益を得るかもしれない。AI支援を利用するライターも、アクセシビリティを改善したり、そうでなければ存在しなかったはずのプロジェクトを完成させたりできる。こうした利点は希薄化を打ち消すものではないが、政策判断を複雑にする。
Hacker Newsの枠組みは、別の限界ももたらす。短い議論スレッドは、論文への注目を集めることはできても、代表的な世論の判断を生むわけではない。4件のコメントと15ポイントは初期の関心を示すにすぎず、幅広い技術的コンセンサスを意味しない。
最も責任ある結論は、より限定的なものだ。このデータセットには、検出されたAI供給の増加と、一作品あたりの成果の悪化との明確な関連が含まれている。もっともらしいメカニズムを提示しているが、出版全体にわたる普遍的な害を証明するものではない。
洪水が拡大し続けるかを示す三つのシグナル
次の段階は、プラットフォームの透明性、独立した追試、市場希薄化に対する法的扱いにかかっている。
第一のシグナルは、AmazonがAI開示をどう扱うかである。現在のルールでは出版社から情報を収集しているが、読者に一律の公開ラベルは提供されていない。可視化された開示制度は、購買行動に関する新たな証拠を生み出すだろう。
Amazonが信頼できるラベルを公開すれば、研究者は読者がAI生成書籍を避けるのか、あるいは特定のジャンルでは受け入れるのかを検証できる。ラベル表示後も販売が安定していれば、成功が隠された制作手法に依存しているという主張は弱まる。
公開ラベルがすべての問題を解決するわけではない。出版社が制作プロセスを誤って報告する可能性がある一方、AI支援コンテンツとAI生成コンテンツはしばしば連続体の上に位置する。ただし、プラットフォームのデータは検出器に基づく推論より有用になる可能性がある。
第二のシグナルは独立した追試である。研究者には、異なる検出器、市場、期間、販売データセットを使った比較可能な研究が必要だ。複数のプラットフォームで同様の結果が得られれば、希薄化が一般的なクリエイティブ市場のメカニズムを反映するという論文の主張は強まる。
相反する結果にも価値がある。それによって、Kindle Unlimited、ジャンル小説、あるいはAmazonのランキングシステムが異例に強い効果を生み出していることが分かるかもしれない。その場合、注目は生成AIだけからプラットフォーム設計へと移る。
追試では、量と可視性も分けるべきだ。刊行数は供給を示す一方、インプレッション、検索、レコメンドの掲載位置、広告オークションは注目を明らかにする。こうしたデータは、実際にどこで置き換えが起きているのかを明確にするだろう。
第三のシグナルは、裁判所がAI著作権訴訟で市場に関する証拠をどう扱うかである。裁判官は、生成作品による拡散的な競争が従来の市場影響分析に含まれるかを判断しなければならない。また、いかなる損害も、法的に重要な複製と結び付けなければならない。
copyrightability guidanceはすでに、人間による創造的なコントロールと純粋に生成された出力を区別している。学習をめぐる紛争は、モデルを構築するために用いられた素材について、別の問いを投げかける。
将来の判決は、市場希薄化を関連する証拠として認めることで、この論文の重要性を強めうる。逆に、特定の学習行為が保護された著作物を含む代替を引き起こしたことについて、より厳密な証明を求めることで、その重要性を弱めることもできる。
プラットフォームは、最終的な法的回答を待つ必要はない。Amazonは、刊行速度、顧客からの苦情、返金行動、反復的なメタデータ、未開示の生成を調査できる。こうした運用上のシグナルは、法廷の法理より早く重要になるかもしれない。
著者も同じ指標を注視すべきだ。読者の需要がそれに伴って伸びるなら、カタログの拡大は管理可能である。作品数が販売より速く増え、一冊ごとに縮小する注目の取り分を奪い合うようになると、危険は増す。
Hacker Newsでの議論は一つの論文から始まったが、次の証拠は市場とプラットフォームから得られなければならない。AmazonがAIラベルを可視化するか、独立したデータセットが希薄化を再現するか、裁判所がそのメカニズムを認めるかを見守るべきだ。
読者にとって、直ちに取れる行動はよりシンプルである。本を選ぶ際は、表紙、ランキング、刊行頻度だけを見ないことだ。信頼できる著者をフォローし、文章を注意深く試し読みし、プラットフォームにより明確な制作ラベルを求めよう。より良い発見のシグナルは自動化された出版を止めないが、規模だけが勝ち続けるかどうかを左右しうる。



