Hacker News 发现 AI 图书泛滥,人类作者正在失去阵地
- Ethan Carter

- 1天前
- 讀畢需時 14 分鐘
Hacker News 上出现的一项针对 14,419 本图书的研究,挑战了为 AI 生成小说辩护时最常见的说法:读者自然会忽略那些质量差的内容。研究人员发现,检测出含有大量 AI 文本的图书,平均而言销售表现较差。然而,其庞大的数量仍从其他图书手中攫取了销量、收入和稀缺的排名位置。
这篇工作论文于 2026 年 7 月提交,目前仍在评审中。论文考察了主要通过 Amazon 销售的自出版类型小说,作者来自 Stony Brook University、Columbia Law School、University of Michigan 以及 MIT Initiative on the Digital Economy。
他们的核心主张并非 AI 能写出更好的小说,而是生成式 AI 即使未在质量竞争中胜出,也能重塑创意市场。低廉的生产成本让出版者能够推出足够多的图书,从而将有限的读者注意力分散到更多书名之间。
这一差异对作者、出版平台和 AI 公司都至关重要。它还为版权法庭提供了有关“市场稀释”这一争议理论的新证据。根据该理论,AI 产出即使单项表现不佳,也可能凭借规模对市场造成损害。
这项研究提供了罕见的详细证据,但并未解决所有问题。其 AI 分类依赖文本检测器,而市场数据仅覆盖 Amazon 小说中经过筛选的一个细分领域。分析同样属于观察性研究,因此其中最强的模式并不能证明每一次下滑都完全由 AI 单独造成。
尽管如此,结果使得一个结论难以忽视:当生产规模接近工业化水平时,较低的平均质量并不会阻止自动化内容获得经济上的重要性。
Hacker News 论文究竟发现了什么
这项研究发现的是供给冲击,而不是 AI 畅销书的全面接管。
研究人员分析了 2023 年 1 月至 2026 年 3 月期间发行的 14,419 个书名。他们将全文 AI 检测结果与截至 2026 年 6 月的每日销售观察数据进行了匹配。样本涵盖八个自出版类型小说类别群。
每个书名被归入三组之一。未检测到 AI 文本的图书得分为零。轻度 AI 图书的检测 AI 文本占比不超过 25%。大量 AI 图书则超过了这一阈值。
这些标签描述的是检测器输出,而非法律意义上的作者身份。它们无法证明某位署名作者使用了某个特定模型,也不能证明侵权,或确定某段文字由谁生成。
在样本中,大量 AI 图书占书名总数的 20%。不过,它们仅贡献了观察到的首发窗口销量的 12.1% 和收入的 11.3%。未检测到 AI 文本的图书占书名总数的 62.9%,却获得了 71.7% 的销量。
这一结果支持了人们熟悉的批评:AI 占比较高的图书在单本表现上较为逊色。然而,市场层面的趋势指向另一方向。它们在观察销量中的份额,从 2023 年初几乎为零,上升至 2026 年第二季度约五分之一。
它们的存在也进入了市场顶端。研究人员依据 Amazon 销量排名中位数,在每个类型内构建了每周 Top-25 组。含有大量 AI 文本的新入选书名最终占这些组新增书名的 31%。
未检测到 AI 文本的图书仍在领先书名中占多数。即便如此,到 2026 年第二季度,轻度 AI 图书和大量 AI 图书在构建的 Top-25 席位中合计占比已接近 40%。
因此,研究将平均表现与总体压力区分开来。单本 AI 占比较高的图书可能销售不佳,但数千本类似的新书合计仍能占据相当可观的注意力。这正是论文标题背后的机制,也是其最有力的发现。
研究人员的增长指标让这种反差更加清晰。累计发行书目规模增长至 2023 年初水平的 38.3 倍。季度在售书名增长 19.2 倍,单位销量增长 7.3 倍,收入增长 8.9 倍。
这些数字并不意味着整个 Amazon 书目以这些速度扩张。它们描述的是研究中观察到的发行批次和指数化样本。不过,这一内部差距十分显著,因为供给增长远快于需求。
更多书名正在争夺每一笔销售。因此,在 2023 年和 2025 年批次之间,八个类型群中有六个的每本在售图书收入下降。对于未检测到 AI 文本的图书而言,八个类别中有七个出现下降。
最后这一结果支撑了稀释论点。平均值的下降并不只是因为表现较弱的 AI 图书进入了分母。被归类为不含 AI 文本的图书,在后续批次中的收入同样更低。
AI 图书市场稀释通过规模发挥作用
生成式 AI 通过让重复生产比重复发现更容易,改变了出版业的经济模式。
传统图书生产存在若干天然限制。起草需要时间,编辑需要投入注意力,每次发行都伴随机会成本。生成式 AI 降低了起草这一约束,尤其是在围绕重复情节和熟悉人物类型构建的公式化类别中。
研究并未声称每位 AI 使用者都会变得高产。研究人员考察了 824 个署名身份在首次发行大量 AI 图书前后的情况。在后来发行更多大量 AI 图书的 385 个身份中,有 287 个提高了月度产量。
这一 74.5% 的比例说明,平均质量并非完整的衡量标准。作者或内容生产者不需要每个书名都成功。庞大的作品组合可以将风险分散到不同类型、笔名、封面、关键词和发行日期之中。
由此产生的竞争发生在多个层面。图书会争夺搜索位置、推荐席位、分类排名、订阅阅读、广告曝光,以及读者有限的浏览时间。每增加一个书名,就多了一个争夺这些受限位置的候选者。
这使出版业类似于其他被低成本内容淹没的算法市场。稀缺资源不再是生产某件内容的能力,而是在正确时机将其呈现给买家的能力。
研究人员发现,在大量 AI 书名占据更多书目的地方,压力更强。未检测到 AI 文本的图书在低暴露组中占据了约 88% 的构建 Top-25 位置;在最高暴露组中,这一比例降至约 63%。
在 Kindle Unlimited 参与度更高的类型中,这种关系更为显著。Kindle Unlimited 让读者可以访问共享订阅书目。由于新书进入同一阅读选择池,这种结构会加剧竞争。
在 Kindle Unlimited 占比较高的类型中,非 AI 图书在销量份额上的优势小了 8.5 个百分点,在收入份额上的优势小了 8.4 个百分点。这些是经调整后的关联,而非实验性估计。
该系统同样奖励高频发行节奏。内容生产者可以测试更多书名,观察哪些组合会吸引读者,并重复成功模式。以较慢周期创作的人类作者面临着不同的风险状况。
一位小说家可能花数月打磨一次发行。以 AI 为中心的运营则能将相近的生产投入分配到许多图书上。即使大多数失败,这种运营模式也获得了更多进入推荐或找到响应性细分市场的机会。
这正是论文真正的颠覆之处。AI 小说不需要说服每一位读者它很好。它需要做的,是让出版成本足够低,使少数成功发行能够弥补大量失败作品所构成的长尾。
研究中的顶尖表现者表明,这条长尾中可能存在具有商业意义的例外。排名靠前的大量 AI 图书达到了显著的单位销量。排名前 15 的书名还在符合条件的样本中攫取了大量 AI 图书收入中的可观份额。
这些成功案例并不能证明自动化生产必然带来成功。它们表明,市场中存在一条从高产量试验走向可观销量的可行路径。这条路径改变了每一位竞争性生产者的激励。
人类作者面临的是注意力问题,而不只是质量问题
即使人类作者能写出更好的书,当平台接收的库存远超读者吸收能力时,他们仍可能失去曝光。
围绕出版的讨论往往假定,读者判断会解决 AI 内容问题。按照这种观点,质量较差的图书会收到差评、从排名中消失,而严肃作者基本不会受害。
这项研究说明了为何这一筛选机制并不完整。读者发现图书发生在其能够评价整本书之前。买家通常先看到封面、书名、简介、短篇试读、类别位置、推荐内容或广告。
因此,低质量图书即使最终未完成销售,也能消耗注意力。它可能占据一个搜索结果、触发一次曝光,或进入一个推荐集合。这些事件都不要求读者读完该书。
排名位置形成了更紧的瓶颈。一个类别可以展示许多图书,但只有少数能获得显著位置。每一本成功进入其中的 AI 占比较高图书,都会将另一本书挤出这个可见群体。
压力不止存在于单本小说之间的直接竞争。不断增长的书目还提高了区分真实作者、可信出版商和经过精心编辑作品的成本。读者在做出选择前,必须评估更多不确定信号。
公开标注或许能降低这种不确定性,但 Amazon 目前只做出有限区分。其 KDP 内容规则要求出版者向 Amazon 说明 AI 生成的文本、图像或翻译内容。
Amazon 将 AI 生成内容定义为由 AI 工具创建的材料,即使后来由人进行了大幅编辑。对于头脑风暴、错误修正或其他 AI 辅助工作,只要创作者完成最终文本,就不要求披露。
披露信息在出版过程中提交给平台。Amazon 的规则并未承诺为每一本披露过的书名提供面向客户的可见标签。这在平台所知与读者所知之间造成了差距。
这一差距是研究的核心。作者报告称,数据集中的图书没有一本公开披露是否包含 AI 制作的内容。因此,读者在购买前无法可靠地区分研究中检测出的各组。
在作者和倡导组织提出担忧后,Amazon 于 2023 年推出了披露要求。根据一篇Associated Press 报道,Authors Guild 当时称此举是有用的第一步,但敦促提高公开透明度。
该平台面临艰难的内容审核问题。严格的标签制度需要关于生产方式的可靠信息。自行申报可能失效,而自动检测可能错误分类经过编辑的作品、翻译散文或独特的人类写作风格。
较宽松的政策能减少错误指控,却让读者获得的信息更少。它也让内容生产者可以从模糊性中获益。精致的封面和看似可信的简介,可能掩盖底层文本的创作速度。
即使人类作者避免使用 AI,也必须应对这种不确定性。他们可能需要更强大的社群、与读者的直接关系、更鲜明的系列辨识度,或更一致的作者身份佐证。这些活动会占用原本可用于写作的时间。
当创作者需要记录草稿、来源、修订和编辑决策时,知识管理也变得更加重要。一个可搜索的个人知识库可以保留这条创作轨迹,而不必迫使作者进入一套独立的行政管理系统。
更深层的问题并不在于 AI 是否应当进入作者的工作流程。编辑辅助与自动化规模化生产会产生截然不同的市场影响。当前的平台店面并不总能让读者看见这种差异。
版权之争如今有了市场机制
该论文将 AI 训练争议与一项证据联系起来:机器生成的替代品可能挤压支撑人类创作的市场。
版权法在判断未经授权的使用是否构成合理使用时,会审查多个因素。其中一个重要因素涉及对受版权保护作品潜在市场的影响。
生成式 AI 让这一分析变得复杂。模型可能在训练时使用书籍,却不会在任何单一输出中复现完整书名。然而,它能够支持创作大量与同类书籍竞争的新作品。
该论文将研究结果与 Kadrey v. Meta 联系起来,这是一起涉及作者与模型训练的版权案件。在该诉讼中,法院审议了一种市场稀释理论,但认定原告未能为此提供足够证据。
研究人员弥补了其中部分证据缺口。他们的研究考察含有大量检测到的 AI 文本的书籍,是否进入了与其他书籍相同的市场;随后衡量随着 AI 暴露增加,销量、收入和排名发生的变化。
研究结果与稀释理论一致,但论文无法裁定责任。版权侵权取决于复制、受保护表达、合理使用及因果关系等法律问题。市场相关性本身无法解决这些问题。
上游与下游行为也需要区分。在受版权保护的书籍上训练模型是一种行为;用户生成并出版一部竞争性小说是另一种行为;平台将该小说与人类创作的书籍并列排序,则增加了第三层因素。
美国版权局已将市场影响视为训练争议的重要部分。其 2025 年分析认为,当输出内容在相关创意市场中形成竞争时,商业训练获得合理使用保护的可能性会更弱。这一评估仍属于政策指引,而非普遍适用的法院裁决。
当前研究在抽象的法律担忧与可观察的市场行为之间提供了一座可能的桥梁。它表明,替代不必表现为复制版取代原作。数以千计、可宽泛替代的类型作品,能够将伤害分散到众多作者身上。
该论文还分析了与现有书籍共享的独特语言。它将罕见表达定义为:至少包含五个单词、且在不超过五卷 Google Books 书籍中出现的词序列。这些表达还必须不存在于一个规模庞大的通用网页快照中。
在每个比较组中收入最高的 50 本书里,大量 AI 文本书籍展现出更高的罕见表达覆盖率。其平均值达到 45%,而未检测到 AI 文本的书籍为 37.7%。
在收入最高的 200 本大量 AI 文本书籍中,罕见表达覆盖率也随收入增长而上升。收入每相差十倍,覆盖率增加 7.6 个百分点。未使用 AI 的书籍中,对应关系在统计上无法与零值区分。
这一模式颇具启发性,但需要谨慎表述。该指标检测的是总体文本重叠;它并不能识别哪一个模型生成了某段文字,证明模型接触过某本特定书籍,或确立对某一作品的复制。
作者明确承认了这一限制。独特重叠可能来自多种过程,包括常见的类型影响、训练数据回忆、编辑选择,或反复使用的源材料。法律结论需要统计相似性以外的证据。
即便如此,这种组合仍然重要。高产量生产可能在经济上压迫人类作者,而成功的重度 AI 作品又展现出与既有语言更多的重叠。两项发现共同强化了这样的问题:谁在提供价值,又是谁在攫取价值。
这些数字不能证明什么
这些发现值得关注,但它们仍是来自一个观察市场和一种分类系统的证据。
该论文是一份正在审稿的工作草稿,而非已完成的同行评审出版物。其方法和结论可能会在批评、复现或进一步分析后发生变化。读者应将其主张视为严肃的初步研究。
第一项不确定性涉及 AI 检测。研究人员使用 Pangram 的全文检测器,并为每本书赋予百分比评分。检测器输出可能包含假阳性和假阴性,尤其是在经过编辑的文本和不断变化的模型家族中。
全文分析比判断短篇预览更可靠。它为分类器提供更多材料,并让研究人员得以测试多个阈值。然而,更大的样本并不能消除系统性的检测器误差。
“未使用 AI 文本”标签也只意味着未检测到 AI 文本,并不保证整个创作过程完全由人类完成。同样,得分超过 25% 并不能证明每一段被标记的文字都直接来自生成式模型。
研究报告了针对阈值变化及可能检测器漂移的稳健性检验。这些检验增强了分析,但无法替代依据作者或平台生产记录进行的独立验证。
第二项不确定性涉及样本边界。该数据集聚焦于特定时期发布的自出版类型小说电子书。爱情、悬疑、奇幻、恐怖、科幻及相关类别主导了分析。
这些市场适合研究产量,因为读者往往寻求熟悉的母题和频繁更新。它们并不代表出版业的每一个细分领域。学术书籍、文学小说、儿童读物、非虚构作品和传统出版书籍的运作方式各不相同。
销售面板同样是专有系统,由一家大型出版商维护。论文称,它追踪了每日电子书单位销量中的很大一部分。外部研究人员无法仅凭公开论文完整审计该系统。
第三项不确定性是因果关系。随着 AI 暴露增加,单本书收入下降,而且在暴露程度更高的类型中降幅更大。这些模式支持稀释理论,但同期还有其他力量发生了变化。
广告环境、订阅行为、类型热度、定价、季节性发行和平台算法都会影响销量。作者使用固定效应和比较方法来减少其他解释的影响。观察性数据仍无法重建一个随机化市场。
读者也可能从更大的书目中获益。更多书籍可以带来更丰富的选择、更快的发行节奏和更多细分题材内容。研究人员表示,他们的证据无法判断市场整体福利效应。
人类作者的平均收入可能下降,同时一些读者获得更多选择。使用 AI 辅助的作者也可以借助工具提高可及性,或完成原本不会存在的项目。这些益处不会消除稀释效应,但会使政策决策更加复杂。
Hacker News 的讨论框架带来了另一项限制。一条简短的讨论帖可以让论文受到关注,却无法形成具有代表性的公众判断。四条评论和 15 个积分显示的是早期兴趣,而非广泛的技术共识。
最负责任的结论应当更为有限。该数据集显示,检测到的 AI 供给上升与单作品表现走弱之间存在清晰关联。它提供了一种可信的机制,但并未证明出版业各领域都存在普遍伤害。
三个信号将显示洪流是否仍在上涨
下一阶段取决于平台透明度、独立复现,以及法律如何处理市场稀释。
第一个信号是 Amazon 对 AI 披露的处理方式。其现行规则会从出版商处收集信息,但读者看不到统一的公开标签。一个可见的披露系统将为购买行为提供新的证据。
如果 Amazon 展示可靠标签,研究人员便可检验读者是否回避 AI 生成书籍,或仅在特定类型中接受它们。若标签出现后销量保持稳定,就会削弱“成功依赖于隐藏生产方式”的说法。
公开标签无法解决所有问题。出版商可能虚报其流程,而 AI 辅助与 AI 生成内容通常处于一个连续谱上。不过,平台数据可能会比基于检测器的推断更有用。
第二个信号是独立复现。研究人员需要使用不同检测器、市场、时期和销售数据集开展可比研究。若不同平台得出相似结果,将加强论文的主张:稀释反映了一种普遍的创意市场机制。
相互矛盾的结果同样有价值。它们可能揭示 Kindle Unlimited、类型小说或 Amazon 的排序系统产生了异常强烈的影响。这将把关注点从生成式 AI 本身转向平台设计。
复现研究还应将数量与可见度区分开来。发行数量反映供给,而展示量、搜索、推荐位置和广告竞价则揭示注意力。这些数据将澄清替代实际发生在何处。
第三个信号是法院如何在 AI 版权案件中处理市场证据。法官必须决定,生成作品带来的分散竞争是否属于传统市场影响分析的范围;他们还必须将任何伤害与法律上相关的复制联系起来。
copyrightability guidance已经将人类创意控制与纯粹生成的输出区分开来。训练争议则提出了另一个问题,即用于构建模型的源材料。
未来裁决若接受市场稀释作为相关证据,便可能增强该论文的重要性;若要求更严格地证明特定训练行为造成了涉及受保护作品的替代,则可能削弱其意义。
平台无需等待最终的法律答案。Amazon 可以研究发行速度、客户投诉、退款行为、重复元数据和未披露的生成内容。这些运营信号可能比法庭原则更早发挥作用。
作者也应关注这些指标。当读者需求同步增长时,书目扩张仍可控。危险在于,产出增长快于销量增长,导致每一部作品都要争夺不断缩小的注意力份额。
Hacker News 的讨论始于一篇论文,但下一批证据必须来自市场和平台。关注 Amazon 是否让 AI 标签可见、独立数据集是否复现稀释效应,以及法院是否接受这一机制。
对读者而言,眼下的行动更简单。选择书籍时,不妨超越封面、排名和发行频率。关注可信赖的作者,仔细试读文本,并要求平台提供更清晰的生产标签。更好的发现信号不会阻止自动化出版,但可以决定规模本身是否继续占据上风。


