top of page

日本 AI 购书让二手书店销量增至 5 倍,但这些书可能一去不返

2小时前
讀畢需時 13 分鐘

据报道,日本 AI 购书潮已将一些二手书店的日销量推高至平日的五倍。这波意外的繁荣背后,却隐藏着一个令人不安的可能性:许多被买走的书可能会被扫描、拆解,并永久退出流通。

据 Tom’s Hardware 援引的日本媒体报道,部分书店一次收到数百本书的订单。多名看似彼此独立的买家据称都将订单寄往冈山县同一物流中心。有记录显示,一批重达 50 吨的日文书籍被运往美国。

买家的身份尚未公开,物流运营商也拒绝回应问询。现有证据并不能证明每笔订单都与 AI 公司有关。不过,这种采购模式与 Anthropic 曾在美国采用的一种已获记录的流程相似。

该流程会购买实体书籍,拆除装订、扫描每一页,并保留可检索的数字副本。随后,印刷页面会被销毁。联邦法官后来将这一路径与 Anthropic 获取数百万本盗版数字书籍的行为区别对待。

因此,核心矛盾远不止于一次异常的销售增长。日本书店今天获得了可观收入,而研究者和读者明天可能面临书源短缺。交易将信息保存在私有数据库中,却可能摧毁提供这些信息的公共实体副本。

日本二手书热潮背后是身份不明的买家

书店层面的销售激增确有其事,但大宗买家的目的与身份仍未得到证实。

日本拥有深厚且多样的二手书市场,包括全国连锁店、专业书商、社区书店,以及库存分布在多个仓库的在线卖家。这种分布使其适合快速汇集广泛的语料库。

语料库是用于搜索、分析或 AI 训练的大型文本集合。印刷书籍提供经过编辑的人类创作内容,而这些内容往往无法通过常规网页爬取获得。较早出版的书籍也早于机器生成文本在互联网上普及的时期。

最新的采购活动似乎正聚焦于这类材料。根据最初的大宗订单报道,部分书店称,在线销售额有时会升至平日的五倍。一些订单包含数百本书,而非普通消费者规模的购物篮。

购买书目的构成同样引发疑问。小说和漫画通常在许多消费者订单中占主导地位,但据报道,这些采购涉及哲学、政治史、医学、法律和社会史等多个领域。其中一个例子是有关江户时代生活与文化的书籍。

这种广度看起来不像个人收藏,更像是在构建数据集。读者通常会围绕作者、类型、时代或具体研究问题选书;而数据买家更看重多样性、整洁的元数据,以及足够的规模来提升统计覆盖度。

这些订单据称来自多个账户,但许多账户都要求配送至冈山县同一物流中心。这个共同目的地是一条重要线索,但并不能据此确认最终客户。

物流中心可以为出口、转售、仓储、图书馆处理或数字化工作集中书籍。该运营商据称拒绝说明其角色。在缺少发票、合同或具名客户的情况下,将订单归因于某一家特定 AI 开发商只能是猜测。

那批 50 吨的货物提供了更有力的历史背景。日本媒体报道称,有记录显示该批书籍被运往美国,用于与 Anthropic 相关的扫描工作。但这并不能证明 Anthropic 下达了当前寄往冈山县的订单。

同样,据称一家身份不明的外国公司曾联系日本西部一家书店,希望收购数万本书。这一询价表明海外存在工业规模的需求,但买家的目的与身份依然未明。

这一区分很重要。现有证据支持这样报道:可疑的大宗采购正在发生;也支持人们担忧部分书籍可能正被收集用于破坏性扫描。但它并不支持将每一笔销售都描述为已确认的 Anthropic 采购。

更准确的结论应当更为克制。日本 AI 购书似乎已达到普通零售行为难以解释的规模。在这些书籍消失于不透明供应链之前,其配送路径和选书范围值得审视。

为什么 AI 公司仍然想要实体书

实体书能够解决大规模 AI 开发商自己加剧的数据质量问题,同时为买家提供比盗版图书馆更清晰的获取记录。

大型语言模型从海量文本集合中学习统计模式。文本质量会影响模型处理推理、文风、专业词汇和事实关系的能力。书籍提供连贯、结构化的论述,这是短篇网页很少能匹敌的。

书籍还涵盖了从未在网上免费公开的知识。地方史、专业手册、学术著作、旧译本和绝版书可能仅以纸本形式存在。对于希望提升非英语能力的模型而言,日文藏书尤其有价值。

这一时机也反映出人们日益担忧合成数据污染。自生成式 AI 广泛普及以来,网络上的机器撰写页面不断增多。爬虫如今可能吸收由早期模型生成的文本,其中包括错误和重复的文风模式。

人类创作的书籍提供了更干净的替代来源。生成式 AI 热潮之前出版的作品,不太可能包含现代聊天机器人的输出。它们的出版过程通常也包含编辑、事实核查和一致的组织结构。

这并不意味着每一本印刷书籍都准确或有用。它意味着,书籍是经过有意组织的人类语言中相对密集的来源。对于在多语言表现上竞争的 AI 开发商而言,这类材料可能难以替代。

法院记录显示 Anthropic 对书籍的重视程度。在 2025 年的合理使用裁决中,William Alsup 法官写道,该公司将书籍视为通往顶级语言模型的一条高性价比路径。

Anthropic 最初从多个来源获取数字副本。法院认定,该公司从 Books3 下载了 196,640 本书,从 Library Genesis 下载了至少 500 万本,从 PiLiMi 下载了至少 200 万本。

裁决称,这些集合含有未经授权的副本。即使某些书籍未被选入训练混合数据,Anthropic 仍保留了一个永久性的中央图书馆。该决定带来了与模型训练本身相区分的法律风险。

该公司后来转向实体书采购路径。2024 年,它聘请了 Tom Turvey;后者此前曾负责 Google 图书扫描项目的合作事务。他的任务是获取极其广泛的图书收藏,同时避免重蹈此前的法律问题。

Anthropic 购买了数百万本实体书,其中许多为二手书。承包商拆除装订、分离书页、进行扫描,再将图像转化为机器可读文本。公司保留了由此生成的数字文件。

这套流程解释了为何二手书市场具有吸引力。二手副本可从大量卖家处采购,购买行为也会形成常规交易记录。买家还可以通过国际标准书号,即 ISBN,锁定特定版本。

ISBN 用于识别某一特定书籍版本及其装帧形式。它帮助买家避免重复购买、将扫描件与元数据关联,并追踪语言或出版信息。当订单包含数千种彼此无关的书目时,这些能力尤为重要。

破坏性扫描比逐页拍摄装订完好的书籍更快。书脊被拆除后,散页可通过高速扫描仪。光学字符识别随后将页面图像转换为可检索文本。

这个流程以保存为代价换取处理速度。除非有人事先将其分开,一册珍稀书与一本常见平装书可能会进入同一套机械流程。最终数据集得以保存,但购入的实体书不会。

这一机制使日本订单可能与 AI 采购有关的推测具有合理性,但并不能证明这种关联。不过,对干净日文文本的需求,加上一套已有记录的工业化流程,足以让书店业主产生合理担忧。

日本 AI 购书将收入转化为保存风险

核心的反转很简单:一笔帮助书店的交易,仍可能削弱促成这笔交易的图书市场。

对卖家而言,单日销量增长五倍通常是好消息。二手书店面临有限的空间、不稳定的需求,以及可能多年卖不出去的库存。大宗订单能够释放仓储空间,并将滞销书转化为收入。

许多被购入的书也可能只是普通的多余副本。销毁一本常见的平装书,并不会让其内容从世界上消失。当保存成本超过潜在需求时,书店也会例行丢弃损坏或不受欢迎的库存。

当买家按元数据而非稀缺性采购时,问题就会加剧。大型采购系统可能将一本绝版的地方研究著作视为与任何其他 ISBN 相同的商品。它或许不会意识到,列出的这一本已是市场上所剩无几的副本之一。

书籍完成扫描后,实体书可能被制成纸浆。其文本或许只会存在于私营企业的内部资料库中。图书馆、研究者、收藏家和未来读者不会自动获得该数字版本的访问权。

这种结果不同于保存项目。图书馆会将脆弱材料数字化以扩大获取范围,并在可能时保留原件。私有 AI 语料库的主要目标是改进商业模型,而不是充当公共档案馆。

这种区别也会影响核验。研究者需要稳定的版本、页面图像、注释、插图和实体语境。纯粹提取出的文本可能遗漏边注、版式、字体、图表,以及版本历史的痕迹。

日本出版业使这个问题尤为敏感。许多作品印量有限,且从未推出数字版。地方史和较早的技术文本可能在未引起全国关注的情况下从市场消失。

二手书店构成了一个非正式的保存网络。它们的书架使不再被私人收藏者需要的书籍仍能等待下一位读者。即使每一笔单独交易都是合法的,以工业规模移走书籍也会改变这一网络。

这种压力分布并不均衡。大型连锁店可从许多分店补充热门书目。小型专业书商则可能拥有耗费数十年积累的独特库存。一笔广泛的大宗订单,就可能永久改变这些书店所能提供的内容。

这并不意味着批量购买本身不正当。书籍所有者有权出售自己的库存,许多人也确实需要这笔收入。买家将图书数字化同样有正当理由,包括无障碍访问、检索、学术研究和语言技术。

问题在于缺乏知情选择。书店可能认为自己是在向读者、图书馆或收藏家供货。若买家的实际意图是拆解每一本书,卖家便无法按自身的保存标准作出判断。

一些所有者可能会拒绝涉及稀缺资料的此类订单。另一些人可能会调整定价、保留一本副本,或要求对珍本采用非破坏性扫描。中间商若隐瞒最终用途,他们便无法作出这些决定。

因此,日本的 AI 图书收购造成了一种市场信息失灵。卖家知道书名和数量,却未必知道货物的去向或用途。买家知道预定流程,却可以将订单分散到多个账户。

结果是价值的短期转移。书店获得现金,而买家同时获得实体物品及其数字化内容的排他控制权。公众可能在未意识到损失已经发生的情况下失去获取这些书的机会。

这正是为何这一事件并不只是 AI 公司为训练数据付费的问题。付款解答了获取方式的一个问题,却没有解决保存、透明度、授权,或持续流通所具有社会价值的问题。

购买图书并不能解决版权问题

实体副本的所有权与复制其文本的许可是两项不同权利,而 AI 训练在各司法辖区的合法性仍存在争议。

买家通常可以转售、出借、改造或销毁一本合法购买的图书。版权法仍限制对受保护表达的复制与使用。AI 扫描让这两项原则直接发生冲突。

在 Anthropic 一案中,联邦法院将获取行为与训练行为区分开来。Alsup 法官认为,根据其面前的事实,企业使用合法取得的图书进行训练具有转换性。该裁决并未为所有 AI 系统创设普遍豁免。

法官还区分了 Anthropic 的实体书扫描与其从盗版图书馆下载的文件。购买印刷本并将其转换为内部使用,获得了更有利的对待;明知而保留数百万盗版文件则没有。

这一区别也是实体书如今具有战略价值的原因之一。可追溯的购买记录或许能降低一类法律风险,但并不能消除有关复制、市场损害、数据透明度或不同国家法律的索赔。

Anthropic 后来同意解决涉及其盗版副本的索赔。拟议和解涵盖约 50 万部作品,并要求销毁从受到质疑的数字图书馆获得的原始文件。

这项版权和解并未认定破坏性扫描本身违法。它凸显了一个事实:即便法院将模型训练视为具有转换性,获取方法依然可能至关重要。

作者和出版商仍对广泛的训练主张持怀疑态度。Authors Guild 已追踪约十余起美国版权案件,涉及图书及其他受保护材料。被告包括 Anthropic、OpenAI、Microsoft、Meta、Nvidia、Google、Bloomberg 和 Databricks。

这些待审 AI 案件涉及不同的数据集、模型、原告和法律理论。单一判决不能自动适用于所有案件,上诉也可能改变当前的法律解释。

日本为分析增加了另一套法律体系。日本版权法包含在特定条件下允许信息分析的条款。其适用取决于目的、对作品的享受,以及对权利人可能造成的损害。

一次海外运输可能涉及多个环节与司法辖区。一本书可能在日本购得、在冈山集货、在美国扫描,并由一家全球运营的公司使用。每一步都会产生不同的事实问题。

目前的报道并未披露这些合同,也未说明谁选择书目、谁拥有扫描件,或出版商是否获得授权费用。这些信息缺口使人无法就合法性作出确切结论。

同样的谨慎也适用于销毁问题。关于 Anthropic 早期工作流程的报道显示,大规模破坏性扫描确实存在,但并不能证明所有经由冈山中心流转的图书都将被制浆处理。

其中一些可能在非破坏性成像后转售,另一些可能被储存或按普通出口流程处理。在买家、物流供应商、扫描服务商或运输记录提供更多细节之前,最终处置方式仍只是一项指控。

这种不确定性不应终结调查,反而界定了调查方向。最有力的报道并非点名一个没有证据支持的责任方,而是指出检验该主张所需的记录。

书店可以保留账户信息、订单清单、运输标签和异常往来。出口记录可以确认目的地与重量。扫描承包商则可在不披露受保护客户数据的前提下说明其保存政策。

出版商和作者也可以询问,新近获取的日语数据集是否获得授权。模型开发商越来越多地介绍安全方法和计算资源,但训练数据的获取过程仍远不够透明。

法律争议仍将继续,但透明度可以在法院作出最终裁决前得到改善。买家可以披露用途、保护稀缺副本,并向权利人提供有实质意义的信息。这些措施都无需暴露模型架构。

下一步证据必须来自供应链

三个信号将决定,这究竟是暂时的零售异常,还是日本出版物被工业化转移至私人 AI 档案库。

第一个信号是确认最终买家。多项采购账户并不能证明存在多名客户,尤其当所有货件都汇集至同一设施时。合同或出口文件可能将该设施与扫描公司或 AI 开发商联系起来。

确认客户身份将加强 AI 获取理论。若证据表明这是普通出口、图书馆转售或商业归档,则会削弱该理论。无论结果如何,都将以可追责的保管链取代猜测。

第二个信号是对稀缺图书的处理方式。卖家应追踪买家是选择常见重复本,还是搜罗每一个符合条件的 ISBN。包含绝版学术著作和地方史资料的订单尤其值得关注。

若买家排除稀缺副本,保存方面的担忧将会降低;采用非破坏性扫描则会进一步降低这种担忧。若流程在未经稀缺性筛选的情况下销毁图书,则会印证人们对永久性文化损失的担忧。

第三个信号来自 AI 开发商的披露。企业可以说明是否正在购买日文印刷藏书、承包商是否销毁原件,以及如何处理版权问题。沉默将使中间商和书店承担声誉压力。

开发商还可以说明扫描件是保持私有,还是支持公共保存副本。私有语料库为一家公司提供商业价值;可访问的档案至少能为读者和研究者保留部分收益。

这些信号的意义不止于日本。欧洲和美国的书商也曾报告,与 AI 训练数据需求相关的异常批量订单。若出现可重复的国际模式,将表明这是一种协调化的数据采购产业,而非零星收藏行为。

这也会改变竞争格局。模型开发商过去主要竞争计算能力、工程人才和互联网规模数据集;如今,他们也在竞争尚未自由流传于网络上的、经过筛选的人类知识。

这种竞争使书商处于陌生的位置。他们不再只是服务读者的零售商,其目录可能成为预算远高于自身、却鲜少公开露面的企业的上游数据基础设施。

所有者无需拒绝每一笔批量销售。他们可以在不放弃新增收入的前提下引入保障措施,例如数量审查、稀缺性核查、买家声明,以及对破坏性使用的单独批准。

交易平台也可以标记共享目的地的协同账户。跨越无关学术主题的大额订单未必存在滥用行为,但对于决定是否释放稀缺库存的卖家而言,这仍是有用信息。

图书馆、出版商和大学也应关注同样的模式。专业书目突然消失,可能在官方流通统计显示短缺之前就影响研究。共享观察名单可以更早识别脆弱作品。

读者同样可以发挥作用。任何出售继承藏书的人,在选择最快的批量买家前,都应考虑独特资料是否应进入图书馆或档案馆。一旦珍本进入破坏性处理流程,这一决定便无法逆转。

当前日本的销售激增,可能会在现有收购目标完成后消退。若果真如此,书店可能会遭遇所有者担心的反转:收购期收入上升,随后因优质库存更难补充而下降。

更持久的问题关乎谁控制由此产生的知识。扫描图书可以改善语言工具、搜索系统,以及残障人士的访问体验。但这些好处并不需要保密或不必要的销毁。

因此,对日本 AI 图书收购的评判,应取决于购买之后发生的事情。稀缺作品是否受到保护?创作者是否得到告知?研究者能否访问保存的副本?买家是否接受公众问责?

在这些答案浮现之前,负责任的结论仍应保持谨慎。书店账户记录证实了这些批量订单,而与 AI 的关联虽有力地得到暗示,却尚未得到完整验证。只有当图书进入扫描仪时,风险才会变得不可逆转。

关注冈山供应链、绝版书目的命运,以及主要模型开发商的披露。这三个信号将揭示,一场零售热潮是否已演变为对文化记忆的隐秘转移。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)和M-Chip Mac 。

你的 AI 工作伙伴

和 remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page