top of page

神秘的大宗图书订单引发关于 AI 训练的疑问

Google News 揭示了一场引人注目的冲突:二手书商正收到数百份彼此毫无关联的订单,但始终无人确认这些客户的身份。英国和爱尔兰各地的卖家怀疑,AI 公司或其承包商正在购买冷门图书用于数字化。这些采购模式与已知的 AI 数据获取项目相似,但相似并不等于证据。

据报道,这些订单涵盖不同主题、语言、版本和出版日期。买家来自英国、加拿大、欧洲大陆和美国。接受原始调查采访的卖家称,一些客户使用不同姓名,却将货物寄往同一地区。

这一谜团之所以重要,是因为 Anthropic 先前曾为开发 Claude 购买并破坏性扫描了数百万本图书。法庭记录表明,收购实体图书并非一种假设性的策略,也解释了 AI 开发者为何可能更倾向于购买图书,而非使用盗版数字图书馆。

因此,核心争议并非书商与某一家已被确认的科技公司之间的对抗,而是有据可查的采购行为与不透明供应链之间的冲突。交易本身真实存在,但其被怀疑的用途仍未得到证实。

Google News 揭示了哪些图书订单信息

异常之处不只是订单规模,而是无关书目、重复买家和集中的配送模式交织在一起。

阿尼克 Barter Books 的共同所有人 Stuart Manley 告诉《卫报》,这些订单在 8 月报道发布前约三个月开始陆续到来。正常的大宗订单通常围绕可辨识的主题,例如交通、体育、军事史或区域研究。

但这些订单并非如此。其中一份被报道的清单包括 John le Carré 的《The Mission Song》爱沙尼亚语译本、Anne Brontë 的《Agnes Grey》某一特定版本,以及 1983 年 10 月号《Warship》杂志。它们唯一明显的共同点,是每一项都可以单独编目。

Manley 表示,他的公司向三名买家售出了数百本书。这些书在读者群、主题、格式或预期转售需求上都看不出关联。这种随机性让他怀疑,清单可能由机器而非人类策展者生成。

克莱尔戈尔韦 MW Books 的所有人 Jim Shaughnessy 描述了始于 5 月的类似模式。他收到的订单从有关 18 世纪非洲农业器具的书,到 20 世纪 50 年代赛车手传记,范围极广。

对于私人收藏家而言,这样的组合并不寻常;对于试图建立连贯目录的传统转售商而言,效率也很低。但如果买家是在填补大型数字语料库中的空白,便更容易理解。

巴斯 BookLovers 的所有人 David Gower-Spence 报告称,5 月至 7 月间订单激增,涉及约 200 本书;据称,一些买家也出现在其他书商的账户记录中。

一名未具名卖家告诉《卫报》,不同客户身份有时会将货物寄往同一地址。该报核查的一个配送邮编指向希思罗机场附近的货运仓库。

这一细节表明货物可能经过集中处理,但并不能确定最终目的地。货运设施通常会为转售商、回收商、图书馆、出口商和私人机构处理货件。AI 承包商只是多种可能客户之一。

订单涉及的地理范围令谜团更深。澳大利亚、德国、荷兰、英国和爱尔兰的书商都描述了类似的大范围订单,其中一些包括带有年代的手册、区域史、特定译本或绝版版本。

传统图书馆的采购也可能产生看似古怪的书单。机构有时会建设全面馆藏、补齐缺失卷册,或购入捐赠图书馆的库存。二手书回收商同样会批量收购存货,再进行分拣、转售、出口或制浆处理。

因此,最强的信号是多个卖家之间呈现出的模式;最薄弱的环节则是归属认定。Google News 的聚合迅速传播了《卫报》的标题,但现有证据仍无法锁定任何一家 AI 实验室。

这一区别应当塑造所有结论。这个故事记录的是二手书需求异常,并未证明是谁委托了这些需求,也未证明这些书将被如何使用。

为什么 AI 开发者仍想要冷门图书

图书提供了结构化、经过编辑且往往稀缺的语言材料,这是开放网络数据无法可靠替代的。

大型语言模型从海量文本集合中学习统计关系。训练并不像储存一个可检索的书架,尽管模型有时可能复现其训练数据中出现过的段落。

开发者重视图书,是因为其中包含连贯的论证、经编辑的散文、专业词汇,以及可能从未进入公共网络的知识。较早的区域史和技术手册,能够覆盖网络上几乎没有呈现的主题。

冷门图书可能尤其具有吸引力,因为开放互联网正日益变得重复。为搜索优化的页面不断改写其他页面,低质量网站复制参考资料,而 AI 生成文本也正在进入新的在线数据集。

扫描后的图书可以提供更干净的历史样本,也能填补由国际标准书号(ISBN)识别出的精确目录空缺。ISBN 是分配给特定图书版本的唯一商业标识符。

如果买家已有一份缺失 ISBN 的数据库,自动化采购就变得顺理成章。软件可以将目标清单与各类市场进行比对,挑选可获得的副本,并将其送往集中处理设施。

这一机制可以解释卖家为何看到奇怪的组合。软件会针对目录覆盖度、品相、可得性和运输成本进行优化,而不会在意两本书是否共享人类可读的主题。

特定版本可能至关重要,因为页码、译文、插图、前言和补充材料都可能不同。追求全面覆盖的数据库,可能会将同一书名的两个版本视作不同对象。

这种需求并不限于模型预训练,即让模型学习广泛语言模式的初始过程。数字化图书还可用于评估、检索系统、专业数据集、搜索索引和后训练研究。

模型开发者未必会直接购买图书。数据经纪商、扫描服务商、回收商、物流公司或数据库运营商,都可能处于书店与最终客户之间。

这种可能性使归属认定变得困难。零售商看到的可能只有账户名称和收货地点;即便是直接采购方,也可能服务于多个行业,或通过多条渠道转售库存。

最有力的先例来自 Anthropic。解封的法律文件显示,该公司曾开展一项内部称为 Project Panama 的实体图书收购工作。

根据一项法院记录调查,Anthropic 花费数千万美元收购了数百万本图书。工作人员拆除书脊、扫描书页,并将剩余材料送去回收。

一份内部规划文件描述了扫描全世界所有图书的雄心。这项行动在公司已从未经授权的在线图书馆收集图书之后,寻求获得合法购入的实体副本。

这一已有记录的项目使当前的怀疑显得合乎情理,但并不能证明 Anthropic 或任何其他被点名的开发者,委托了如今送达独立书商的订单。

其他买家也可能看到同样的机会。扫描公司可以聚合冷门图书,并出售数字访问权、元数据或处理服务;回收商则可以在将不受欢迎的库存制浆前,先提取其中有价值的书目。

因此,Google News 的读者应当将动机与身份区分开来。AI 开发者有明确理由寻求图书,但这些特定买家的身份仍然隐藏在幕后。

真正的冲突是合法购买与透明使用之间的矛盾

购买实体副本可以强化公司的法律立场,却无法回答作者是否同意将作品用于 AI 训练。

Anthropic 诉讼确立了获取图书与使用其内容之间的重要区别。美国地区法官 William Alsup 认为,在他审理的具体情形下,使用图书训练模型可能构成具有转换性的合理使用。

法官对待 Anthropic 合法购入的图书,与其从未经授权的影子图书馆获得的数百万份文件有所不同。影子图书馆会在未经权利人许可的情况下传播受版权保护的作品。

2025 年 6 月的意见书认定,Anthropic 可以将购入图书数字化,用于其核心图书馆和模型训练。不过,该公司仍面临与其收藏中保留的盗版副本有关的索赔。

Anthropic 后来同意就盗版指控达成 15 亿美元和解。该和解并未推翻法院关于对合法取得材料进行训练构成合理使用的认定。

这种区分为购买实体图书提供了直接激励。有记录的交易比从盗版网站匿名下载拥有更清晰的来源证明。来源证明记录材料从何而来,以及如何取得。

实体所有权不会自动转让版权。购买一本小说,允许所有者阅读、出借、转售或处置该副本,但不赋予其不受限制的复制权。

不过,在美国法律下,合理使用仍可能允许某些复制行为。法院会权衡用途、作品性质、使用数量以及对市场的影响。AI 训练案件正在检验这些因素应如何适用于模型开发。

美国版权局已警告,不存在放之四海而皆准的答案。其训练分析指出,结果取决于包括源材料、使用目的、输出内容的防护措施以及对许可市场影响在内的因素。

法律图景也会因跨境而变化。一笔始于英国或爱尔兰的交易,可能涉及在其他地点扫描、在另一国家存储,以及在美国进行模型训练。

不同司法辖区对文本和数据挖掘设有不同例外。合同条款、数据库权利、版权期限和商业目的,都可能进一步增加分析复杂度。

对书商而言,眼前的决定更简单,却在情感上更为困难。他们拥有库存,通常可以将其出售给愿意购买的客户;但许多人也将自己视为文化材料的守护者。

当被要求购买的书目稀缺时,这种担忧会更加尖锐。销毁一本常见的平装书,对公众获取的影响很小;销毁一本不常见的区域史或专业版本,则可能使一份重要副本退出流通。

“稀有”同样需要谨慎界定。绝版并不总意味着不可替代、珍贵或独一无二。数千册副本或许仍存于私人收藏、图书馆和仓库中。

反过来,一本价格低廉的书也可能保存着在其他地方难以找到的信息。市场价格并不是衡量历史或研究价值的完美标准。

因此,书商面临着相互矛盾的信号。大额订单可以带动滞销库存流转,并支撑利润微薄的生意;但同样的订单也可能减少书店、收藏家和研究人员所重视作品的可得性。

法律争议聚焦于复制与训练。书商的担忧则提出了一个保存问题:买家在购入具有文化重要性的资料时,是否应披露其将进行破坏性数字化?

目前没有普遍规则要求作出这种披露。要求每一位顾客解释购买用途,同样会带来隐私和行政管理问题。

或许可以采取更具针对性的做法。卖家可对签名书、档案资料、独特批注、地方史料,以及机构馆藏有限的版本进行额外审查。

但这仍无法解决更广泛的透明度问题。从数字化图书中获益的公司,可能与供货书店之间隔着多层合同关系。

证据尚不能证明什么

AI 的解释符合已知行为模式,但公开记录缺少将怀疑推进为归因所需的文件。

没有任何具名 AI 公司承认委托了相关报道中的订单。也没有书商公布合同,将某位买家与 Anthropic、OpenAI、Google、Meta 或其他模型开发商联系起来。

同样没有公开的运输记录能够追踪这些图书从英国或爱尔兰书店流向扫描设施。希思罗机场附近的仓库可以整合国际货运,而未必知道其最终用途。

一些卖家确认 Zoom Books 是其客户之一。这家总部位于加拿大的公司自称为图书回收商,多个国家的卖家都讨论过与其相关的订单。

回收商的参与并不能证明与 AI 有关。二手书公司本就在日常运营中大量采购、分类、转售、出口、捐赠和制浆处理图书。

被删除的营销措辞、不透明的别名或异常的采购模式,足以引发进一步质疑。但这些迹象都不能独立证明是谁资助了订单,或图书在交付后经历了什么。

这些选书也可能源自自动化转售分析。买家可能扫描各类交易平台的商品列表,寻找价格差异、机构需求、补书请求或出口机会。

它们也可能服务于与生成式 AI 无关的私人图书馆或数字化项目。大学、家谱服务机构、保存团体和专业数据库都在寻找冷门资料。

仅凭规模本身提供的证据有限。独立卖家会注意到 200 本或 500 本的订单激增,因为这些订单可能扰乱正常履约;大型转售商则可能将同等数量视为常规业务。

时间线更具暗示性。法院文件披露 Anthropic 的破坏性扫描项目后,相关报告开始流传。那次披露为书商解读陌生订单提供了一个具体框架。

但它也可能造成确认偏误。一旦卖家知道某家 AI 公司扫描了数百万本图书,每一笔不规则订单都可能看起来与同一行业有关。

这并不意味着这些担忧没有根据,而是说报道应通过记录检验这一假设,而非通过重复来强化它。

一个有用的检验方式是比较不同卖家的买家名单。共享的支付处理商、公司注册信息、电话号码、仓库单元和转运账户,或许能揭示表面不同的客户是否属于同一网络。

另一个检验方式是在获得适当同意并具备法律保障的前提下,追踪一批带有标记或可追溯的货物。其运输路线可以区分国内转售与国际集运。

记者还可以查阅海关申报和企业采购记录。处理数百万本图书的扫描承包商需要设施、设备、劳动力、废弃物处理和物流能力。

模型开发商可通过自愿披露减少不确定性。他们可以公布采购政策、确认主要数据供应商、说明保存保障措施,并区分购买资料与授权馆藏。

当前的不透明状态对双方都没有好处。书商无法作出知情决策,作者无法评估潜在用途,AI 公司即便采购另有目的也会面临怀疑。

针对大型开发商的近期诉讼加剧了这种不信任。7 月,出版商指控 Google 未经许可使用受版权保护的图书训练 Gemini。这些指控仍存在争议,但 Gemini lawsuit 表明,图书来源如今已成为重要的法律议题。

这一背景解释了为何 Guardian 的报道会通过 Google News 广泛传播。它将一种可见的零售模式与 AI 供应链中隐蔽的一环联系起来。

不过,负责任的结论仍应保持克制:神秘买家正在采购不同寻常的图书集合。AI 训练是一种可信解释,而非既定事实。

谁在承受新需求的压力

这些订单让书商处于商业生存、文化保存与渴求可追溯数据的 AI 行业交汇点。

独立卖家可能欢迎购买滞销库存的客户。每一本放在书架上的书都会占用空间、劳动力、编目时间和营运资金。

突如其来的订单也可能压垮小型经营者。员工必须找出每个版本、核实其品相、打包、纠正商品信息错误,并处理交易平台的沟通。

当订单通过不同账户下达时,卖家可能直到开始履约才意识到它们合在一起的规模。多个包裹最终可能汇聚到一个转运仓库。

交易平台面临另一种压力。它们的系统原本用于连接个体买家与分散库存。自动化补货程序可能将这些平台转变为采购网络。

平台可以在不公开披露客户详情的情况下识别异常订单集群。当多个账户共享一个收货点,或似乎由同一组织控制时,平台可以提醒卖家。

这种监测必须避免将合法的大宗采购当作不当行为。图书馆、学校、影视制作、室内设计师和出口商都会例行下达大额或非同寻常的订单。

出版商和作者面临更根本的问题。二手交易通常不会产生新的版税,但也不会创造可规模化的衍生资产。

数字化改变了这一等式。一册购得的图书可能成为数据集的一部分,用于反复训练、评估或商业模型服务。

AI 开发商面临记录合法采购的压力。盗版数据集廉价且覆盖全面,但诉讼已使其法律和声誉成本更难忽视。

购买实体图书提供了一条更容易辩护的路径,但也引入物流成本、扫描错误、重复检测、存储问题,以及对销毁行为的审视。

图书馆和档案馆或许会成为低调的制衡力量。即使市场上的副本消失,它们仍可保存访问渠道,但其馆藏并不普遍,也无法永久保证。

稀缺的地方性作品面临最高风险。一部地区史可能商业需求有限,却仍对家谱研究者、历史学家和社区研究人员具有价值。

数字化可以保存其文字,却可能毁掉其实体语境。边注、装帧、纸张、题字、夹附文件和印刷差异,都可能承载光学字符识别无法捕捉的信息。

当买家将每本书都视为可互换的训练材料时,这种差异尤为重要。文本语料库看重可提取的语言,而档案馆看重完整的物件及其历史。

这场冲突并不能通过宣布所有销毁图书的行为都不可接受来解决。图书馆会剔除重复馆藏,出版商会制浆处理滞销库存,回收商每天也会处理受损书籍。

缺失的环节是知情分流。为优化 ISBN 覆盖率而进行大宗采购的买家,可能无法识别哪些副本应在破坏性扫描前得到保存。

书商可以帮助识别这些情况,但他们无法独自承担责任。他们的目录可能不会记录来源、批注或版本特有的特征,除非有人亲手检查每一册。

行业标准可以要求扫描承包商筛查签名本、独特手稿、批注和稀缺版本。有价值的发现可以转入非破坏性扫描或档案收藏。

AI 公司也可以资助保存副本。如果一个项目销毁了一本购得图书,它可以支持将另一册副本或高质量数字替代品存入可访问机构。

这些保障措施无法解决版权争议,但能回应另一个问题:防止数据获取竞赛悄然清除罕见的实体记录。

对知识工作者而言,这一事件提醒我们,数字答案也有供应链。聊天机器人回复可能间接依赖于用户从未见过的作者、编辑、卖家、扫描人员、编目人员和物流人员。

将源文件和来源信息保存在 personal knowledge base 中,是一种切实可行的应对方式。它让用户能够区分模型流畅的回答与自己可以亲自核查的证据。

可证实或削弱 AI 理论的三个信号

下一阶段应聚焦于买家身份、货运目的地,以及破坏性扫描的证据。

第一个信号是经过核实的合同关联。将买家与 AI 开发商联系起来的发票、采购协议、付款记录或供应商确认,都会大幅增强这一理论。

与扫描供应商的关联同样重要,尤其是在该供应商向模型开发商推销数据集或数字化服务的情况下。但仍需证明相关报道中的图书进入了 AI 项目。

如果调查反而将这些采购与普通转售、回收或私人图书馆客户联系起来,核心主张就会被削弱。异常的选书模式届时可能反映自动化商业活动,而非模型训练。

第二个信号是图书的实体运输路线。货物送达货运仓库本身无法说明太多,除非调查人员能够确认下一站目的地。

若货物反复运往工业扫描点、数据承包商或破坏性数字化设施,将支持书商的怀疑;若反复运往转售仓库,则指向其他解释。

海关记录、仓库租赁数据和物流文件可帮助确定这一路径。卖家也可以通过行业协会私下比较配送详情。

第三个信号是 AI 公司或中间方作出的披露。开发商可以说明自己是否正在购买二手图书、使用哪些供应商,以及扫描是否会销毁原件。

否认必须足够具体,才便于评估。仅称公司遵守适用法律,并不能回答承包商是否代表其采购和扫描图书。

也应关注新的法庭文件。版权诉讼已多次披露公司此前未曾公开讨论的内部采购做法。

Anthropic 文件改变了卖家对大宗订单的解读,因为它们揭示了一套完整机制:实体书被大量收购、拆解、扫描、数字化并回收处理。

若能找到涉及其他公司的类似记录,将进一步印证一个更广泛的结论:二手交易平台已成为 AI 数据采购的基础设施。

但缺少这类记录并不能证明相反的情况。私下合同可能始终不公开,中间商也可能掩盖最终客户身份。然而,证据终究必须超越模式比对。

通过 Google News 看到这篇报道的读者,应同时注意这两方面事实。AI 公司已展现出对书籍的强烈需求,而一家大型开发商曾以极大规模进行破坏性扫描。

与此同时,目前英国和爱尔兰的大宗订单仍无法归属到具体主体。卖家记录了异常行为,但尚未确认最终买家的身份或目的。

这一核查缺口正是报道最重要的特征。它揭示了为数字模型提供原料的实体供应链,透明度究竟有多低。

未来几个月,请关注是否出现共享买家记录、可追踪的货运目的地,以及采购披露。这些信号将决定,这究竟是一个 AI 采购网络,还是全球二手书贸易中一次不寻常的循环。

在此之前,应将这些大宗订单视为一条可信线索,而非已经定论的案件。保留原始资料,追踪物流,并追问:当一本实体书变成不可见的训练数据时,究竟是谁从中获益。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page