近日,世界各地的二手书商都收到了过往难得一见的巨额订单,而且订单没有主题,五花八门。他们怀疑,人工智能企业开始急需大量没有被AI污染过的文本来提升语言大模型的能力。

一个用于Anthropic公司“巴拿马计划”的二手书仓库
全球书商都收到异常订单
在英国诺森伯兰郡经营巴特书店的斯图尔特·曼利,过往每周能卖出两三千本二手书。但最近一家加拿大公司下的一笔订单,就相当于他一周的销量,他说,他在二手书行业从业30年来,从未见过这样的事情。
美国休斯顿贝克书店的经理查理·贝克称,近期,他卖给了同一个买家95本书,其中有一单就70本。订单中的书籍几乎全部是非虚构类书籍,大多出版于20世纪70年代至90年代,例如一本1995年出版的《丹佛都市区内幕指南》。
爱尔兰的肯尼斯书店也曾收到5000本书的订单,书目包括地区历史书、18世纪非洲的农具书籍、20世纪50年代赛车手的传记以及非常冷门的金融指南,几乎没有主题规律,仿佛机器自动生成的。
因此书商开始怀疑:这些买家可能不是普通读者,而是通过自动化系统按照国际标准书号(ISBN)寻找AI训练数据还没有覆盖的书。
有一位用户三个月前在著名社交媒体上提问称:“最近二手书的网上抢购热潮是怎么回事?”很快这一帖子收到大量回复,自称是书商的用户纷纷讲述了他们收到异常大宗订单的经历。
而采购者很多都是中间商,并非是AI公司。总部位于加拿大的企业Zoom Books自称是“北美领先的图书回收公司”,利用“智能物流”每月“采购、分类和转售超过200万册图书,德国、新西兰等全球各国的书商都收到过这一企业的订单。
在荷兰,一些书商也收到了来自一家名为“2077AI”的新加坡机构的电子邮件。该机构声称正在“革新人工智能数据”,其部分工作是创建训练数据集。该公司发送的邮件附带了一份包含3000种英文书籍的清单,其中包括《地质力学中的离散元建模》等学术著作。
对于出版行业来说,这一现象已经成为该行业内部的最热门话题。有一名匿名的英国二手书商表示,订单可能来自不同的买家,但却被送到同一个地址。自1月份以来,他已收到来自类似买家的6000本书订单,价值数千英镑。尽管买家批量订购,但他们支付的价格“非常高”,而且没有要求折扣。
这一系列订单引发了书商们的猜测,他们认为人工智能公司正在收购大量书籍,扫描其内容后再将其销毁。
美国法官判决购买书籍训练不违法
2025年,在三位作家对人工智能公司Anthropic提起的版权诉讼后,法官裁定,以购买书籍的方式来训练人工智能软件并不违反美国版权法,因为这些模型以“变革性”的方式处理书籍,人工智能训练过程类似于教师“训练小学生写作”。
法庭文件显示,Anthropic曾花费了数千万美元收购数百万本书,拆除书脊,扫描书页,来训练语言大模型Claude。这一项目在公司内部被称为“巴拿马项目”。被拆除书籍的范围很广,从晦涩难懂的拉丁文文献到西部牛仔小说都有。
而Anthropic则回应称,在书籍中寻找训练模型的材料是人工智能行业广泛采用的方法,该公司的数据采集项目不会“购买和销毁珍稀古籍”。
在另一起诉讼中,Anthropic还被发现在盗版网站下载了大量电子版书籍用来训练模型。在这一诉讼中,Anthropic公司没有承认存在不当行为,而是同意向出版商和作者支付15亿美元的和解金,以避免审判。书籍被下载的作者可以申请获得和解金,预计每本书的赔偿金额约为3000美元。
2022年之前的书籍成为抢手货
专家表示,人工智能公司如今正面临着自身造成的数据难题:开放网络充斥着人工智能生成的文本,而用这些“垃圾”训练新模型会导致“模型崩溃”(即机器因吞噬自身输出而性能下降)。而不寻常和罕见的文本可以为改进大型语言模型的训练提供新的素材,这对生成式人工智能工具的发展至关重要。
Anthropic的一位联合创始人曾提出,用书籍训练人工智能模型可以教会它们“如何写出好文章”,而不是模仿“低劣的网络用语”。Meta公司2024年的一封内部邮件中,则将获取数字书籍资源描述为与人工智能竞争对手抗衡的“关键”。
还曾有图书数据库ISBNdb曾直接告诉AI公司,世界上最好的AI训练数据就摆在书架上,2022年之前出版的书籍是AI公司的理想素材,因为它们的文本没有被聊天机器人生成的素材污染。
而对于珍惜纸质书的二手书商来说,这一过程让他们尤为不安。爱丁堡二手书店老板德里克·沃克称,他出售的书籍里有一本是目前唯一幸存的18世纪版本书籍,“如果最近出版一本学术著作只发行了100册,其中75册已经在图书馆里,哪怕销毁一册也不会造成太大的损失。但是我售出了一些真正罕见的书籍,有的是目前已知的唯一幸存的18世纪版本。”