英国与爱尔兰的二手书商正涌向一波来历不明的成批订单:买家要的书五花八门、毫无主题规律,却肯出高价、不求折扣。不少书商怀疑,幕后买家是人工智能公司——它们把实体旧书买去扫描,当作训练大语言模型的新数据。

「这组合实在太怪」
英格兰诺森伯兰郡 Barter Books 的合伙老板 Stuart Manley 说,订单大约从三个月前开始出现,反常之处在于它们不像普通订单那样按主题归类。一笔近期订单里同时出现了爱沙尼亚语译本的《使命之歌》、某个特定版本的女作家安妮·勃朗特作品《艾格妮丝·格雷》,以及 1983 年 10 月的《战舰》月刊。他说自己已经向三名买家卖出「成百上千」本随机书籍,总额约合 4000 英镑。
爱尔兰克莱尔郡的 MW Books 老板 Jim Shaughnessy 也表示,自 5 月以来店里不断收到量大且杂乱的订单,「推测是由机器驱动,几乎没有主题逻辑」。英国巴斯 BookLovers 的老板 David Gower-Spence 则在 5 到 7 月间收到约 200 本书的集中订单。有书商发现,不同买家下的随机订单竟被送到同一个地址——伦敦希思罗机场附近的一组货运仓库。
一本书为何值得被「买断」
这股订单潮让人联想到大模型的「数据饥渴」。今年《华盛顿邮报》披露,开发 Claude 聊天机器人的头部 AI 公司 Anthropic 曾花费数千万美元收购书籍、裁掉书脊以便扫描内容,随后送去回收。Anthropic 回应称,其训练数据来自公开网络、商业采购数据集与自产数据,采购书籍是行业通行做法,且从未购买或销毁珍稀古籍。
技术媒体 404 Media 上月报道,一个图书数据库曾向书商暗示「世界上最好的 AI 训练数据就摆在书架上」,并称 2022 年以前出版的书籍是理想材料,因为它们的文本尚未被聊天机器人生成的内容「污染」。对 AI 公司而言,那些早于 ChatGPT 走红、又未上网的二手书,恰好是难得的干净语料。在书商论坛里,有人感慨这些书「注定要进 AI 训练,封面被撕掉,最终化作纸浆」。澳大利亚书商近期也报告了类似的异常订单。
来源:The Guardian