AI公司成批买旧书书商怕珍本被撕去喂模型

AI 公司成批买旧书:书商怕珍本被撕去喂模型

AI 公司为了拿到高质量长文训练模型,正从二手书里找出路——买来实体书、切掉书脊、高速扫描、再把纸本销毁。这套「破坏性扫描」成本低、速度快,却让爱书人和旧书商担心:那些不可再得的珍本,可能就这么永远没了。Ars Technica 记者 Ashley Belanger 的报道,把这股暗流摆到了台面上。

从一场官司说起的「巴拿马计划」

2025 年夏天,Bartz 诉 Anthropic 一案揭出 Anthropic 的「Project Panama」(巴拿马计划):公司花数千万美元买下数百万本实体书,由服务方切去装订、裁齐书页、扫成数字文件,再把纸本丢弃。美国加州北区联邦法官威廉·阿尔苏普(William Alsup)在 2025 年 6 月的裁决中认定,合法购得后做格式转换属于「合理使用」(fair use),因为本质上只是把买来的纸本换成了可检索的数字副本。盗版部分则另算——2026 年 7 月,旧金山一家联邦法院批准了 Anthropic 与作者方高达 15 亿美元的和解。

换句话说,法律给「买来、扫完、销毁」开了绿灯。可书商的恐惧不在这里,而在那些稀有、绝版的孤本:一旦被成批处理,世上可能再无第二本。

书商盯上的可疑大单

据《大西洋月刊》报道,最近两起调查引发社交媒体哗然:先是《每日电讯报》称硅谷在销毁数百万本稀有书、连原书一起粉碎;接着 404 Media 曝光,一家叫 ISBNdb 的图书数据库公司,公然帮 AI 公司批量找书,订单从一千本到一百万本不等,还签保密协议掩盖买家身份。ISBNdb 据说还提醒客户:这事儿「观感太差」,得藏着点。Anthropic 当年也给自己的破坏性扫描起了代号,就是为了不让人知道。

并非所有公司都走这条路。OpenAI 与微软正联手哈佛大学的馆员,用约一百万本溯源到 15 世纪的公有领域图书训练模型;埃隆·马斯克旗下的 xAI 也公开表示不会销毁珍本。Anthropic 则否认自己毁过任何珍本。只是批评者指出,马斯克没说 xAI 一本都不毁,也没界定什么叫「珍本」。

真正的红旗出现在书店柜台。爱尔兰老牌书店 Kennys 近日收到一笔「离谱」订单:一次性要五千本冷门书。与大学、大图书馆的批量采购不同,这位买家连价都不还——在书商眼里,这几乎等于「AI 来了」的信号。Kennys 的汤姆·肯尼(Tomás Kenny)对《爱尔兰时报》说,AI 正在「吓坏我们这个行业」,他打算拒掉疑似拿去训练模型的订单,以保护作者权益和读者读到冷门书的机会。「书商常站在道德与伦理两难的最前线,多数时候轮不到我决定,」他说,「可要是他们拿一本书去扫描、意在拿走其中的知识产权,Kennys 不想成为其中一环。」有书商担心,把藏书卖给不加区分地销毁的 AI 公司,无异于「签下自己的死刑判决」。

不毁书的另一条路

其实本不必如此。谷歌早在 2009 年就拿下一项非破坏性图书扫描专利(专利号 US-7508978-B1),只要肯慢下来、肯投入就能用。互联网档案馆更愿意把老书当「人力活」:自 2010 年起做图书扫描的 Eliza Zhang,用脚踩踏板抬起扫描玻璃、逐页对正、记下所有折页,十多年里扫了超过 300 万页、1.4 万张折页、1.8 万件藏品,目标是「零差错」。她说过,最老最脆的书页「薄如蝉翼」,干净干燥的人手才是最好的翻页方式。

一边是工业化的切脊粉碎,一边是逐页轻拿轻放。公众的反感,或许会倒逼大公司学学互联网档案馆——既数字化、也把珍本原样留下来。否则对那些爱捧一本旧书在手里的人来说,最难受的画面是:稀有的,只会更稀。

来源:Ars Technica(作者 Ashley Belanger)