你书架上那本压箱底的旧书,很可能正被人按吨收走。

据 404 Media 调查,今年 4 月起,二手书商陆续接到规模异常的订单,单笔从 1000 册到 100 万册不等。买家不挑题材、不挑作者,对价格也不敏感,溢价照收,唯一的硬条件是出版时间早于 2022 年——那是生成式模型大规模铺开之前,最后一批确定由人写成、没被机器文本污染过的内容。一位不愿具名的书商说,他从前一周卖出约 20 本,现在一周能走几百本。
书买回去并不入库。为了扫得快、扫得平,通行做法是用切割机削掉书脊,把散页送进工业扫描仪高速成像,扫完的纸页当废品处理。今年 1 月公开的法庭文件披露,Anthropic 内部有个代号「巴拿马计划」的项目,目标正是尽可能多地买书、扫描、销毁。法官认定购买后自行扫描属于合理使用,而该公司因早期囤积盗版书库,另与作者方达成 15 亿美元和解。
争议随后烧到了图书数据库网站 ISBNdb。它曾上线一个撮合页面,写着「世界上最好的训练数据就在书架上」。舆论发酵后页面被删,官方声明称自己从不训练模型,那只是一次市场需求测试。
说白了,问题不在扫描,而在扫描之后。绝版书退出流通,内容进了不对外开放的私有库,公众反倒读不到了。
你怎么看:花钱买下一本书,就有权把它变成纸浆吗?
图片来源:Hackley Public Library / Flickr(CC BY 2.0)
来源:404 Media、IT之家







