爬走 1200 万张画作后,他帮艺术家做防护

一个为”反 AI 训练”而生的平台

2023 年初,摄影师 Jingna Zhang 与一小队志愿者开始维护一个名为 Cara 的图片分享与作品集应用。至今它已吸引约 150 万名艺术家入驻。人们聚到这里,是因为共同反对用自身作品未经授权训练人工智能模型,并希望在不受大型科技公司剥削的前提下展示创作。Cara 会过滤 AI 生成图,并提供名为 Glaze 的工具,试图通过”伪装”图像风格来干扰爬虫的模仿。

八月的三次”收割”

然而,彻底阻止爬取几乎不可能。就在 2026 年 8 月,Cara 遭遇了三次大规模抓取,服务器费用骤增,也让从 Instagram 等平台迁来的创作者感到不安——毕竟在那些平台上,内容会被明确定性为可用于训练的数据。

第一次发生在 8 月 13 日:一名 Reddit 用户以”MandarinDawnPoppy994″为名,在 r/DefendingAIArt 版块发布了一个包含 1200 万件作品、体积达 12TB 的压缩包,几乎覆盖了 Cara 全部公开图像。他在事后删除的帖文中称”这是个有趣的项目”,并说整个过程花费不到 10 美元。

第二次,另一名抓取者拉走了约 850 万条链接及用户名、标题、标签等元数据,上传到 AI 开发者平台 Hugging Face,账号名为”CaptiveDreamer”。在大量下架请求下,Hugging Face 表示会通知该用户删除个人元数据,但无法移除链接本身,因为”这里没有托管任何作品副本”。

第三次在 8 月 22 日:又有抓取者获取了 12.3 万张图片,连同含个人信息的文字帖与用户简介,发布到名为 Academic Torrents 的站点。

从”爬手”到盟友

戏剧性的一幕出现了:掀起这轮风波的始作俑者,在被 Zhang 对峙后道歉并删除了数据集,转而同意与她合作开发一款开源的艺术家防护工具。此人现以网名”Heft”活动,是一名北美学生,有软件背景、对数字存档感兴趣;因遭遇人肉搜索与死亡威胁,他要求仅以网名示人。Heft 对 WIRED 解释,最初抓取 Cara 只是个技术项目,并无公开之意,但”愚蠢地决定去 Reddit 上引战”,”被评论区的节奏带跑了”。看到有人因这次抓取而恐慌、甚至删光整个作品集,他才意识到伤害之深,坦言”回过头看,不仅针对 Cara,连发帖的方式都既残忍又欠考虑”。

如今他加入 Cara 的 Discord 担任”排障员”,向团队解释哪些修补方案行不通,指出允许爬取的结构性弱点——用 Zhang 的话说,他”会花时间解释,某些工具或设计他几分钟就能攻破”。

更大的战场

Heft 还提到,1200 万张图远不足以训练一个图像模型,商业实验室多从 LAION 等开放组织的大规模网络抓取中取材。Zhang 则正参与两起集体诉讼:一起针对 Stability AI、Midjourney 等,另一起针对 Google,均指控其图像生成工具在受版权保护的作品上完成了训练。为筹措法律费用,她发起的 GoFundMe 目标 12 万美元,截至报道时(周四)已筹得逾 10 万美元。