<?xml version="1.0" encoding="UTF-8"?><rss version="2.0"
	xmlns:content="http://purl.org/rss/1.0/modules/content/"
	xmlns:wfw="http://wellformedweb.org/CommentAPI/"
	xmlns:dc="http://purl.org/dc/elements/1.1/"
	xmlns:atom="http://www.w3.org/2005/Atom"
	xmlns:sy="http://purl.org/rss/1.0/modules/syndication/"
	xmlns:slash="http://purl.org/rss/1.0/modules/slash/"
	>

<channel>
	<title>数据抓取 &#8211; mylogs.cn</title>
	<atom:link href="https://mylogs.cn/tag/%e6%95%b0%e6%8d%ae%e6%8a%93%e5%8f%96/feed/" rel="self" type="application/rss+xml" />
	<link>https://mylogs.cn</link>
	<description>发现、记录、分享</description>
	<lastBuildDate>Fri, 28 Aug 2026 16:55:52 +0000</lastBuildDate>
	<language>zh-Hans</language>
	<sy:updatePeriod>
	hourly	</sy:updatePeriod>
	<sy:updateFrequency>
	1	</sy:updateFrequency>
	
	<item>
		<title>爬走 1200 万张画作后，他帮艺术家做防护</title>
		<link>https://mylogs.cn/%e7%88%ac%e8%b5%b0-1200-%e4%b8%87%e5%bc%a0%e7%94%bb%e4%bd%9c%e5%90%8e%ef%bc%8c%e4%bb%96%e5%b8%ae%e8%89%ba%e6%9c%af%e5%ae%b6%e5%81%9a%e9%98%b2%e6%8a%a4/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Fri, 28 Aug 2026 16:55:52 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[Cara]]></category>
		<category><![CDATA[人工智能]]></category>
		<category><![CDATA[开源工具]]></category>
		<category><![CDATA[数据抓取]]></category>
		<category><![CDATA[版权]]></category>
		<category><![CDATA[艺术家]]></category>
		<guid isPermaLink="false">https://mylogs.cn/%e7%88%ac%e8%b5%b0-1200-%e4%b8%87%e5%bc%a0%e7%94%bb%e4%bd%9c%e5%90%8e%ef%bc%8c%e4%bb%96%e5%b8%ae%e8%89%ba%e6%9c%af%e5%ae%b6%e5%81%9a%e9%98%b2%e6%8a%a4/</guid>

					<description><![CDATA[一个为&#8221;反 AI 训练&#8221;而生的平台 2023 年初，摄影师 Jingna Zhang  [&#8230;]]]></description>
										<content:encoded><![CDATA[<h2 class="wp-block-heading">一个为&#8221;反 AI 训练&#8221;而生的平台</h2>

<p class="wp-block-paragraph">2023 年初，摄影师 Jingna Zhang 与一小队志愿者开始维护一个名为 Cara 的图片分享与作品集应用。至今它已吸引约 150 万名艺术家入驻。人们聚到这里，是因为共同反对用自身作品未经授权训练人工智能模型，并希望在不受大型科技公司剥削的前提下展示创作。Cara 会过滤 AI 生成图，并提供名为 Glaze 的工具，试图通过&#8221;伪装&#8221;图像风格来干扰爬虫的模仿。</p>

<h2 class="wp-block-heading">八月的三次&#8221;收割&#8221;</h2>

<p class="wp-block-paragraph">然而，彻底阻止爬取几乎不可能。就在 2026 年 8 月，Cara 遭遇了三次大规模抓取，服务器费用骤增，也让从 Instagram 等平台迁来的创作者感到不安——毕竟在那些平台上，内容会被明确定性为可用于训练的数据。</p>

<p class="wp-block-paragraph">第一次发生在 8 月 13 日：一名 Reddit 用户以&#8221;MandarinDawnPoppy994&#8243;为名，在 r/DefendingAIArt 版块发布了一个包含 <strong>1200 万</strong>件作品、体积达 <strong>12TB</strong> 的压缩包，几乎覆盖了 Cara 全部公开图像。他在事后删除的帖文中称&#8221;这是个有趣的项目&#8221;，并说整个过程花费不到 10 美元。</p>

<p class="wp-block-paragraph">第二次，另一名抓取者拉走了约 <strong>850 万</strong>条链接及用户名、标题、标签等元数据，上传到 AI 开发者平台 Hugging Face，账号名为&#8221;CaptiveDreamer&#8221;。在大量下架请求下，Hugging Face 表示会通知该用户删除个人元数据，但无法移除链接本身，因为&#8221;这里没有托管任何作品副本&#8221;。</p>

<p class="wp-block-paragraph">第三次在 8 月 22 日：又有抓取者获取了 <strong>12.3 万</strong>张图片，连同含个人信息的文字帖与用户简介，发布到名为 Academic Torrents 的站点。</p>

<h2 class="wp-block-heading">从&#8221;爬手&#8221;到盟友</h2>

<p class="wp-block-paragraph">戏剧性的一幕出现了：掀起这轮风波的始作俑者，在被 Zhang 对峙后道歉并删除了数据集，转而同意与她合作开发一款开源的艺术家防护工具。此人现以网名&#8221;Heft&#8221;活动，是一名北美学生，有软件背景、对数字存档感兴趣；因遭遇人肉搜索与死亡威胁，他要求仅以网名示人。Heft 对 WIRED 解释，最初抓取 Cara 只是个技术项目，并无公开之意，但&#8221;愚蠢地决定去 Reddit 上引战&#8221;，&#8221;被评论区的节奏带跑了&#8221;。看到有人因这次抓取而恐慌、甚至删光整个作品集，他才意识到伤害之深，坦言&#8221;回过头看，不仅针对 Cara，连发帖的方式都既残忍又欠考虑&#8221;。</p>

<p class="wp-block-paragraph">如今他加入 Cara 的 Discord 担任&#8221;排障员&#8221;，向团队解释哪些修补方案行不通，指出允许爬取的结构性弱点——用 Zhang 的话说，他&#8221;会花时间解释，某些工具或设计他几分钟就能攻破&#8221;。</p>

<h2 class="wp-block-heading">更大的战场</h2>

<p class="wp-block-paragraph">Heft 还提到，1200 万张图远不足以训练一个图像模型，商业实验室多从 LAION 等开放组织的大规模网络抓取中取材。Zhang 则正参与两起集体诉讼：一起针对 Stability AI、Midjourney 等，另一起针对 Google，均指控其图像生成工具在受版权保护的作品上完成了训练。为筹措法律费用，她发起的 GoFundMe 目标 12 万美元，截至报道时（周四）已筹得逾 10 万美元。</p>

<figure data-wp-context="{&quot;imageId&quot;:&quot;6a99510ca8129&quot;}" data-wp-interactive="core/image" data-wp-key="6a99510ca8129" class="wp-block-image size-large wp-lightbox-container"><img fetchpriority="high" decoding="async" width="1232" height="645" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/0c6b3ebbc8b7296189bfa40c2b2d85d3_header.webp" alt="反 AI 训练艺术家聚会的资料图" class="wp-image-5551" srcset="https://mylogs.cn/wp-content/uploads/2026/08/0c6b3ebbc8b7296189bfa40c2b2d85d3_header.webp 1232w, https://mylogs.cn/wp-content/uploads/2026/08/0c6b3ebbc8b7296189bfa40c2b2d85d3_header-300x157.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/0c6b3ebbc8b7296189bfa40c2b2d85d3_header-1024x536.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/0c6b3ebbc8b7296189bfa40c2b2d85d3_header-768x402.webp 768w" sizes="(max-width: 1232px) 100vw, 1232px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption>图片来源：WIRED（摄影：WIRED Staff / Getty Images）</figcaption></figure>]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>AI 网页爬虫怎么写？Python 三步抓取结构化数据</title>
		<link>https://mylogs.cn/python-ai-web-scraper-tutorial/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Sat, 15 Aug 2026 10:52:03 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI工具]]></category>
		<category><![CDATA[BeautifulSoup]]></category>
		<category><![CDATA[Python]]></category>
		<category><![CDATA[教程]]></category>
		<category><![CDATA[数据分析]]></category>
		<category><![CDATA[数据抓取]]></category>
		<category><![CDATA[网页爬虫]]></category>
		<guid isPermaLink="false">https://mylogs.cn/python-ai-web-scraper-tutorial/</guid>

					<description><![CDATA[数据科学与人工智能项目里，拿到外部数据往往是第一步。传统做法是用 Python 的 requests 库把网页 [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">数据科学与人工智能项目里，拿到外部数据往往是第一步。传统做法是用 Python 的 requests 库把网页抓回来，再用 BeautifulSoup 解析；如果想让爬虫更「聪明」，可以再接一个大模型，把杂乱的网页文本直接整理成结构化数据。技术媒体 KDnuggets 近期的一篇教程，演示了如何用 Python 搭建一个最小可用的 AI 网页爬虫。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a99510ca8f2b&quot;}" data-wp-interactive="core/image" data-wp-key="6a99510ca8f2b" class="wp-block-image size-large aligncenter wp-lightbox-container"><img decoding="async" width="1200" height="821" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/4764ef3f0d157a383511100693aec57d_header.webp" alt="AI 网页爬虫怎么写？Python 三步抓取结构化数据" class="wp-image-4957" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/4764ef3f0d157a383511100693aec57d_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/4764ef3f0d157a383511100693aec57d_header-300x205.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/4764ef3f0d157a383511100693aec57d_header-1024x701.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/4764ef3f0d157a383511100693aec57d_header-768x525.webp 768w" sizes="(max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">AI生成配图</figcaption></figure>





<h2 class="wp-block-heading">第一步：用 requests 取回网页</h2>



<p class="wp-block-paragraph">开始前需要安装三个库：requests 负责网络请求，beautifulsoup4 负责解析，pandas 负责把结果存成表格。</p>



<p class="wp-block-paragraph">拿到目标网址后，第一步是用 requests.get() 发起请求，取回页面的原始 HTML。很多网站会拒绝没有标识的请求，因此在请求头里带上一个正常的 User-Agent 是基本操作。取回的文本，就是后续所有处理的基础。</p>



<h2 class="wp-block-heading">第二步：用 BeautifulSoup 解析内容</h2>



<p class="wp-block-paragraph">BeautifulSoup 能把手写的 HTML 变成可方便检索的对象。以一个简单的练习站点为例，页面上往往罗列着一组条目，每条包含正文、作者和若干标签。</p>



<p class="wp-block-paragraph">用 find() 与 find_all() 两个方法，就能按标签和类名把想要的内容逐条提取出来。比如先抓全部条目的容器，再在容器内部取出每一段的文本、作者名和标签。把多页内容循环抓完，最后用 pandas 汇总成一个 DataFrame 保存，一次就能拿到成百上千条数据。</p>



<h2 class="wp-block-heading">第三步：让大模型做智能提取</h2>



<p class="wp-block-paragraph">前面两步得到的是「原始文本」，要变成可用数据，传统做法是针对每个站点手写解析规则——网站结构一变，规则就失效。AI 网页爬虫的思路是：把清洗后的文本连同明确的指令一起交给大模型（LLM），让它输出固定字段的 JSON。</p>



<p class="wp-block-paragraph">具体实现上，可以调用任意兼容接口的大模型，把「请从下面文本中提取标题、作者、日期、摘要」这类指令和文本一并发送，要求模型返回结构化结果。这样一来，面对不同结构的页面，只要换指令，就不必重写解析代码。</p>



<h2 class="wp-block-heading">进阶：动态页面与反爬</h2>



<p class="wp-block-paragraph">如今的网页大量依赖 JavaScript 渲染，requests 直接取回的可能只是空壳。这类页面可以用 Playwright 等无头浏览器先把页面跑起来，再交给 BeautifulSoup 解析。遇到反爬严格的站点，则可以配合代理轮换来控制请求频率。</p>



<h2 class="wp-block-heading">三点提醒</h2>



<p class="wp-block-paragraph">抓取行为应当遵守目标站的 robots.txt 与服务条款，控制请求节奏，避免对服务器造成压力；只抓公开内容，不碰付费墙后或涉及个人隐私的数据；把爬虫用于学习与研究，而不是批量搬运他人成果。</p>



<p class="wp-block-paragraph">把三层组合起来——requests 负责抓、BeautifulSoup 负责解、大模型负责提——一个能用的 AI 网页爬虫就搭好了。对需要频繁收集外部数据的开发者来说，这是一项值得掌握的基础能力。</p>



<p class="has-small-font-size wp-block-paragraph">来源：KDnuggets</p>

]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>700 个社区先试，Reddit 请大模型来当版主</title>
		<link>https://mylogs.cn/reddit-rules-hub-llm-moderation-api-changes/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Thu, 06 Aug 2026 07:43:45 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[Reddit]]></category>
		<category><![CDATA[内容审核]]></category>
		<category><![CDATA[大语言模型]]></category>
		<category><![CDATA[开发者平台]]></category>
		<category><![CDATA[数据抓取]]></category>
		<category><![CDATA[社区治理]]></category>
		<guid isPermaLink="false">https://mylogs.cn/reddit-rules-hub-llm-moderation-api-changes/</guid>

					<description><![CDATA[美国社区平台 Reddit 宣布，将引入基于大语言模型的自动化审核工具，帮助版主管理社区。这套工具从 8 月  [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">美国社区平台 Reddit 宣布，将引入基于大语言模型的自动化审核工具，帮助版主管理社区。这套工具从 8 月 5 日起向所有新建社区开放测试，并计划在 2026 年晚些时候全面上线。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a99510caa340&quot;}" data-wp-interactive="core/image" data-wp-key="6a99510caa340" class="wp-block-image size-large aligncenter wp-lightbox-container"><img decoding="async" width="1200" height="624" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/b8db39588a4f32aeb9c2a8c429d644a8_header.webp" alt="700 个社区先试，Reddit 请大模型来当版主" class="wp-image-3797" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/b8db39588a4f32aeb9c2a8c429d644a8_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/b8db39588a4f32aeb9c2a8c429d644a8_header-300x156.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/b8db39588a4f32aeb9c2a8c429d644a8_header-1024x532.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/b8db39588a4f32aeb9c2a8c429d644a8_header-768x399.webp 768w" sizes="(max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：The Verge</figcaption></figure>





<p class="wp-block-paragraph">Reddit 官方数据显示，该平台目前每天有超过 1.3 亿人访问，社区数量超过 10 万个。</p>



<h2 class="wp-block-heading">从「关键词匹配」改成「读懂规则意图」</h2>



<p class="wp-block-paragraph">这套工具被命名为 Rules Hub（规则中心）。版主可以在其中选择哪些社区规则需要自动执行、规则被触发后采取何种动作（送入审核队列、过滤或直接移除），并在正式启用前预览效果，事后还能查看日志与数据洞察，了解规则的实际运行情况。</p>



<p class="wp-block-paragraph">与现有方案最核心的区别在判定方式。眼下大量子版块依赖的自动审核工具 Automoderator（通常简称 Automod），其判定逻辑建立在精确的关键词与模式匹配之上——规则里写了哪个词，就拦哪个词，不看上下文。Rules Hub 则改用大语言模型来评估「一条帖子或评论是否符合某条规则的意图」。</p>



<p class="wp-block-paragraph">Reddit 在官方博客中表示，这种做法「能够更好地处理语义细微差别、自然语言和边缘情况，同时保留版主的控制权」。</p>



<p class="wp-block-paragraph">对这次替换，Reddit 首席执行官史蒂夫·霍夫曼的表态相当直白。他称 Automod 一直是「最重要的版主工具之一」，但同时也「难学、难维护，严重依赖脆弱的关键词匹配、正则表达式，以及那些继承下来、往往整个版主团队里没几个人真正搞得懂的配置」。他的结论是：「我们可以做得更好。」</p>



<h2 class="wp-block-heading">已在 700 多个社区测试数月</h2>



<p class="wp-block-paragraph">Reddit 称，Rules Hub 在过去数月中已经进行了早期测试，参与者是来自 700 多个社区的新手与资深版主，其中包括 Reddit 版主委员会网络的成员。</p>



<p class="wp-block-paragraph">现阶段测试范围扩大到所有新创建的社区。Reddit 发言人罗莎·金向 The Verge 确认，对新社区而言这项功能是可选的。</p>



<p class="wp-block-paragraph">不过从官方措辞看，Automod 的执行类功能长期看会被逐步淘汰。Reddit 在博客中表示，展望未来，Rules Hub 与 Post &amp; Comment Guidance（发帖与评论引导）、Safety Filters（安全过滤器）等较新的系统合在一起，最终可以取代社区目前依赖 Automod 的许多执行流程。需要说明的是，被替代的是 Automod 的规则执行环节，而非 Automod 这个工具本身；Reddit 也强调，在替代方案经过测试并与版主共同验证之前，不会改动任何现有的执行流程。</p>



<h2 class="wp-block-heading">同日宣布：第三方应用必须迁到开发者平台</h2>



<p class="wp-block-paragraph">审核工具只是这批平台公告中的一项。Reddit 同时宣布了针对开发者的重大调整：新的第三方应用今后必须构建在 Reddit 的开发者平台之上，而不是公共接口。</p>



<p class="wp-block-paragraph">Reddit 在公告中描述了这样一个目标：让平台上所有良性、可信的自动化程序都运行在一个官方能够提供支持、并一致地执行政策的生态里。为此，公共接口访问会继续保留但仅限于有限范围，新的申请将被逐步收紧，第三方应用则需迁移到开发者平台上运行。</p>



<p class="wp-block-paragraph">霍夫曼给出的理由是，Reddit 的公共接口不是为今天这样的规模、自动化滥用和商业化抓取设计的。按他的说法，平台希望有用的机器人、社区工具和善意的开发者拥有一条清晰、被良好支持的开发路径，但不希望恶意方无节制地抓取 Reddit、转售数据，或在不承担责任的情况下使用这些数据。</p>



<p class="wp-block-paragraph">为配合迁移，Reddit 推出了总额 100 万美元的应用迁移计划。</p>



<p class="wp-block-paragraph">这一调整很难不让人联想到 2023 年那场风波。当时 Reddit 大幅调整接口收费政策，目的是让人工智能公司为使用其数据付费，结果引发大规模抗议，多款广受欢迎的第三方客户端因此关停。目前若开发者想做 Reddit 移动应用，仍需向官方申请公共接口豁免，金表示这一点不会改变。至于强制迁移的时间表，Reddit 尚未确定，但承诺会「提前充分通知社区」并给出明确日程。新规将影响「除明确获得豁免之外的所有接口应用」。</p>



<h2 class="wp-block-heading">老版界面也要动，但官方称不会直接砍掉</h2>



<p class="wp-block-paragraph">第三项变动指向 old.reddit.com——那套沿用了 21 年的旧版桌面界面。Reddit 称，改动是其反抓取行动的一部分。</p>



<p class="wp-block-paragraph">该公司此前已经采取了一系列措施：屏蔽不付费搜索引擎的收录、起诉 Anthropic 与 Perplexity、封锁互联网档案馆以阻断人工智能公司借道抓取数据；今年 6 月起，使用老版界面还需要登录账号。</p>



<p class="wp-block-paragraph">具体会怎么改，Reddit 没有明说。金表示公司正在「评估不同方案」，短期内会将访问限制为登录用户，并迁移关键的机器人和版主工作流。霍夫曼的说法则更全面一些：为了保护平台、业务和用户，公司必须有所动作，而且要做的事不止一件——可选项包括限制访问、迁移重要用途，或者用现代技术栈重建，他认为这三件大概都会做。</p>



<p class="wp-block-paragraph">对于用户可能产生的抵触，霍夫曼也有所预判。他坦言，关于接口和老产品的公告总是带着一些历史包袱，仅凭一句「相信我们」远远不够；如果要求用户迁移到新方案上，那么新方案在实际使用中就必须达到同等水平或者更好，而不只是理论上如此。他承诺，在有可信的替代方案之前不会移除主要能力，并会在改动落地前逐步公布进展。</p>



<p class="wp-block-paragraph">真正的考验仍在后面：把规则执行权从字符串匹配交给一个会「理解意图」的模型，意味着判定结果不再可以逐条复现。当模型误读了某个小众社区的黑话、玩笑或反讽时，Reddit 需要给出的答案，不只是技术层面的。</p>



<p class="has-small-font-size wp-block-paragraph">来源：The Verge、Reddit 官方博客</p>

]]></content:encoded>
					
		
		
			</item>
	</channel>
</rss>
