<?xml version="1.0" encoding="UTF-8"?><rss version="2.0"
	xmlns:content="http://purl.org/rss/1.0/modules/content/"
	xmlns:wfw="http://wellformedweb.org/CommentAPI/"
	xmlns:dc="http://purl.org/dc/elements/1.1/"
	xmlns:atom="http://www.w3.org/2005/Atom"
	xmlns:sy="http://purl.org/rss/1.0/modules/syndication/"
	xmlns:slash="http://purl.org/rss/1.0/modules/slash/"
	>

<channel>
	<title>AI 训练 &#8211; mylogs.cn</title>
	<atom:link href="https://mylogs.cn/tag/ai-%e8%ae%ad%e7%bb%83/feed/" rel="self" type="application/rss+xml" />
	<link>https://mylogs.cn</link>
	<description>发现、记录、分享</description>
	<lastBuildDate>Thu, 13 Aug 2026 10:59:02 +0000</lastBuildDate>
	<language>zh-Hans</language>
	<sy:updatePeriod>
	hourly	</sy:updatePeriod>
	<sy:updateFrequency>
	1	</sy:updateFrequency>
	
	<item>
		<title>AI公司成批买旧书书商怕珍本被撕去喂模型</title>
		<link>https://mylogs.cn/ai-firms-buying-rare-books/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Thu, 13 Aug 2026 10:58:49 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI 训练]]></category>
		<category><![CDATA[Anthropic]]></category>
		<category><![CDATA[书商]]></category>
		<category><![CDATA[数据伦理]]></category>
		<category><![CDATA[版权]]></category>
		<category><![CDATA[稀有书籍]]></category>
		<guid isPermaLink="false">https://mylogs.cn/ai-firms-buying-rare-books/</guid>

					<description><![CDATA[AI 公司成批买旧书：书商怕珍本被撕去喂模型 AI 公司为了拿到高质量长文训练模型，正从二手书里找出路——买来 [&#8230;]]]></description>
										<content:encoded><![CDATA[
<h2 class="wp-block-heading">AI 公司成批买旧书：书商怕珍本被撕去喂模型</h2>



<p class="wp-block-paragraph">AI 公司为了拿到高质量长文训练模型，正从二手书里找出路——买来实体书、切掉书脊、高速扫描、再把纸本销毁。这套「破坏性扫描」成本低、速度快，却让爱书人和旧书商担心：那些不可再得的珍本，可能就这么永远没了。Ars Technica 记者 Ashley Belanger 的报道，把这股暗流摆到了台面上。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a7e5d1ba0807&quot;}" data-wp-interactive="core/image" data-wp-key="6a7e5d1ba0807" class="wp-block-image size-large aligncenter wp-lightbox-container"><img fetchpriority="high" decoding="async" width="1200" height="1109" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/6b0cc768728a5d21647d47f796caf3ec_header.webp" alt="AI公司成批买旧书书商怕珍本被撕去喂模型" class="wp-image-4703" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/6b0cc768728a5d21647d47f796caf3ec_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/6b0cc768728a5d21647d47f796caf3ec_header-300x277.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/6b0cc768728a5d21647d47f796caf3ec_header-1024x946.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/6b0cc768728a5d21647d47f796caf3ec_header-768x710.webp 768w" sizes="(max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：Unsplash（示意图）</figcaption></figure>





<h2 class="wp-block-heading">从一场官司说起的「巴拿马计划」</h2>



<p class="wp-block-paragraph">2025 年夏天，Bartz 诉 Anthropic 一案揭出 Anthropic 的「Project Panama」（巴拿马计划）：公司花数千万美元买下数百万本实体书，由服务方切去装订、裁齐书页、扫成数字文件，再把纸本丢弃。美国加州北区联邦法官威廉·阿尔苏普（William Alsup）在 2025 年 6 月的裁决中认定，合法购得后做格式转换属于「合理使用」（fair use），因为本质上只是把买来的纸本换成了可检索的数字副本。盗版部分则另算——2026 年 7 月，旧金山一家联邦法院批准了 Anthropic 与作者方高达 15 亿美元的和解。</p>



<p class="wp-block-paragraph">换句话说，法律给「买来、扫完、销毁」开了绿灯。可书商的恐惧不在这里，而在那些稀有、绝版的孤本：一旦被成批处理，世上可能再无第二本。</p>



<h2 class="wp-block-heading">书商盯上的可疑大单</h2>



<p class="wp-block-paragraph">据《大西洋月刊》报道，最近两起调查引发社交媒体哗然：先是《每日电讯报》称硅谷在销毁数百万本稀有书、连原书一起粉碎；接着 404 Media 曝光，一家叫 ISBNdb 的图书数据库公司，公然帮 AI 公司批量找书，订单从一千本到一百万本不等，还签保密协议掩盖买家身份。ISBNdb 据说还提醒客户：这事儿「观感太差」，得藏着点。Anthropic 当年也给自己的破坏性扫描起了代号，就是为了不让人知道。</p>



<p class="wp-block-paragraph">并非所有公司都走这条路。OpenAI 与微软正联手哈佛大学的馆员，用约一百万本溯源到 15 世纪的公有领域图书训练模型；埃隆·马斯克旗下的 xAI 也公开表示不会销毁珍本。Anthropic 则否认自己毁过任何珍本。只是批评者指出，马斯克没说 xAI 一本都不毁，也没界定什么叫「珍本」。</p>



<p class="wp-block-paragraph">真正的红旗出现在书店柜台。爱尔兰老牌书店 Kennys 近日收到一笔「离谱」订单：一次性要五千本冷门书。与大学、大图书馆的批量采购不同，这位买家连价都不还——在书商眼里，这几乎等于「AI 来了」的信号。Kennys 的汤姆·肯尼（Tomás Kenny）对《爱尔兰时报》说，AI 正在「吓坏我们这个行业」，他打算拒掉疑似拿去训练模型的订单，以保护作者权益和读者读到冷门书的机会。「书商常站在道德与伦理两难的最前线，多数时候轮不到我决定，」他说，「可要是他们拿一本书去扫描、意在拿走其中的知识产权，Kennys 不想成为其中一环。」有书商担心，把藏书卖给不加区分地销毁的 AI 公司，无异于「签下自己的死刑判决」。</p>



<h2 class="wp-block-heading">不毁书的另一条路</h2>



<p class="wp-block-paragraph">其实本不必如此。谷歌早在 2009 年就拿下一项非破坏性图书扫描专利（专利号 US-7508978-B1），只要肯慢下来、肯投入就能用。互联网档案馆更愿意把老书当「人力活」：自 2010 年起做图书扫描的 Eliza Zhang，用脚踩踏板抬起扫描玻璃、逐页对正、记下所有折页，十多年里扫了超过 300 万页、1.4 万张折页、1.8 万件藏品，目标是「零差错」。她说过，最老最脆的书页「薄如蝉翼」，干净干燥的人手才是最好的翻页方式。</p>



<p class="wp-block-paragraph">一边是工业化的切脊粉碎，一边是逐页轻拿轻放。公众的反感，或许会倒逼大公司学学互联网档案馆——既数字化、也把珍本原样留下来。否则对那些爱捧一本旧书在手里的人来说，最难受的画面是：稀有的，只会更稀。</p>



<p class="has-small-font-size wp-block-paragraph">来源：Ars Technica（作者 Ashley Belanger）</p>

]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>Twitch 默认拿直播喂亚马逊 AI，关掉要挖三层</title>
		<link>https://mylogs.cn/twitch-amazon-ai-training-opt-out/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Thu, 13 Aug 2026 08:38:04 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI 训练]]></category>
		<category><![CDATA[Twitch]]></category>
		<category><![CDATA[亚马逊]]></category>
		<category><![CDATA[数据隐私]]></category>
		<category><![CDATA[生成式 AI]]></category>
		<category><![CDATA[用户协议]]></category>
		<category><![CDATA[直播]]></category>
		<guid isPermaLink="false">https://mylogs.cn/twitch-amazon-ai-training-opt-out/</guid>

					<description><![CDATA[直播平台 Twitch 近日悄悄改了一项规定：默认允许亚马逊用用户频道里的直播、录像、剪辑和聊天内容去训练生成 [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">直播平台 Twitch 近日悄悄改了一项规定：默认允许亚马逊用用户频道里的直播、录像、剪辑和聊天内容去训练生成式 AI 模型。主播想退出，得自己钻进设置深处手动关闭——而且关掉之后，也不代表平台完全不再使用这些数据。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a7e5d1ba1400&quot;}" data-wp-interactive="core/image" data-wp-key="6a7e5d1ba1400" class="wp-block-image size-large aligncenter wp-lightbox-container"><img decoding="async" width="974" height="548" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/5a868e0aae8e2dad9423ed6f8ac6cba0_header.webp" alt="Twitch 默认拿直播喂亚马逊 AI，关掉要挖三层" class="wp-image-4686" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/5a868e0aae8e2dad9423ed6f8ac6cba0_header.webp 974w, https://mylogs.cn/wp-content/uploads/2026/08/5a868e0aae8e2dad9423ed6f8ac6cba0_header-300x169.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/5a868e0aae8e2dad9423ed6f8ac6cba0_header-768x432.webp 768w" sizes="(max-width: 974px) 100vw, 974px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：AppleInsider</figcaption></figure>





<h2 class="wp-block-heading">默认开启的「训练」</h2>



<p class="wp-block-paragraph">Twitch 隶属于亚马逊，后者于 2014 年将其收购。8 月 12 日，平台上线了一个名为「Training for Generative AI」的开关，默认处于开启状态。按官方说明，一旦开启，用户的直播流、点播视频、剪辑、精彩片段、聊天记录、文字与图片，都可能被用于训练「能生成或合成文本、音频、图像或视频」的亚马逊模型。</p>



<h2 class="wp-block-heading">关掉要翻三层</h2>



<p class="wp-block-paragraph">想退出并不难，只是藏得深。路径是：登录后进入账号设置，选择「安全与隐私」，一直滑到页面底部，才能看到那个开关并关闭它。更棘手的是，退出只针对「未来」的训练——Twitch 并没有说明，此前已经收集的内容是否已被用于训练；当被直接问到用户视频是否早进了训练集时，首席产品官 Mike Minton 坦言自己「不知道亚马逊到底用没用」。</p>



<p class="wp-block-paragraph">观众这边的处境更被动：用户在别人频道里发的聊天内容，归不归训练，由那个频道主的设置说了算。也就是说，即便主播在自己频道退了出，只要去别人直播间发了言，留言仍可能被吸走。</p>



<h2 class="wp-block-heading">退出不等于全停</h2>



<p class="wp-block-paragraph">关掉这个开关，并不能关掉 Twitch 上的所有 AI。自动审核（AutoMod）、字幕生成、推荐、赞助工具和安全系统仍会运行，平台称这些功能不保留频道内容去「生产」新素材。官方说法是，安全机制保护的是所有人，单人关闭会削弱整体安全，因此不提供单独开关。</p>



<h2 class="wp-block-heading">一句大实话</h2>



<p class="wp-block-paragraph">面对用户铺天盖地的批评，Minton 在被问到「为何默认开启」时，给出了一句大实话：「说白了，如果是默认关闭、需要主动勾选，根本不会有人选。」社区负责人 Mary Kish 也直言，不指望用户会为这件事感到高兴。一条高赞评论写道：「没人会主动勾选，因为没人想把创意和内容喂给 AI。」</p>



<p class="has-small-font-size wp-block-paragraph">来源：Kotaku（经 Google News 收录）</p>

]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>教 AI 干完整份工作：科技巨头抢建虚拟职场</title>
		<link>https://mylogs.cn/ai-rl-environments-training-agents-work/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Thu, 13 Aug 2026 08:37:59 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI 训练]]></category>
		<category><![CDATA[Meta]]></category>
		<category><![CDATA[强化学习]]></category>
		<category><![CDATA[智能体]]></category>
		<category><![CDATA[机器学习]]></category>
		<category><![CDATA[自动化]]></category>
		<category><![CDATA[谷歌]]></category>
		<guid isPermaLink="false">https://mylogs.cn/ai-rl-environments-training-agents-work/</guid>

					<description><![CDATA[过去几年，大模型主要靠「读书」长大：吞下书籍、网页和论坛里的海量文本，再靠人工标注员评判回答好坏。这条路造出了 [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">过去几年，大模型主要靠「读书」长大：吞下书籍、网页和论坛里的海量文本，再靠人工标注员评判回答好坏。这条路造出了能聊天的 AI，却始终没能让 AI 真正独立干完一份需要数小时、跨多步骤的工作。如今，行业正把赌注压到一种新玩法上——为 AI 搭建一座座逼真的「虚拟职场」，让它在里面反复试错、学会像员工一样完成整个任务。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a7e5d1ba1f20&quot;}" data-wp-interactive="core/image" data-wp-key="6a7e5d1ba1f20" class="wp-block-image size-large aligncenter wp-lightbox-container"><img decoding="async" width="1200" height="900" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/806bae7dd14044a8ba06e7ca6740ff7a_header.webp" alt="教 AI 干完整份工作：科技巨头抢建虚拟职场" class="wp-image-4682" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/806bae7dd14044a8ba06e7ca6740ff7a_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/806bae7dd14044a8ba06e7ca6740ff7a_header-300x225.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/806bae7dd14044a8ba06e7ca6740ff7a_header-1024x768.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/806bae7dd14044a8ba06e7ca6740ff7a_header-768x576.webp 768w" sizes="(max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：Business Insider</figcaption></figure>





<h2 class="wp-block-heading">从「背答案」到「练实操」</h2>



<p class="wp-block-paragraph">这种虚拟训练场被称为强化学习环境。与逐字预测下一个词不同，它把真实的办公场景仿真出来：AI 智能体在其中写代码、操作业务软件、做决策、推进长周期任务，做错了就重来，做对了才被强化。Scale AI 相关负责人在产品博客中写道，前沿模型越来越需要在贴近真实的模拟环境里通过试错学习，而不是只依赖静态数据集或人工偏好反馈；他透露，公司近一半的新训练项目已经涉及这类环境。</p>



<h2 class="wp-block-heading">谷歌下注虚拟职场</h2>



<p class="wp-block-paragraph">最引人注目的是一笔潜在大交易。据 Business Insider 独家报道，谷歌正洽谈向初创公司 Mechanize 投资超过 15 亿美元。这家位于旧金山的公司专门构建用于训练 AI 智能体的虚拟工作环境，交易若达成，其团队将并入谷歌，相关技术也会被授权使用，重点放在模型评估与研发上。</p>



<p class="wp-block-paragraph">Mechanize 由 AI 研究者 Tamay Besiroglu 于去年创立，目标颇为激进：实现经济的全面自动化。他认为，今天的 AI 在长周期工作上仍不可靠，根源是缺少足够真实的练习环境；公司先从软件工程切入，未来再扩展到各类白领工作。该公司测算，美国劳动者年薪总额约 18 万亿美元，全球则超过 60 万亿美元——这正是它眼中这片训练市场的规模。</p>



<h2 class="wp-block-heading">巨头也在记录员工怎么干活</h2>



<p class="wp-block-paragraph">这种思路也解释了为什么大公司突然对员工的工作方式产生兴趣。据披露，Meta 曾在内部推行一款追踪软件，采集员工的鼠标移动、点击、按键和屏幕内容，理由是帮助 AI 理解人们到底怎么用电脑——从快捷键到各类办公软件的操作逻辑。Uber 则启动了名为 Agentic Pods（智能体攻坚组）的计划，把顶尖 AI 工程师嵌入财务、法务、人力资源、市场、采购和客服等部门，先观察员工如何工作，再用 AI 围绕这些流程重新设计。</p>



<h2 class="wp-block-heading">争议与边界</h2>



<p class="wp-block-paragraph">把「人怎么工作」变成训练数据，隐私边界立刻成为焦点。员工在不知情下被记录键鼠轨迹，其合规性与透明度都受到质疑。更深层的问题是：当整个社会都成为 AI 的练习场，谁能拥有这些行为数据？无论答案如何，一个趋势已经清晰——AI 的竞争，正从「谁读得多」转向「谁更懂人怎么做」。</p>



<p class="has-small-font-size wp-block-paragraph">来源：Business Insider（经 Google News 收录）</p>

]]></content:encoded>
					
		
		
			</item>
	</channel>
</rss>
