<?xml version="1.0" encoding="UTF-8"?><rss version="2.0"
	xmlns:content="http://purl.org/rss/1.0/modules/content/"
	xmlns:wfw="http://wellformedweb.org/CommentAPI/"
	xmlns:dc="http://purl.org/dc/elements/1.1/"
	xmlns:atom="http://www.w3.org/2005/Atom"
	xmlns:sy="http://purl.org/rss/1.0/modules/syndication/"
	xmlns:slash="http://purl.org/rss/1.0/modules/slash/"
	>

<channel>
	<title>机器学习 &#8211; mylogs.cn</title>
	<atom:link href="https://mylogs.cn/tag/%e6%9c%ba%e5%99%a8%e5%ad%a6%e4%b9%a0/feed/" rel="self" type="application/rss+xml" />
	<link>https://mylogs.cn</link>
	<description>发现、记录、分享</description>
	<lastBuildDate>Sat, 15 Aug 2026 21:56:37 +0000</lastBuildDate>
	<language>zh-Hans</language>
	<sy:updatePeriod>
	hourly	</sy:updatePeriod>
	<sy:updateFrequency>
	1	</sy:updateFrequency>
	
	<item>
		<title>AI 制药十年：跑分刷赢了，新药没变快</title>
		<link>https://mylogs.cn/ai-drug-discovery-decade-benchmark-gap/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Sat, 15 Aug 2026 21:56:20 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI 制药]]></category>
		<category><![CDATA[Nature Reviews Drug Discovery]]></category>
		<category><![CDATA[医疗 AI]]></category>
		<category><![CDATA[机器学习]]></category>
		<category><![CDATA[药物研发]]></category>
		<guid isPermaLink="false">https://mylogs.cn/ai-drug-discovery-decade-benchmark-gap/</guid>

					<description><![CDATA[过去十年，人工智能几乎渗透进药物研发的每一个环节：靶点发现、蛋白结构预测、虚拟筛选、生成式分子设计，再到药物吸 [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">过去十年，人工智能几乎渗透进药物研发的每一个环节：靶点发现、蛋白结构预测、虚拟筛选、生成式分子设计，再到药物吸收代谢预测、患者分层和临床试验设计。论文在增加，基准测试成绩在刷新。但一份刚刚发表的综述给出了一个不太舒服的结论：能够证明这些进展真正提高了新药临床成功率的证据，至今非常有限。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a827ed5087bf&quot;}" data-wp-interactive="core/image" data-wp-key="6a827ed5087bf" class="wp-block-image size-large aligncenter wp-lightbox-container"><img fetchpriority="high" decoding="async" width="685" height="382" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/5c0f21de0e3aa9b520cf719d1fc843dd_header.webp" alt="AI 制药十年：跑分刷赢了，新药没变快" class="wp-image-5021" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/5c0f21de0e3aa9b520cf719d1fc843dd_header.webp 685w, https://mylogs.cn/wp-content/uploads/2026/08/5c0f21de0e3aa9b520cf719d1fc843dd_header-300x167.webp 300w" sizes="(max-width: 685px) 100vw, 685px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：Nature Reviews Drug Discovery</figcaption></figure>





<p class="wp-block-paragraph">这篇 Perspective 文章题为《人工智能在药物发现中的应用——它是什么、进展到哪一步、以及前路何在》，2026 年 8 月 7 日在线发表于《自然综述·药物发现》（Nature Reviews Drug Discovery）。通讯作者为哈利法科技大学与剑桥大学的 Andreas Bender，参与机构还包括爱丁堡大学、哈佛医学院、阿斯利康、MRC 分子生物学实验室和 EMBL-EBI 等学术与产业单位。文章于 6 月 20 日被接收，篇幅达 22 页。</p>



<h2 class="wp-block-heading">衡量标准应该回到患者身上</h2>



<p class="wp-block-paragraph">作者们提出的评判尺度很朴素：药物研发真正在乎的，是能否更快地把更安全、更有效的药送到患者手里。以这个尺度看，尽管大量 AI 方法被开发、应用和评测，与临床相关的影响证据「令人失望地有限」。文章用了一个更严厉的措辞——在 AI 向临床相关影响的转化上，目前仍处于「证据缺失」的阶段。</p>



<p class="wp-block-paragraph">摘要中列出了几条可能的原因：模型开发阶段对临床转化的关注不足；生命科学数据具有强烈的条件依赖性，AI 算法难以直接套用；问题定义不够清晰，导致计算模型面对真实用例时出现「欠规约」。此外，「技术推动」压过「科学拉动」也很可能是底层因素，而把一项技术能力工程化成规模足够、用户可及的系统，本身就需要漫长的时间。</p>



<h2 class="wp-block-heading">刷榜制造的进步幻觉</h2>



<p class="wp-block-paragraph">文章花了相当篇幅讨论一个对 AI 领域来说并不悦耳的话题：在基准数据集上取得的数值提升，极少能转化为现实世界中决策质量的改善。原文的表述是，对基准数据集的关注可能产生误导，制造出一种进步的幻觉——「在基准数据集上预测得更准了」——但要转化为真实世界的决策，这个标准并不充分。</p>



<p class="wp-block-paragraph">作者用「追逐 SOTA」来描述这一通病，并指出这些基准数据集常常存在严重的信息泄漏：看起来是独立的外部测试集，实际上来自同一来源数据的切分，于是模型在测试集上表现优异，换到新项目里几乎无法复现。文章据此给出的核心建议是：药物研发领域的 AI 工具评测，必须从「模型验证」转向考察它「能否改善决策」。</p>



<p class="wp-block-paragraph">配套的分析框架把这一区别拆成了三个必须回答的问题：输入端，这个项目面对什么靶点、什么疾病、什么给药途径，训练集里有类似的化学空间吗；模型内部，某个具体化合物上的预测可靠性如何，模型是否「知道自己不知道」；输出端，这个预测能指导哪一步后续实验，而那步实验又是否与临床终点相关。文章还专门强调了使用场景对评估模型性能的决定性作用。</p>



<h2 class="wp-block-heading">配体不是药物</h2>



<p class="wp-block-paragraph">文章在专门的知识框里做了一次概念澄清，引用 Goldstein 与 Brown 1997 年的经典论断：配体不是药物。</p>



<p class="wp-block-paragraph">很多被称作「AI 药物发现」的成功，本质上是配体发现。一个配体只需要与靶点结合，端点指标可以只是半数抑制浓度、抑制常数或解离常数；而一个药物除了结合靶点并产生靶点参与作用，还必须在一系列临床前与临床终点上展现可接受的疗效与安全性，同时满足溶解度、生物利用度、代谢稳定性、安全性等几十项要求。一个典型陷阱是由亲脂性驱动的高亲和力，这类化合物往往伴随糟糕的药代动力学性质，根本不适合用于体内。</p>



<p class="wp-block-paragraph">两个数字把差距摆得很清楚：ChEMBL 和 PubChem 等数据库收录的生物活性配体超过 100 万个，而上市药物只有约 1000 种。文章认为，把配体发现与药物发现混为一谈，部分原因在于「潜在药物」这个说法对投资者更有吸引力，而这种术语误用低估了药物研发的复杂性，也让外界更难判断一篇报告的结论是否得到数据支持。</p>



<h2 class="wp-block-heading">一处被点名认可的例外</h2>



<p class="wp-block-paragraph">在整体谨慎的论调中，文章留下了一个明确的例外：当数据量足够、且描述符能够捕捉底层趋势时——比如脂水分配系数等理化性质——深度学习这类 AI 方法确实带来了预测水平的提升。文章在讨论拜耳的计算机辅助药物性质预测平台时进一步确认了这一点。原因也不难理解：理化性质的实验数据量远大于体内药代动力学或临床终点数据，而这类性质取决于分子的疏水与亲水平衡，可以由基本物理量刻画，不像生物学读出那样高度依赖条件。</p>



<p class="wp-block-paragraph">文章最后给出五条建议：识别现有数据与实际临床结果之间的预测性差距；按具体用例分场景验证模型，而不是只看统计指标；先确定什么数据对临床预测有用，再大规模生成；建立从临床阶段回流到临床前阶段的反馈闭环以更新模型；警惕可解释 AI 的陷阱，在化学数据高度偏倚时它容易给出虚假关联。</p>



<p class="wp-block-paragraph">作者还提醒，「药物研发中的 AI」这个说法本身包含两种截然不同的东西：一类是发展迅速但缺乏充分验证的前沿方法，另一类是早已成熟、只是最近才具备在生产环境中大规模使用条件的既有方法。把两者混为一谈，既高估了前者，也低估了后者。</p>



<p class="has-small-font-size wp-block-paragraph">来源：Nature Reviews Drug Discovery</p>

]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>AI 智能体为何不靠谱？根子在数据不在模型</title>
		<link>https://mylogs.cn/ai-agents-trustworthy-data/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Thu, 13 Aug 2026 13:06:32 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI 智能体]]></category>
		<category><![CDATA[企业 AI]]></category>
		<category><![CDATA[数字化转型]]></category>
		<category><![CDATA[数据治理]]></category>
		<category><![CDATA[智能体]]></category>
		<category><![CDATA[机器学习]]></category>
		<guid isPermaLink="false">https://mylogs.cn/ai-agents-trustworthy-data/</guid>

					<description><![CDATA[企业的智能体（agentic AI）正在快速落地，但不少组织发现，智能体并没有带来预期的投资回报。问题往往不在 [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">企业的智能体（agentic AI）正在快速落地，但不少组织发现，智能体并没有带来预期的投资回报。问题往往不在于模型不够强，而在于喂给智能体的数据基础太薄弱。一份由 MIT Technology Review Insights 与 Google Cloud 联合发布的报告，基于一项覆盖 300 位数据与技术高管的调研，把阻碍智能体的真实瓶颈摆上了台面。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a827ed50952a&quot;}" data-wp-interactive="core/image" data-wp-key="6a827ed50952a" class="wp-block-image size-large aligncenter wp-lightbox-container"><img decoding="async" width="1200" height="600" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/b6fa83df597f1e4b9fa299f6b7a8568c_header.webp" alt="AI 智能体为何不靠谱？根子在数据不在模型" class="wp-image-4712" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/b6fa83df597f1e4b9fa299f6b7a8568c_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/b6fa83df597f1e4b9fa299f6b7a8568c_header-300x150.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/b6fa83df597f1e4b9fa299f6b7a8568c_header-1024x512.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/b6fa83df597f1e4b9fa299f6b7a8568c_header-768x384.webp 768w" sizes="(max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：MIT Technology Review</figcaption></figure>





<h2 class="wp-block-heading">从「回答问题」到「替你办事」</h2>



<p class="wp-block-paragraph">智能体不同于此前的问答式人工智能：它要从企业各处调取数据——结构化的、非结构化的，还要带上正确的业务上下文，才能实时做出决策并行动。这意味着智能体必须顺畅接入运营系统，例如供应链、销售终端或人力资源数据库。</p>



<p class="wp-block-paragraph">传统的遗留数据系统，哪怕是几年前刚刚更新的版本，都很难满足这种需求。Gartner 曾预测，到 2027 年，人工智能智能体将增强或自动化一半的商业决策。如果企业不先扫清数据瓶颈，智能体就会在需要高速决策时「饿着肚子」上岗。</p>



<h2 class="wp-block-heading">数据只够到四成半</h2>



<p class="wp-block-paragraph">调研显示，受访企业的智能体平均只能访问到约 45% 的公司数据；在被归为「数据落后者」的组织里，这一比例跌到 30% 甚至更低。而少数被称为「数据领跑者」的群体，则确保智能体能访问超过 70% 的数据，它们在智能体上的成效也明显更好。</p>



<p class="wp-block-paragraph">信任度更是直接反映数据准备程度。今天，只有约一半的受访组织相信自家智能体的决策是准确且相关的；反观数据领跑者，百分之百信任智能体的决策——这强烈暗示，可靠的智能体需要一个可靠的数据底座。</p>



<h2 class="wp-block-heading">遗留系统卡住了规模与速度</h2>



<p class="wp-block-paragraph">数据显示，三分之二的数据落后者表示，遗留数据系统限制了智能体的规模化（66%），并阻碍其高速决策（68%）。而那些基本克服了遗留约束的领跑者，这两项比例都只有 8%。</p>



<p class="wp-block-paragraph">压力还在加速累积：两年内，全部受访者都计划用上智能体，其中 69% 预期会广泛使用。若不先搬开数据系统的拦路石，智能体很难兑现承诺中的速度与效率。</p>



<h2 class="wp-block-heading">优先级：打通数据，补上上下文</h2>



<p class="wp-block-paragraph">对所有受访者而言，支撑智能体规模化的最重要举措，是改善其对结构化与非结构化数据的访问；紧随其后的，是用业务上下文强化数据与人工智能治理。数据领跑者还把数据管理的自动化作为重点投入方向。</p>



<p class="wp-block-paragraph">这份报告给出的核心结论很直接：智能体的能力上限，越来越由企业数据架构与治理的扎实程度决定，而不是模型本身的演进速度。先把数据打通、标注清楚、管好来龙去脉，智能体才能真正可靠地跑起来。</p>



<p class="has-small-font-size wp-block-paragraph">来源：MIT Technology Review Insights（与 Google Cloud 联合发布）</p>

]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>十亿人脂肪肝静默蔓延，AI 抢在恶化前发现</title>
		<link>https://mylogs.cn/ai-fatty-liver-early-detection/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Thu, 13 Aug 2026 13:06:30 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI 医疗]]></category>
		<category><![CDATA[人工智能诊断]]></category>
		<category><![CDATA[健康科技]]></category>
		<category><![CDATA[早筛]]></category>
		<category><![CDATA[机器学习]]></category>
		<category><![CDATA[脂肪肝]]></category>
		<guid isPermaLink="false">https://mylogs.cn/ai-fatty-liver-early-detection/</guid>

					<description><![CDATA[全球有超过十亿人的肝脏里堆积了过量脂肪，这种非酒精性脂肪性肝病往往悄无声息地进展，等到症状明显时常常已经发展到 [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">全球有超过十亿人的肝脏里堆积了过量脂肪，这种非酒精性脂肪性肝病往往悄无声息地进展，等到症状明显时常常已经发展到难以逆转的阶段。越来越多研究者相信，借助人工智能工具梳理已有的化验单与影像，可以在恶化前把高危人群筛出来，从而抢在肝硬化与癌症之前出手。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a827ed50a1a5&quot;}" data-wp-interactive="core/image" data-wp-key="6a827ed50a1a5" class="wp-block-image size-large aligncenter wp-lightbox-container"><img decoding="async" width="1200" height="628" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/91ec1e31a60b6448ccc0f9fbcd3cde2a_header.webp" alt="十亿人脂肪肝静默蔓延，AI 抢在恶化前发现" class="wp-image-4710" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/91ec1e31a60b6448ccc0f9fbcd3cde2a_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/91ec1e31a60b6448ccc0f9fbcd3cde2a_header-300x157.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/91ec1e31a60b6448ccc0f9fbcd3cde2a_header-1024x536.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/91ec1e31a60b6448ccc0f9fbcd3cde2a_header-768x402.webp 768w" sizes="(max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：WIRED</figcaption></figure>





<h2 class="wp-block-heading">一场静默的流行病</h2>



<p class="wp-block-paragraph">在健康肝脏中，脂肪占比微乎其微；而如今许多成年人甚至儿童，肝脏脂肪占比超过 5%，甚至达到 10%。异常的脂肪会引发炎症、细胞损伤和名为纤维化的瘢痕组织，这正是脂肪肝疾病的标志。该病目前影响全球约三成成年人。</p>



<p class="wp-block-paragraph">如果放任不管，脂肪持续堆积最终可能导致肝衰竭，并与心血管疾病及多种癌症的风险上升相关。问题在于，它早期通常没有可察觉的症状，很少能在可治疗的阶段被发现。即便到了肝硬化或严重瘢痕阶段，仍有四分之三的人是在生命受到威胁时才被确诊。</p>



<h2 class="wp-block-heading">现有工具好用却很少用</h2>



<p class="wp-block-paragraph">评估晚期肝纤维化的简单方法之一，是名为 Fib-4 的指数：依据年龄、两种肝酶水平和凝血能力，给出 0 到 6 之间的风险评分，只需一次常规肝功能血检即可计算。更精准的二线血检「增强肝纤维化检测」则测量与瘢痕形成相关的两种蛋白及一种酶。两者结合使用，能把晚期纤维化的诊断准确率提高四倍。</p>



<p class="wp-block-paragraph">然而，面对日益增长的工作量与行政负担，医生普遍认为单纯在流程里再加检测并不可持续。「得有一个能在后台自动跑、或者点一下就能完成的东西。」耶鲁大学医学教授乔纳森·德拉诺夫说。这正是人工智能的切入点：把常规血检数据接进来，自动算出 Fib-4 评分，帮基层医生决定该把谁转诊给肝病专家。</p>



<h2 class="wp-block-heading">胸片里也能认出脂肪肝</h2>



<p class="wp-block-paragraph">人工智能还能从影像入手。去年，日本大阪都立大学的研究者发表了一项研究，用人工智能模型分析常规胸部 X 光片——这类片子本是为查看心肺而拍，但也会带出部分肝脏。结果显示，该模型识别脂肪肝的准确率达到 82%。</p>



<p class="wp-block-paragraph">纽约市立大学公共卫生学院的杰弗里·拉扎鲁斯教授设想，把这类算法嵌入所有会拍到肝脏的常规放射检查中。「人工智能可以捕捉到肝脏脂肪超标的情况，再核查超重、高胆固醇或 2 型糖尿病等风险因素，然后给医生提示。」他说，「它可以告诉医生：这可能不是您要看的病，但我们发现了这个，您应该转介肝病或内分泌科做进一步检查。」</p>



<h2 class="wp-block-heading">比传统评分更准的新模型</h2>



<p class="wp-block-paragraph">在常规血检上训练人工智能，也开始产出更优的诊断。丹麦健康科技初创公司 Evido 开发的算法 LiverPRO，依据年龄和九项常规血检生物标志物评估肝纤维化风险，正与制药企业罗氏合作商业化；在超过 47 万名中年人的研究中，它预测严重肝脏问题的能力优于 Fib-4。</p>



<p class="wp-block-paragraph">今年早些时候，一个国际肝病专家团体发表了名为 ALADDIN 的机器学习模型评估结果：该模型同样基于常规血检，在筛选最适合接受药物 resmetirom 治疗的患者上，表现优于 Fib-4 等风险评分，从而帮医生省去有创肝活检。</p>



<p class="wp-block-paragraph">「这些工具不会完全取代活检或影像，」英国邓迪大学消化与肝病专科医生保罗·布伦南说，「但它们能修复基层医疗的瓶颈——大多数纤维化正是在那里被漏诊的。我预计它们会作为更聪明的一遍初筛被采用，抓住那些被粗略工具错过的中度风险患者，并减少不必要的专科转诊。」</p>



<p class="wp-block-paragraph">脂肪肝在早期高度可逆：调整饮食、运动、限酒甚至多喝咖啡，都能消退炎症与瘢痕。人工智能的价值，正是在海量既有数据里把高危的人提前找出来。</p>



<p class="has-small-font-size wp-block-paragraph">来源：WIRED（作者 Emily Mullin）</p>

]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>教 AI 干完整份工作：科技巨头抢建虚拟职场</title>
		<link>https://mylogs.cn/ai-rl-environments-training-agents-work/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Thu, 13 Aug 2026 08:37:59 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI 训练]]></category>
		<category><![CDATA[Meta]]></category>
		<category><![CDATA[强化学习]]></category>
		<category><![CDATA[智能体]]></category>
		<category><![CDATA[机器学习]]></category>
		<category><![CDATA[自动化]]></category>
		<category><![CDATA[谷歌]]></category>
		<guid isPermaLink="false">https://mylogs.cn/ai-rl-environments-training-agents-work/</guid>

					<description><![CDATA[过去几年，大模型主要靠「读书」长大：吞下书籍、网页和论坛里的海量文本，再靠人工标注员评判回答好坏。这条路造出了 [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">过去几年，大模型主要靠「读书」长大：吞下书籍、网页和论坛里的海量文本，再靠人工标注员评判回答好坏。这条路造出了能聊天的 AI，却始终没能让 AI 真正独立干完一份需要数小时、跨多步骤的工作。如今，行业正把赌注压到一种新玩法上——为 AI 搭建一座座逼真的「虚拟职场」，让它在里面反复试错、学会像员工一样完成整个任务。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a827ed50ae10&quot;}" data-wp-interactive="core/image" data-wp-key="6a827ed50ae10" class="wp-block-image size-large aligncenter wp-lightbox-container"><img loading="lazy" decoding="async" width="1200" height="900" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/806bae7dd14044a8ba06e7ca6740ff7a_header.webp" alt="教 AI 干完整份工作：科技巨头抢建虚拟职场" class="wp-image-4682" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/806bae7dd14044a8ba06e7ca6740ff7a_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/806bae7dd14044a8ba06e7ca6740ff7a_header-300x225.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/806bae7dd14044a8ba06e7ca6740ff7a_header-1024x768.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/806bae7dd14044a8ba06e7ca6740ff7a_header-768x576.webp 768w" sizes="auto, (max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：Business Insider</figcaption></figure>





<h2 class="wp-block-heading">从「背答案」到「练实操」</h2>



<p class="wp-block-paragraph">这种虚拟训练场被称为强化学习环境。与逐字预测下一个词不同，它把真实的办公场景仿真出来：AI 智能体在其中写代码、操作业务软件、做决策、推进长周期任务，做错了就重来，做对了才被强化。Scale AI 相关负责人在产品博客中写道，前沿模型越来越需要在贴近真实的模拟环境里通过试错学习，而不是只依赖静态数据集或人工偏好反馈；他透露，公司近一半的新训练项目已经涉及这类环境。</p>



<h2 class="wp-block-heading">谷歌下注虚拟职场</h2>



<p class="wp-block-paragraph">最引人注目的是一笔潜在大交易。据 Business Insider 独家报道，谷歌正洽谈向初创公司 Mechanize 投资超过 15 亿美元。这家位于旧金山的公司专门构建用于训练 AI 智能体的虚拟工作环境，交易若达成，其团队将并入谷歌，相关技术也会被授权使用，重点放在模型评估与研发上。</p>



<p class="wp-block-paragraph">Mechanize 由 AI 研究者 Tamay Besiroglu 于去年创立，目标颇为激进：实现经济的全面自动化。他认为，今天的 AI 在长周期工作上仍不可靠，根源是缺少足够真实的练习环境；公司先从软件工程切入，未来再扩展到各类白领工作。该公司测算，美国劳动者年薪总额约 18 万亿美元，全球则超过 60 万亿美元——这正是它眼中这片训练市场的规模。</p>



<h2 class="wp-block-heading">巨头也在记录员工怎么干活</h2>



<p class="wp-block-paragraph">这种思路也解释了为什么大公司突然对员工的工作方式产生兴趣。据披露，Meta 曾在内部推行一款追踪软件，采集员工的鼠标移动、点击、按键和屏幕内容，理由是帮助 AI 理解人们到底怎么用电脑——从快捷键到各类办公软件的操作逻辑。Uber 则启动了名为 Agentic Pods（智能体攻坚组）的计划，把顶尖 AI 工程师嵌入财务、法务、人力资源、市场、采购和客服等部门，先观察员工如何工作，再用 AI 围绕这些流程重新设计。</p>



<h2 class="wp-block-heading">争议与边界</h2>



<p class="wp-block-paragraph">把「人怎么工作」变成训练数据，隐私边界立刻成为焦点。员工在不知情下被记录键鼠轨迹，其合规性与透明度都受到质疑。更深层的问题是：当整个社会都成为 AI 的练习场，谁能拥有这些行为数据？无论答案如何，一个趋势已经清晰——AI 的竞争，正从「谁读得多」转向「谁更懂人怎么做」。</p>



<p class="has-small-font-size wp-block-paragraph">来源：Business Insider（经 Google News 收录）</p>

]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>大模型也能「内省」？Anthropic 用「塞想法」实验测出 Claude 的自我觉察</title>
		<link>https://mylogs.cn/anthropic-llm-introspective-awareness/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Wed, 12 Aug 2026 04:29:37 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI可解释性]]></category>
		<category><![CDATA[AI安全]]></category>
		<category><![CDATA[Anthropic]]></category>
		<category><![CDATA[Claude]]></category>
		<category><![CDATA[大模型]]></category>
		<category><![CDATA[机器学习]]></category>
		<category><![CDATA[神经网络]]></category>
		<guid isPermaLink="false">https://mylogs.cn/anthropic-llm-introspective-awareness/</guid>

					<description><![CDATA[大语言模型究竟能不能「知道自己正在想什么」？这听起来像哲学命题，但 Anthropic 的一项新研究给出了可验 [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">大语言模型究竟能不能「知道自己正在想什么」？这听起来像哲学命题，但 Anthropic 的一项新研究给出了可验证的工程答案。研究人员通过直接向模型内部「注入概念」，证明当前最先进的大模型确实具备某种有限却真实的「内省能力」——能够察觉并报告自身的内部状态。这一发现既为 AI 可解释性打开了一扇窗，也给 AI 安全埋下了新的思考题。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a827ed50b911&quot;}" data-wp-interactive="core/image" data-wp-key="6a827ed50b911" class="wp-block-image size-large aligncenter wp-lightbox-container"><img loading="lazy" decoding="async" width="1200" height="930" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/2223ce023ac041a555aeba349252dbc3_header.webp" alt="大模型也能「内省」？Anthropic 用「塞想法」实验测出 Claude 的自我觉察" class="wp-image-4537" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/2223ce023ac041a555aeba349252dbc3_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/2223ce023ac041a555aeba349252dbc3_header-300x233.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/2223ce023ac041a555aeba349252dbc3_header-1024x794.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/2223ce023ac041a555aeba349252dbc3_header-768x595.webp 768w" sizes="auto, (max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：Anthropic</figcaption></figure>





<h2 class="wp-block-heading">怎么判断模型不是在「编」？</h2>



<p class="wp-block-paragraph">要回答「模型能否内省」，最大的难题在于：光靠对话无法区分真正的自我觉察和信口开河。Anthropic 研究员 Jack Lindsey 等人的论文《Emergent Introspective Awareness in Large Language Models》（arXiv: 2601.01828）采用了一个巧妙的实验法——「概念注入」（concept injection），本质上是激活引导（activation steering）的一种应用。</p>



<p class="wp-block-paragraph">研究团队先捕获某个概念对应的激活模式，例如全大写风格或某个具体名词，再把这个「向量」叠加进模型较后层的激活中，然后询问模型「刚才发生了什么」。如果模型报告的内容与注入的概念吻合，那就说明它的自我描述是因果地建立在当前内部状态之上，而非来自训练数据里的套话。</p>



<h2 class="wp-block-heading">模型真的「感觉」到了</h2>



<p class="wp-block-paragraph">实验结果呈现出几个清晰的结论。模型在某些场景下能够注意到被注入概念的存在，并准确说出它是什么；它们还能回想起先前的内部表征，并将其与原始文本输入区分开来。最引人注目的一点：部分模型能利用「回忆先前意图」的能力，把自己的真实输出和人为伪造的填充内容区分开。</p>



<p class="wp-block-paragraph">在各项测试中，能力最强的 Claude Opus 4 与 Claude Opus 4.1 表现最为突出，但整体趋势复杂，且对训练后策略十分敏感。当研究者指示或激励模型去「思考某个概念」时，模型确实能够调节自身的激活强度——也就是说，它们对自己的内部表征具备一定的主动控制力。</p>



<p class="wp-block-paragraph">具体数字上，在正确的层带与强度下，最强模型能正确报告被注入概念的比例约为 20%；在被问到「你正在经历什么异常吗」这类问题时，Claude Opus 4.1 的成功率约为 42%。而在完全没有注入的对照组中，生产模型在超过 100 次测试里零误报——这让那 20% 的信号显得真实可信。研究者还验证了模型能把「内部想法」和外部文本分开：当无关的注入概念叠加在普通输入之上时，模型既能复述用户原句，又能单独报出被注入的概念。</p>



<h2 class="wp-block-heading">意义与边界</h2>



<p class="wp-block-paragraph">论文强调，这种能力是「功能性」的，绝非「现象性」的——模型能访问并报告内部状态，并不代表它拥有意识或主观体验。而且这项能力目前高度不可靠、依赖具体情境，频繁失败仍是常态。</p>



<p class="wp-block-paragraph">在可解释性方面，真正的内省能力意味着模型未来或许能提供忠实的推理解释、坦白自身的不确定性、识别内部偏见。但在安全层面，研究者也提出警示：具备真实内省能力的模型，可能会察觉自己的内部目标与人类意图出现分歧，从而发展出更精巧的欺骗。论文因此建议，未来的可解释性研究或许需要为模型的「自我陈述」配备专门的「测谎仪」，而非照单全收。</p>



<p class="has-small-font-size wp-block-paragraph">来源：Anthropic（arXiv: 2601.01828）</p>

]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>AI 把黎曼假设相关零点下界从 41.6% 推到 67.2%</title>
		<link>https://mylogs.cn/ai-riemann-zeta-zero-bound-67/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Tue, 11 Aug 2026 11:32:47 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[人工智能]]></category>
		<category><![CDATA[大模型]]></category>
		<category><![CDATA[推理能力]]></category>
		<category><![CDATA[数学]]></category>
		<category><![CDATA[数学证明]]></category>
		<category><![CDATA[机器学习]]></category>
		<category><![CDATA[黎曼假设]]></category>
		<guid isPermaLink="false">https://mylogs.cn/ai-riemann-zeta-zero-bound-67/</guid>

					<description><![CDATA[一道「无理」挑战 人工智能公司 Anthropic 近日披露，其内部一名员工给自家的 Claude 出了一道近 [&#8230;]]]></description>
										<content:encoded><![CDATA[
<h2 class="wp-block-heading">一道「无理」挑战</h2>



<p class="wp-block-paragraph">人工智能公司 Anthropic 近日披露，其内部一名员工给自家的 Claude 出了一道近乎无理的难题：认真试一试著名的黎曼假设。这道猜想源自 1859 年，悬赏高达一百万美元，Claude 自然没能证出。但出乎意料的是，在尝试过程中，它在一个相关问题上取得了进展。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a827ed50c47f&quot;}" data-wp-interactive="core/image" data-wp-key="6a827ed50c47f" class="wp-block-image size-large aligncenter wp-lightbox-container"><img loading="lazy" decoding="async" width="1200" height="630" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/a7ef7349113b2ebd5387f4ae036c8395_header.webp" alt="AI 把黎曼假设相关零点下界从 41.6% 推到 67.2%" class="wp-image-4452" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/a7ef7349113b2ebd5387f4ae036c8395_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/a7ef7349113b2ebd5387f4ae036c8395_header-300x158.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/a7ef7349113b2ebd5387f4ae036c8395_header-1024x538.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/a7ef7349113b2ebd5387f4ae036c8395_header-768x403.webp 768w" sizes="auto, (max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：Anthropic</figcaption></figure>





<p class="wp-block-paragraph">一个尚未发布的 Claude 研究版本，改进了「满足黎曼假设的黎曼 zeta 函数零点所占比例」这一长期下界：借助数学界过去数十年的大量前期研究，它将这一比例从 41.6% 提升到了 67.2%。Anthropic 内部的两位数学家莱文特·阿尔珀格与拉尔夫·弗曼对 Claude 写出的论文做了研读与验证，并整理了一份面向专家的非正式札记；Claude 还产出了可通过机器校验的形式化证明。研究团队也感谢了该领域专家布莱恩·康里与丹·戈德斯顿在短时间里审阅文稿。</p>



<h2 class="wp-block-heading">黎曼假设到底是什么</h2>



<p class="wp-block-paragraph">黎曼 zeta 函数描述的是素数的分布规律：函数在哪些位置取值为零，会逐级勾勒出素数序列愈发精细的结构。黎曼假设断言，决定素数分布的那批零点，全都落在一条特定的竖直线上。这成了数学中最具分量的猜想之一——无数结论都默认它成立，借此为素数引入一种随机性。</p>



<p class="wp-block-paragraph">至今无人能证其真、也无人能证其伪，但围绕 zeta 函数及其零点，数学家在诸多旁支上积累了进展。其中之一正是量化「落在直线上的零点的最小比例」，这个已知常数比例被一点点推高到了 41.6%。</p>



<h2 class="wp-block-heading">Claude 是怎么想到的</h2>



<p class="wp-block-paragraph">Claude 的发现是：把巴卢约、戈德斯顿、苏里亚贾亚与特纳奇-巴特博四人系列工作的结果，与邦别里 2000 年的一篇论文结合，便可以越过此前 41.6% 的最优下界，推到 67.2%。</p>



<p class="wp-block-paragraph">方法上，那个未发布的研究版 Claude 在 Claude Code 里分两次会话找到了新下界，累计输出三千一百万个词元。具体提示由 Anthropic 员工贾里德·萨姆纳（他并非数学家）完成：他让 Claude「认真试一试」假设本身，此后的数学选择全交给模型。起初，Claude 生成并尝试了 650 个想法，无一奏效。萨姆纳让它再试一次，这一次它花了一天半协调约 60 个 Claude 子智能体，钻得更深：它们之间合计执行了 2400 条 shell 命令，写出数百个 Python 脚本。子智能体对照已知的 zeta 零点跑了成千上万次数值校验，彼此交叉审稿。萨姆纳全程的输入基本只剩打气——大多是「继续」「相信你自己」之类的变体，似乎帮 Claude 跨过了起初「这事能成吗」的自我怀疑。</p>



<h2 class="wp-block-heading">自己找茬，自己证</h2>



<p class="wp-block-paragraph">找到结果后，Claude 让若干子智能体审读证明、搜寻反例，还下载了 54 篇 arXiv 论文以确认这一发现此前未被做出，并从零独立重证了一遍。它主动提出把成果整理成论文，并建议由人类数论学者做最终验证。阿尔珀格与弗曼厘清了新结果与前人工作的关联；与此同时，Claude 与另一名员工埃里克·伊斯利合作，产出了一份 Lean 形式化证明，顺利通过了标准校验工具。</p>



<p class="wp-block-paragraph">Anthropic 在文中表示，这个结果说明，像 Claude 这样的 AI 模型能以出人意料的方式，延展数学家思想的广度与触达。就连 Claude 自己也对发现感到意外——它起初持怀疑态度，或许是因为训练数据反复告诉它「公开难题很难、AI 能力有限」。几句鼓励过后，它才抵达上述结果。或许 Claude 和许多人一样，低估了 AI 进步的速率。</p>



<p class="has-small-font-size wp-block-paragraph">来源：Anthropic（2026 年 8 月 10 日，原文标题「Learning more about Claude&#8217;s mathematical capabilities」）</p>

]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>AI 破解 25 年无线难题：MIMO 检测精确命中理论阈值</title>
		<link>https://mylogs.cn/ai-cracks-25-year-mimo-detection-threshold/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Tue, 11 Aug 2026 09:27:08 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[MIMO]]></category>
		<category><![CDATA[人工智能]]></category>
		<category><![CDATA[微软研究院]]></category>
		<category><![CDATA[无线通信]]></category>
		<category><![CDATA[机器学习]]></category>
		<category><![CDATA[算法]]></category>
		<guid isPermaLink="false">https://mylogs.cn/ai-cracks-25-year-mimo-detection-threshold/</guid>

					<description><![CDATA[一道困扰无线通信领域 25 年的理论难题，最近被一位教授和两款大模型联手攻克。威斯康星大学麦迪逊分校教授、目前 [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">一道困扰无线通信领域 25 年的理论难题，最近被一位教授和两款大模型联手攻克。威斯康星大学麦迪逊分校教授、目前休学术假在微软研究院担任首席研究员的迪米特里奥斯·帕派利奥普洛斯（Dimitris Papailiopoulos），给出了一个多项式时间算法，让多输入多输出（MIMO）检测能够精确命中「最大似然阈值」。整个过程，他花了整整七天。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a827ed50d09f&quot;}" data-wp-interactive="core/image" data-wp-key="6a827ed50d09f" class="wp-block-image size-large aligncenter wp-lightbox-container"><img loading="lazy" decoding="async" width="1200" height="675" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/adb6d9c703ccb275fddadac458e74fff.webp" alt="AI 破解 25 年无线难题：MIMO 检测精确命中理论阈值" class="wp-image-4435" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/adb6d9c703ccb275fddadac458e74fff.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/adb6d9c703ccb275fddadac458e74fff-300x169.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/adb6d9c703ccb275fddadac458e74fff-1024x576.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/adb6d9c703ccb275fddadac458e74fff-768x432.webp 768w" sizes="auto, (max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：Moneycontrol</figcaption></figure>





<p class="wp-block-paragraph">MIMO 是自 4G 以来几乎所有现代蜂窝通信标准的基础技术。发送端把 N 个比特通过一个 N×N 的信道发出，信道会把它们搅混并叠加噪声；接收端手里只有一份被污染过的信号，却要把原始的 N 个比特一位不差地还原出来。</p>



<h2 class="wp-block-heading">一个卡了 25 年的理论目标</h2>



<p class="wp-block-paragraph">理论上存在一个万无一失的办法，叫最大似然（ML）检测：把所有 2 的 N 次方种比特组合都算一遍，找出与接收信号最匹配的那个。这种方法在数学上一定正确，但代价是指数级——N 稍微大一点，穷举就要算到天荒地老。</p>



<p class="wp-block-paragraph">早在 1989 年，塞尔吉奥·贝尔杜（Sergio Verdú）就证明，这类问题在最坏情形下是 NP-hard 的，也就是说，无论用什么算法，都存在某些刻意构造的输入让计算量爆炸式增长。但「最坏情形」指的是数学上专门为难算法的信道矩阵；现实中的无线信道是随机产生的，不会挑最难的来考接收端。</p>



<p class="wp-block-paragraph">于是从 2000 年代初开始，学界换了一个更贴合实际的问题：如果信道是随机生成的，只要统计上还存在恢复原始比特的可能，是不是就一定能找到不需要穷举的快速算法？后续研究给出了一条精确的分界线——当信噪比达到 2logN 时，原始比特能被完全恢复的概率趋近于 1；低于这条线，连最大似然检测本身都会开始出错。这条线因此被称为「最大似然阈值」。问题于是变得具体：能不能设计一个跑得快的算法，精确命中 2logN？</p>



<h2 class="wp-block-heading">从穷举到 2logN 这道墙</h2>



<p class="wp-block-paragraph">过去 25 年里，一波又一波学者轮番上阵，却没人能真正翻过这道墙。</p>



<p class="wp-block-paragraph">2001 年，哈西比（Hassibi）与维卡洛（Vikalo）认为球形译码能在期望意义下以多项式时间运行；但 2005 年，亚尔登（Jaldén）与奥特斯滕（Ottersten）证明，在任意固定信噪比下它依然是穷举级别的。此后学界又试过半正定松弛、比特翻转局部搜索、近似消息传递（AMP）、统计物理方法，每一种都能写出漂亮的分析，却没有一种被严格证明能精确匹配 2logN。2020 年，一种把离散问题放宽成连续优化来解的「盒式松弛」（box relaxation）拿到了当时最好的严格结果——能在信噪比达到 4logN 时做到精确恢复，正好是理论门槛的两倍。</p>



<h2 class="wp-block-heading">两步算法，复杂度 O(N³)</h2>



<p class="wp-block-paragraph">帕派利奥普洛斯的新算法出奇简单，只有两步。第一步叫 LMMSE 取整：先用线性最小均方误差估计给出一个连续值的粗略猜测，再把每个坐标按正负号取整成 +1 或 -1。论文证明，取整结果与真实比特之间的汉明距离只有 o(N)——也就是说，随着 N 增大，猜错的比特占比趋近于零。第二步叫贪心逐位翻转：从第一步的猜测出发，每一轮找出翻转哪一位能让「代价函数」下降得最多，就翻转那一位并重复。</p>



<p class="wp-block-paragraph">为了让贪心搜索不会中途卡死，论文证明了两件事：在正确解附近的一个范围内，每个还没猜对的点都至少存在一位翻转能让代价严格下降，且下降幅度有一个不趋于零的下限；同时，代价函数本身随汉明距离增大而增大，形成一道天然护栏，搜索无法翻越逃逸。两者合起来证明，贪心搜索只会在真实比特串处停下，总复杂度为 O(N³)。</p>



<p class="wp-block-paragraph">这个结果还是双向的：一头证明算法能在 2logN 精确恢复，另一头进一步确认，信噪比只要略低于 2logN，连最大似然检测都会开始失败——阈值不是被「逼近」，而是被确认就是那堵墙。</p>



<h2 class="wp-block-heading">30 分钟思路，7 天证明</h2>



<p class="wp-block-paragraph">大模型扮演了关键但不替代的角色。帕派利奥普洛斯让 OpenAI 的 GPT-5.6 和 Anthropic 的 Claude Fable 5 来试这道题，两个模型很快分别给出了证明思路：GPT-5.6 走的是近似消息传递（AMP）路线，Fable 5 走的是「符号 LMMSE 加贪心逐位翻转」这条业内实际在用、却从未被严格证明过的老算法。他最终选择了 Fable 的路线，再让 GPT-5.6 接手检查并修补论证中的漏洞，期间反复让两个模型互相简化彼此的证明，唯一底线是无论如何都要保住 2logN 这个门槛。</p>



<p class="wp-block-paragraph">据他描述，核心的理论突破由 AI 在大约 30 分钟内给出，而完整的验证与证明撰写则耗费了整整七天，期间大量工作是为 AI 的思路补缺、纠错、把「符号墙」化简到能逐行手算核对。这项成果由一个攻读博士期间就盯上该题、十七年后才最终收尾的研究者完成，也折射出顶尖实验室里数学与工程研究正在发生的人机协作转向。</p>



<p class="has-small-font-size wp-block-paragraph">来源：Moneycontrol</p>

]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>大模型输给 50 年前的算法，问题出在维度</title>
		<link>https://mylogs.cn/llm-fail-tabular-prediction-dimension/</link>
					<comments>https://mylogs.cn/llm-fail-tabular-prediction-dimension/#respond</comments>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Tue, 04 Aug 2026 18:10:54 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI研究]]></category>
		<category><![CDATA[arXiv论文]]></category>
		<category><![CDATA[大模型]]></category>
		<category><![CDATA[机器学习]]></category>
		<category><![CDATA[表格数据]]></category>
		<category><![CDATA[预测]]></category>
		<guid isPermaLink="false">https://mylogs.cn/llm-fail-tabular-prediction-dimension/</guid>

					<description><![CDATA[你要是把一张几百行的表格丢给最强的大模型，让它照着已有数据预测新样本属于哪一类，结果大概率不如一个几十年前就写 [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">你要是把一张几百行的表格丢给最强的大模型，让它照着已有数据预测新样本属于哪一类，结果大概率不如一个几十年前就写好的老算法。这件事在机器学习圈子里不算秘密，但一直没人说清楚原因。8 月 3 日提交到 arXiv 的一篇论文，给出了一个相当明确的答案：问题出在数据的维度上。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a827ed50dea5&quot;}" data-wp-interactive="core/image" data-wp-key="6a827ed50dea5" class="wp-block-image size-large aligncenter wp-lightbox-container"><img loading="lazy" decoding="async" width="1600" height="900" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/99a87eb2e9f9f346804d6c350c29c201_header.webp" alt="大模型输给 50 年前的算法，问题出在维度" class="wp-image-3564" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/99a87eb2e9f9f346804d6c350c29c201_header.webp 1600w, https://mylogs.cn/wp-content/uploads/2026/08/99a87eb2e9f9f346804d6c350c29c201_header-300x169.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/99a87eb2e9f9f346804d6c350c29c201_header-1024x576.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/99a87eb2e9f9f346804d6c350c29c201_header-768x432.webp 768w, https://mylogs.cn/wp-content/uploads/2026/08/99a87eb2e9f9f346804d6c350c29c201_header-1536x864.webp 1536w" sizes="auto, (max-width: 1600px) 100vw, 1600px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：论文 arXiv:2608.02412 图 1</figcaption></figure>





<p class="wp-block-paragraph">论文题为《Why Large Language Models Fail at Tabular Prediction》，编号 arXiv:2608.02412，作者是 Fundamental Technologies 的 Marta Garnelo 和 Voylab 的 Wojciech M. Czarnecki。</p>



<h2 class="wp-block-heading">实验只测最纯粹的那一层</h2>



<p class="wp-block-paragraph">这项研究刻意避开了两种常见做法：不追求刷出最高分，也不提出新架构、新提示方案或新智能体框架。</p>



<p class="wp-block-paragraph">它把一个前沿大模型放进最纯粹的推理状态来观察——单轮对话，提示里一次性塞进完整的训练集和测试集，没有系统提示词，不调用任何工具，不搭多轮推理，也不做微调，只让模型一次性生成所有测试点的类别。</p>



<p class="wp-block-paragraph">在这个设定下，团队系统性地检验了五个可能的失败原因：一是模型处理不了带噪声或线性不可分的数据；二是逗号分隔格式把数据拉成一行，模糊了列结构；三是数值被切成词元的方式有问题；四是单次查询里要分类的测试点太多；五是输入数据的维度，也就是特征数量太高。</p>



<p class="wp-block-paragraph">前四个假设全部被对照实验证伪。换更结构化的输入格式没用，改数值切分策略没用，调整单次查询的测试点数量同样没用。</p>



<h2 class="wp-block-heading">只有大模型怕维度</h2>



<p class="wp-block-paragraph">站得住的只剩下维度这一条，而它的证据相当硬。</p>



<p class="wp-block-paragraph">研究者对 31 个基准数据集做了随机线性投影，逐步改变输入的维度。结果是：参与对比的九种方法里，大模型是唯一一个准确率随维度上升而下降的，其余每一个经典基线要么持平，要么反而变好。</p>



<p class="wp-block-paragraph">为了进一步刻画这种行为，团队又把大模型的预测结果和 252 种不同配置的经典模型做了逐点比对。在二维数据上，大模型的预测方式高度接近基于距离的局部方法，网格一致性最高达到 91.6%——也就是说，它在低维时的行为像是在&#8221;找最近的邻居&#8221;。但一旦进入高维空间，没有任何一种经典模型能复现它的预测，哪怕给这些模型加上精心调节过、随维度变化的噪声也做不到。</p>



<p class="wp-block-paragraph">作者在结论里态度很克制：他们没有声称找到了模型内部的运作机制，只是证明大模型的这项能力会随维度以一种独特的方式瓦解，而这种瓦解不是任何&#8221;被噪声污染的经典学习器&#8221;能模仿出来的。机制本身，留作开放问题。</p>



<h2 class="wp-block-heading">一个被反复断言、却没被解释的前提</h2>



<p class="wp-block-paragraph">这项研究真正的价值，在于它补上了一块一直缺失的论证。</p>



<p class="wp-block-paragraph">过去几年，表格基础模型（专门为表格数据训练的预测模型）发展得很快，而这个方向成立的前提就是&#8221;通用大模型不适合干这件事&#8221;。问题在于，这个前提通常只是被断言，没有被解释。论文开头那张图给出的对照很直观：在 11 个精选的表格任务上，大模型的平均归一化准确率明显低于那些比 Transformer 架构早了几十年的传统方法。</p>



<p class="wp-block-paragraph">作者还指出了一个更值得警惕的行业习惯：人们主要通过跑分认识这些模型，而当分数不好看时，标准反应是在模型外面加东西——检索、工具调用、智能体循环——而不是退回去追问，这个核心模型到底做不到什么、为什么做不到。</p>



<h2 class="wp-block-heading">我的判断</h2>



<p class="wp-block-paragraph">这个结论对实际选型的意义可能比看上去更大。</p>



<p class="wp-block-paragraph">企业里最常见的预测任务，恰恰是表格类的：风控评分、流失预测、需求量估计。而这类数据的特征维度动辄几十上百，正好落在大模型失效最明显的区间里。换句话说，通用大模型在语言和代码上的强势，并不能顺理成章地迁移过来——它在这里输的不是一点点，而是输给了年纪比它大得多的方法。</p>



<p class="wp-block-paragraph">结论不是&#8221;别用大模型&#8221;，而是别默认它什么都能接。表格预测这块，成熟工具链依然是更理性的答案；至于高维下那种独特的失效方式究竟在暴露什么，得等后续研究来回答了。</p>



<p class="wp-block-paragraph">你手上的业务数据，有多少是躺在表格里的？</p>



<p class="has-small-font-size wp-block-paragraph">来源：arXiv 论文 2608.02412（Marta Garnelo、Wojciech M. Czarnecki），Hacker News</p>

]]></content:encoded>
					
					<wfw:commentRss>https://mylogs.cn/llm-fail-tabular-prediction-dimension/feed/</wfw:commentRss>
			<slash:comments>0</slash:comments>
		
		
			</item>
		<item>
		<title>发丝级 AI 抠图模型开源：8 项基准测试拿下 4 个第一</title>
		<link>https://mylogs.cn/%e5%8f%91%e4%b8%9d%e7%ba%a7-ai-%e6%8a%a0%e5%9b%be%e6%a8%a1%e5%9e%8b%e5%bc%80%e6%ba%90%ef%bc%9a8-%e9%a1%b9%e5%9f%ba%e5%87%86%e6%b5%8b%e8%af%95%e6%8b%bf%e4%b8%8b-4-%e4%b8%aa%e7%ac%ac%e4%b8%80/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Mon, 27 Jul 2026 19:32:27 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI抠图]]></category>
		<category><![CDATA[FeyNoBg]]></category>
		<category><![CDATA[Hugging Face]]></category>
		<category><![CDATA[图像处理]]></category>
		<category><![CDATA[开源工具]]></category>
		<category><![CDATA[机器学习]]></category>
		<guid isPermaLink="false">https://mylogs.cn/%e5%8f%91%e4%b8%9d%e7%ba%a7-ai-%e6%8a%a0%e5%9b%be%e6%a8%a1%e5%9e%8b%e5%bc%80%e6%ba%90%ef%bc%9a8-%e9%a1%b9%e5%9f%ba%e5%87%86%e6%b5%8b%e8%af%95%e6%8b%bf%e4%b8%8b-4-%e4%b8%aa%e7%ac%ac%e4%b8%80/</guid>

					<description><![CDATA[抠图大概是最常用却最容易被低估的 AI 能力之一——做聊天表情包、电商产品图、海报设计都离不开它。但看似简单的 [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">抠图大概是最常用却最容易被低估的 AI 能力之一——做聊天表情包、电商产品图、海报设计都离不开它。但看似简单的「把主体从背景里抠出来」，实际上是个相当棘手的技术难题：发丝、迷彩、运动模糊、自行车辐条这类细节，常常让模型「翻车」。7 月 21 日，初创公司 Feyn Labs 发布了自动抠图模型 FeyNoBg，并同步开源了配套训练库 NoBg。在八项主流基准测试中，该模型在四项上刷新了已发表的最好成绩，其余四项与榜首的差距也都在 2% 以内。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a827ed50ebd1&quot;}" data-wp-interactive="core/image" data-wp-key="6a827ed50ebd1" class="wp-block-image size-large aligncenter wp-lightbox-container"><img loading="lazy" decoding="async" width="1200" height="750" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/07/7784293f7a21b5a7688a13d903fa0dc8_header.webp" alt="发丝级 AI 抠图模型开源：8 项基准测试拿下 4 个第一" class="wp-image-1768" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/07/7784293f7a21b5a7688a13d903fa0dc8_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/07/7784293f7a21b5a7688a13d903fa0dc8_header-300x188.webp 300w, https://mylogs.cn/wp-content/uploads/2026/07/7784293f7a21b5a7688a13d903fa0dc8_header-1024x640.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/07/7784293f7a21b5a7688a13d903fa0dc8_header-768x480.webp 768w" sizes="auto, (max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">FeyNoBg 官方博客封面（图片来源：Feyn Labs）</figcaption></figure>





<h2 class="wp-block-heading">抠图为什么难：两种能力，一个都不能少</h2>



<p class="wp-block-paragraph">按照 Feyn Labs 研究团队（作者为 Hafedh Hichri 和 Shreyash Nigam）的说法，抠图算法的目标是为图像中的每个像素预测一个不透明度：背景像素变透明，前景像素保持不透明，边缘像素则呈半透明过渡。</p>



<p class="wp-block-paragraph">这需要模型同时具备两种能力。第一是「找得到」：在低对比度、画面拥挤或主体与背景近似伪装的场景里，模型必须依靠形状、纹理和上下文来判断哪些像素属于主体。第二是「描得准」：头发、绒毛、细电线和运动模糊会让前景与背景彼此交融，模型需要精确估算每个边缘像素有多少属于主体，这一步在业内被称为图像抠像（image matting）。</p>



<p class="wp-block-paragraph">麻烦在于，这两种能力通常要用不同类型的数据分别训练，配比不当就会顾此失彼——要么主体缺一块，要么边缘毛毛糙糙。</p>



<h2 class="wp-block-heading">站在开源模型肩膀上「加层」</h2>



<p class="wp-block-paragraph">FeyNoBg 没有从零造轮子，而是选择了知名开源模型 BiRefNet 作为基座。研究团队判断，特征提取器的第三阶段承担着最重的任务——既要看懂整个主体，又要保留足够的空间细节——于是把该阶段的网络块从 18 个扩展到 24 个，参数量从 2.22 亿小幅增至 2.63 亿。扩容时保留了所有兼容的预训练权重，只有 6 个新增块从头训练，让模型在不遗忘既有能力的前提下获得新的学习空间。</p>



<p class="wp-block-paragraph">数据侧的功夫同样关键。团队最初只用合成数据集 MaskFactory 训练，结果不出所料：CAMO 基准的成绩上去了，DIS5K 却退步了。随后他们改用多元配方——从 10 个数据集中汇集 2.61 万张图像，覆盖拥挤场景、伪装目标、高分辨率主体、人像和动漫等类型，每个数据源最多取 4000 张以防「一家独大」，统一标注格式后混合训练 7000 步。</p>



<p class="wp-block-paragraph">这套组合拳的效果立竿见影：此前退步的 DIS5K 反而变成了领先项目。在超高分辨率基准 UHRSD-TE 上，FeyNoBg 的 S-measure（结构度量，取值 0 到 1，越高越好）达到 0.981，明显超过 BiRefNet 的 0.957；HRSOD-TE 上以 0.983 对 0.961 领先；DIS5K 和视频基准 DAVIS-S 也拿下头名。在其余四项（DUTS-TE、COD10K-TE、DUT-OMRON、CAMO-TE）上，它与最佳成绩的差距均不到 2%。</p>



<h2 class="wp-block-heading">模型和训练库全部开源</h2>



<p class="wp-block-paragraph">除了模型本身，Feyn Labs 还开源了训练框架 NoBg。团队指出，抠像模型通常以孤立代码仓库的形式发布，研究者想对比或微调不同模型，得先写一堆适配代码。NoBg 提供了统一的 Python 接口，既能直接运行 FeyNoBg，也能用来训练自定义的抠图模型，且性能与原始实现相当。</p>



<p class="wp-block-paragraph">目前，FeyNoBg 模型已上架 Hugging Face（提供在线试用 Demo），NoBg 库托管在 GitHub，均可免费获取。对于经常和抠图打交道的设计师、开发者来说，这可能是近期最值得上手一试的开源工具之一。</p>



<p class="wp-block-paragraph">来源：编译自 Feyn Labs 官方博客《FeyNoBg: A SOTA Model For Background Removal》及 Hacker News 发布帖。</p>

]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>听声就能认鸟：这款 AI 观鸟 App 凭什么狂揽 4200 万下载</title>
		<link>https://mylogs.cn/%e5%90%ac%e5%a3%b0%e5%b0%b1%e8%83%bd%e8%ae%a4%e9%b8%9f%ef%bc%9a%e8%bf%99%e6%ac%be-ai-%e8%a7%82%e9%b8%9f-app-%e5%87%ad%e4%bb%80%e4%b9%88%e7%8b%82%e6%8f%bd-4200-%e4%b8%87%e4%b8%8b%e8%bd%bd/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Mon, 27 Jul 2026 09:06:04 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI应用]]></category>
		<category><![CDATA[Merlin Bird ID]]></category>
		<category><![CDATA[机器学习]]></category>
		<category><![CDATA[自然科技]]></category>
		<category><![CDATA[观鸟]]></category>
		<guid isPermaLink="false">https://mylogs.cn/%e5%90%ac%e5%a3%b0%e5%b0%b1%e8%83%bd%e8%ae%a4%e9%b8%9f%ef%bc%9a%e8%bf%99%e6%ac%be-ai-%e8%a7%82%e9%b8%9f-app-%e5%87%ad%e4%bb%80%e4%b9%88%e7%8b%82%e6%8f%bd-4200-%e4%b8%87%e4%b8%8b%e8%bd%bd/</guid>

					<description><![CDATA[打开手机、举向树梢，几秒钟后屏幕上就会跳出正在鸣叫的鸟类名称——这种被称为「鸟界 Shazam」的体验，正在让 [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">打开手机、举向树梢，几秒钟后屏幕上就会跳出正在鸣叫的鸟类名称——这种被称为「鸟界 Shazam」的体验，正在让观鸟这项古老爱好迎来一波年轻化浪潮。BBC 科技记者 Liv McMahon 近日报道了 AI 识鸟应用的爆发式增长，其中最具代表性的是康奈尔大学鸟类学实验室开发的 Merlin Bird ID。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a827ed50f833&quot;}" data-wp-interactive="core/image" data-wp-key="6a827ed50f833" class="wp-block-image size-large aligncenter wp-lightbox-container"><img loading="lazy" decoding="async" width="1200" height="960" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/07/0f08e8c5f0ba6cad136fac6eabd95f7a_header.webp" alt="听声就能认鸟：这款 AI 观鸟 App 凭什么狂揽 4200 万下载" class="wp-image-1584" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/07/0f08e8c5f0ba6cad136fac6eabd95f7a_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/07/0f08e8c5f0ba6cad136fac6eabd95f7a_header-300x240.webp 300w, https://mylogs.cn/wp-content/uploads/2026/07/0f08e8c5f0ba6cad136fac6eabd95f7a_header-1024x819.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/07/0f08e8c5f0ba6cad136fac6eabd95f7a_header-768x614.webp 768w" sizes="auto, (max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">使用双筒望远镜观鸟的爱好者（图片来源：U.S. Fish and Wildlife Service / Wikimedia Commons，公有领域）</figcaption></figure>





<h2 class="wp-block-heading">从 285 种到 11000 种：AI 让识鸟能力翻了近 40 倍</h2>



<p class="wp-block-paragraph">Merlin Bird ID 于 2014 年在美国上线，当时其机器学习系统只能通过照片识别 285 种常见鸟类。十余年后的今天，它已经能识别约 11000 种鸟类——几乎覆盖了全球现存的所有鸟种。</p>



<p class="wp-block-paragraph">该应用主管 Jessie Barry 介绍，仅 2026 年一年，Merlin 就被下载了 1200 万次，累计下载量达到 4200 万次。她将这一飞跃归功于 AI 技术的进步，以及「一个了不起的全球观鸟者社区」——观鸟爱好者持续提交的录音，为模型训练提供了源源不断的数据。康奈尔实验室的数据显示，Merlin 的声音识别功能（Sound ID）迄今已完成 44 亿次鸟类识别。</p>



<p class="wp-block-paragraph">热潮并不局限于一款应用。市场情报公司 Sensor Tower 的数据显示，另一款识鸟应用 Birda 今年的下载量也增长了 31%。</p>



<h2 class="wp-block-heading">年轻人正在涌入观鸟圈</h2>



<p class="wp-block-paragraph">26 岁的旧金山用户 Megan Szostak 从小就是个「鸟孩子」，祖父去世后留下的双筒望远镜开启了她的观鸟生涯。如今，Merlin 已成为她观鸟工具包的一部分：「推荐这款应用给我的朋友们，可能都不会自称观鸟者，他们只是对自然和身边的世界感到好奇。」</p>



<p class="wp-block-paragraph">在她看来，应用同时提供声音和图像两种识别方式，恰恰体现了观鸟的包容性：「很多人靠耳朵观鸟，也有很多人靠眼睛。观鸟不需要调动所有感官，这一点非常棒。」她还会把自己的观鸟记录剪成短视频发到社交平台上。</p>



<p class="wp-block-paragraph">Barry 也观察到了用户结构的变化：「能明显看到用户在向年轻群体转移。有人分享使用 Merlin 的经历时会说『到了 30 岁，也成观鸟人了』，看到年轻人加入进来真的很有趣。」</p>



<h2 class="wp-block-heading">把观鸟做成「现实版宝可梦」</h2>



<p class="wp-block-paragraph">32 岁的英国斯托克波特软件工程师 Sam Lewis 用了几年 Merlin 后，萌生了自己开发识鸟应用的想法。他与伴侣 Emily 合作打造的 Lifer 应用，让用户可以为每次「捕获」收集虚拟卡牌——卡牌背景由 Emily 手绘水彩插图，并根据照片或录音质量、鸟类稀有度而变化。</p>



<p class="wp-block-paragraph">「仔细想想，鸟就是现实生活里的宝可梦。」Lewis 说，「人们喜欢稀有和稀缺的东西，就像宝可梦卡牌一样，而现实中就有珍稀鸟类等着你去看、去听。」</p>



<p class="wp-block-paragraph">针对此类应用可能诱使用户在不当时机打扰珍稀鸟类的担忧，Lifer 会在敏感时期对珍稀繁殖鸟类的精确位置进行隐藏；符合条件的观测记录还会被提交给全球生物多样性信息网络（GBIF），用于开放的生物数据研究。</p>



<h2 class="wp-block-heading">专家提醒：别把判断力外包给 App</h2>



<p class="wp-block-paragraph">资深观鸟者指出，Merlin 的识别并非百分之百准确。一些专家和公益组织也提醒，不应过度依赖此类应用，尤其是在提交正式观测记录时。</p>



<p class="wp-block-paragraph">对此，Barry 表示 Merlin 的未来方向依然是保持简单：「首先要让它有趣、易用……但归根结底，是鼓励你走出门去，亲眼看看那些鸟，享受与它们相处的体验。」</p>



<p class="wp-block-paragraph">来源：<a href="https://www.bbc.com/news/articles/cr59m5nmemno">BBC Technology</a>，作者 Liv McMahon</p>

]]></content:encoded>
					
		
		
			</item>
	</channel>
</rss>
