<?xml version="1.0" encoding="UTF-8"?><rss version="2.0"
	xmlns:content="http://purl.org/rss/1.0/modules/content/"
	xmlns:wfw="http://wellformedweb.org/CommentAPI/"
	xmlns:dc="http://purl.org/dc/elements/1.1/"
	xmlns:atom="http://www.w3.org/2005/Atom"
	xmlns:sy="http://purl.org/rss/1.0/modules/syndication/"
	xmlns:slash="http://purl.org/rss/1.0/modules/slash/"
	>

<channel>
	<title>AI 推理 &#8211; mylogs.cn</title>
	<atom:link href="https://mylogs.cn/tag/ai-%e6%8e%a8%e7%90%86/feed/" rel="self" type="application/rss+xml" />
	<link>https://mylogs.cn</link>
	<description>发现、记录、分享</description>
	<lastBuildDate>Sun, 20 Sep 2026 03:26:47 +0000</lastBuildDate>
	<language>zh-Hans</language>
	<sy:updatePeriod>
	hourly	</sy:updatePeriod>
	<sy:updateFrequency>
	1	</sy:updateFrequency>
	
	<item>
		<title>MLPerf 6.1：AMD 512 卡刷新推理纪录</title>
		<link>https://mylogs.cn/mlperf-6-1%ef%bc%9aamd-512-%e5%8d%a1%e5%88%b7%e6%96%b0%e6%8e%a8%e7%90%86%e7%ba%aa%e5%bd%95/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Thu, 17 Sep 2026 09:00:10 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI 推理]]></category>
		<category><![CDATA[AMD]]></category>
		<category><![CDATA[MI355X]]></category>
		<category><![CDATA[MLPerf]]></category>
		<category><![CDATA[Vera Rubin]]></category>
		<category><![CDATA[基准测试]]></category>
		<category><![CDATA[英伟达]]></category>
		<guid isPermaLink="false">https://mylogs.cn/mlperf-6-1%ef%bc%9aamd-512-%e5%8d%a1%e5%88%b7%e6%96%b0%e6%8e%a8%e7%90%86%e7%ba%aa%e5%bd%95/</guid>

					<description><![CDATA[MLCommons 近日发布 MLPerf Inference v6.1 基准测试套件。作为衡量不同硬件在 A [&#8230;]]]></description>
										<content:encoded><![CDATA[<figure data-wp-context="{&quot;imageId&quot;:&quot;6ab2485401d35&quot;}" data-wp-interactive="core/image" data-wp-key="6ab2485401d35" class="wp-block-image wp-lightbox-container"><img decoding="async" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" style="max-width:100%; height:auto;" src="https://mylogs.cn/wp-content/uploads/2026/09/mlperf_v61_amd_mi355x_2026_header.webp" alt="MLPerf Inference v6.1 基准测试结果公布"/><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption>图片来源：IT之家</figcaption></figure>
<p class="wp-block-paragraph">MLCommons 近日发布 MLPerf Inference v6.1 基准测试套件。作为衡量不同硬件在 AI 推理任务中吞吐与延迟表现的权威评测，最新 6.1 版本将重点放在推理吞吐、扩展效率，以及不同 GPU 配置下的实际表现。AMD、英伟达、英特尔等厂商在结果公布后同步提交了各自的成绩单。</p>
<h2 class="wp-block-heading">AMD 派出的 512 卡答卷</h2>
<p class="wp-block-paragraph">AMD 以约 575 万个 token/秒的速度，在 512 个 GPU 的规模下创造了新的 MLPerf 提交纪录，这也是 AMD 迄今为止规模最大的参赛配置，意在证明其性能、规模、软件成熟度与可复现性。</p>
<p class="wp-block-paragraph">在 DeepSeek R1 这一大模型负载测试中，AMD 派出 512 个 Instinct MI355X GPU 参赛。离线（强调批量处理能力，通常用于衡量系统在非实时场景下的最大吞吐）成绩为 2,901,950 tokens/s，服务器（强调在线服务场景中的吞吐与响应能力，更接近实际部署中的请求处理环境）成绩为 2,405,310 tokens/s。</p>
<h2 class="wp-block-heading">英伟达的 288 卡对照</h2>
<p class="wp-block-paragraph">同一项目中，英伟达提交了 GB300 与 GB200 的 288 GPU 配置。其中 GB300 离线成绩为 2,705,130 tokens/s，服务器成绩为 2,028,030 tokens/s。需要特别说明的是，两家提交的 GPU 数量并不相同——AMD 用 512 块，英伟达用 288 块，配置存在差异，因此以上数据仅供参考，不能直接当作同规模下的性能对比。</p>
<h2 class="wp-block-heading">Vera Rubin 首次现身</h2>
<p class="wp-block-paragraph">本次测试的一大看点是英伟达新一代架构 Vera Rubin（VR200）首次进入 MLPerf 推理基准，出现了 36 GPU 与 72 GPU 两种配置。在相同的 72 个 GPU 配置下，Vera Rubin（VR200）要比 GB300 快 95%；此外，其 36 GPU 配置版本甚至比 72-GPU 的 GB200 配置更快。</p>
<p class="wp-block-paragraph">在 GPT-OSS 120B 负载中，AMD 同样以史上最高的 512 GPU 配置在离线与服务器两类场景中领先；而在 72 GPU 与 8 GPU 段，英伟达的 GB300（Grace Blackwell Ultra）配置则占据上风。AMD 的 MI350P 在 8 GPU 配置下也快于上一代 MI300X。英特尔方面则带来了 Arc Pro B70 与至强（Xeon）的提交，英伟达的 RTX PRO 系列也在 8 GPU 与 4 GPU 配置下参与了测试。</p>
<h2 class="wp-block-heading">评测之外更值得看什么</h2>
<p class="wp-block-paragraph">从 512 卡到 288 卡，从已量产的 GB300 到首次亮相的 VR200，这一轮提交把 AI 推理吞吐的竞争推到了新的量级。对采购方而言，MLPerf 的价值不只在于“谁跑得更快”，更在于揭示不同规模、不同架构下的扩展效率——在真实业务里，往往不是单卡峰值，而是千卡协同能否不掉链子，才决定了一座 AI 工厂的真正产能。</p>]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>AI 推理时代：内存与存储才是胜负手</title>
		<link>https://mylogs.cn/ai-%e6%8e%a8%e7%90%86%e6%97%b6%e4%bb%a3%ef%bc%9a%e5%86%85%e5%ad%98%e4%b8%8e%e5%ad%98%e5%82%a8%e6%89%8d%e6%98%af%e8%83%9c%e8%b4%9f%e6%89%8b/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Sat, 05 Sep 2026 08:45:28 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI 基础设施]]></category>
		<category><![CDATA[AI 推理]]></category>
		<category><![CDATA[RAG]]></category>
		<category><![CDATA[企业 AI]]></category>
		<category><![CDATA[内存与存储]]></category>
		<category><![CDATA[数据中心]]></category>
		<guid isPermaLink="false">https://mylogs.cn/ai-%e6%8e%a8%e7%90%86%e6%97%b6%e4%bb%a3%ef%bc%9a%e5%86%85%e5%ad%98%e4%b8%8e%e5%ad%98%e5%82%a8%e6%89%8d%e6%98%af%e8%83%9c%e8%b4%9f%e6%89%8b/</guid>

					<description><![CDATA[从训练到推理，基础设施的关注点变了 随着 AI 推理（inference）成为企业工作负载的主流，组织需要重新 [&#8230;]]]></description>
										<content:encoded><![CDATA[<h2 class="wp-block-heading">从训练到推理，基础设施的关注点变了</h2>

<p class="wp-block-paragraph">随着 AI 推理（inference）成为企业工作负载的主流，组织需要重新思考底层基础设施的设计逻辑。过去，算力规模往往是唯一的标尺；如今，速度、能效、可扩展性与每瓦性能共同决定了一套系统能否把 AI 的真正价值释放到现实业务中。</p>

<p class="wp-block-paragraph">Tirias Research 创始人兼首席分析师 Jim McGregor 指出，业界常把 AI 当作单一工作负载，但事实并非如此。他在与 MIT Technology Review Insights 的合作分析中表示：&#8221;AI 不是单一工作负载，而是成千上万、乃至数十亿个不同的工作负载。&#8221;推理任务往往是持续的、地理分布的，并且对响应时间高度敏感，这就要求系统从一开始就被设计成可扩展、有韧性且高效的形态。</p>

<p class="wp-block-paragraph">医疗保健系统实时分析数以百万计的数据点以加速救命研究、智能助手一次性解决数千个复杂客户诉求——这些真实场景都依赖一套先进的基础设施作为&#8221;持续智能&#8221;的引擎，在支撑实时服务的同时，也驱动着越来越聪明的物联网与消费级设备边缘。在这一由推理驱动的新格局里，每一次延迟、每一个瓶颈、每一瓦浪费，都会直接影响结果质量与运营成本。</p>

<h2 class="wp-block-heading">数据搬运成为新瓶颈</h2>

<p class="wp-block-paragraph">传统企业 IT 可以依赖相对稳定的基础设施假设，但推理与智能体（agentic）AI 带来了延迟、数据搬运、可扩展性和利用率方面的全新需求。以检索增强生成（RAG）为例，这类技术需要系统不断扫描海量数据库以生成准确回答，不仅对算力要求高，更要求数据能够被即时取用。</p>

<p class="wp-block-paragraph">McGregor 认为，随着数据实时查询量的激增，&#8221;数据如何在更广的架构中被高效搬运、缓存和交付&#8221;变得至关重要，内存与存储由此从后台支撑角色上升为战略资产。单纯采购最快的处理器已不够，推理高度依赖内存带宽、缓存、存储就近性，以及快速稳定取回相关信息的能力。他强调，最高效的 AI 基础设施看上去不像一堆顶级零件的堆叠，而更像计算、内存、存储与网络的均衡系统。&#8221;你必须把这四者作为一个整体来设计才能高效，这正是挑战所在。&#8221;</p>

<h2 class="wp-block-heading">把基础设施采购当成战略</h2>

<p class="wp-block-paragraph">规划 AI 基础设施不只是挑选最快的硬件，更关键的是如何在技术快速迭代时避免被过早锁死。McGregor 提出几点框架：</p>

<ul class="wp-block-list"><li>先明确要优化的 AI 工作负载，避免为泛化的&#8221;AI 就绪&#8221;过度投入而留下瓶颈；</li><li>为计算、内存、存储、供电与散热构建模块化架构，让容量随需求变化；</li><li>与完整的供应商和集成商生态合作，降低供应风险；</li><li>持续重估采购策略，因为硬件与商业模式变化太快；</li><li>优化效率与投资回报，而非只追求峰值性能——能效本身已是面向公众的指标，更高的利用率能回应外界对耗电与耗水的审视。</li></ul>

<h2 class="wp-block-heading">结论</h2>

<p class="wp-block-paragraph">在推理时代，内存与存储不再是被动的仓库，而是 AI 持续运转的&#8221;血液&#8221;。McGregor 预测，未来的竞争优势将越来越多属于那些把计算、内存、存储与网络当作一个整体、能够规模化且可量化回报地高效交付 AI 的企业。他总结道，采购即战略，系统设计已是领导层议题——&#8221;每一位高管都必须回答的一个核心问题是：AI 将如何改变我的商业模式？&#8221;</p>

<p class="wp-block-paragraph">*本文基于 MIT Technology Review Insights 发布的行业分析，该内容由人类研究撰写，并在人工监督下使用 AI 工具辅助生产流程。*</p>]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>四台 Mac Studio 串一起：本地跑大模型推理快了 3 倍</title>
		<link>https://mylogs.cn/%e5%9b%9b%e5%8f%b0-mac-studio-%e4%b8%b2%e4%b8%80%e8%b5%b7%ef%bc%9a%e6%9c%ac%e5%9c%b0%e8%b7%91%e5%a4%a7%e6%a8%a1%e5%9e%8b%e6%8e%a8%e7%90%86%e5%bf%ab%e4%ba%86-3-%e5%80%8d/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Thu, 27 Aug 2026 00:59:53 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI 推理]]></category>
		<category><![CDATA[Apple 芯片]]></category>
		<category><![CDATA[Mac Studio]]></category>
		<category><![CDATA[本地大模型]]></category>
		<category><![CDATA[雷雳 5]]></category>
		<guid isPermaLink="false">https://mylogs.cn/%e5%9b%9b%e5%8f%b0-mac-studio-%e4%b8%b2%e4%b8%80%e8%b5%b7%ef%bc%9a%e6%9c%ac%e5%9c%b0%e8%b7%91%e5%a4%a7%e6%a8%a1%e5%9e%8b%e6%8e%a8%e7%90%86%e5%bf%ab%e4%ba%86-3-%e5%80%8d/</guid>

					<description><![CDATA[雷雳 5 加远程直接内存访问，把多台机器拼成一台 苹果新款 Mac Studio 可以通过雷雳 5（Thund [&#8230;]]]></description>
										<content:encoded><![CDATA[<h2 class="wp-block-heading">雷雳 5 加远程直接内存访问，把多台机器拼成一台</h2>

<p class="wp-block-paragraph">苹果新款 Mac Studio 可以通过雷雳 5（Thunderbolt 5）接口与 RDMA（远程直接内存访问）技术将多台机器互联，形成一个共享内存池，用来运行更大的 AI 模型。MacRumors 在 2026 年 8 月 26 日报道了这一能力。</p>

<figure data-wp-context="{&quot;imageId&quot;:&quot;6ab24854034b4&quot;}" data-wp-interactive="core/image" data-wp-key="6ab24854034b4" class="wp-block-image size-large wp-lightbox-container"><img fetchpriority="high" decoding="async" width="2000" height="1125" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/a47d2e84dab9ef50159d8d35913a216b_header.webp" alt="四台 Mac Studio 通过雷雳 5 互联集群" class="wp-image-5483" srcset="https://mylogs.cn/wp-content/uploads/2026/08/a47d2e84dab9ef50159d8d35913a216b_header.webp 2000w, https://mylogs.cn/wp-content/uploads/2026/08/a47d2e84dab9ef50159d8d35913a216b_header-300x169.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/a47d2e84dab9ef50159d8d35913a216b_header-1024x576.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/a47d2e84dab9ef50159d8d35913a216b_header-768x432.webp 768w, https://mylogs.cn/wp-content/uploads/2026/08/a47d2e84dab9ef50159d8d35913a216b_header-1536x864.webp 1536w" sizes="(max-width: 2000px) 100vw, 2000px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption>图片来源：MacRumors</figcaption></figure>

<h2 class="wp-block-heading">四台并联，推理速度翻三倍</h2>

<p class="wp-block-paragraph">根据苹果的说法，若将四台 Mac Studio 集群化，AI 推理速度可达单机运行的 3 倍。共享内存池的作用，是让系统能够载入当前最强的一批开放权重前沿大模型——这类模型参数量巨大，单机通常难以一次性装下。</p>

<p class="wp-block-paragraph">新款 Mac Studio 于 2026 年 8 月 25 日发布，搭载 M5 Ultra 芯片。苹果近年来持续强化 Mac 的本地 AI 推理定位，强调数据留在设备端、无需上传云端即可完成大模型运算。把多台机器用高速总线连成一体，相当于在不依赖外部算力集群的前提下，为本地方向的 AI 开发提供更大显存与更高吞吐。</p>

<h2 class="wp-block-heading">对开发者意味着什么</h2>

<p class="wp-block-paragraph">对个人开发者和小型团队而言，这种集群思路降低了&#8221;在本地跑大模型&#8221;的门槛：无需采购专业加速卡，也能借助多台 Mac Studio 的组合获得可观的推理性能。苹果在搭载 Apple 芯片的 Mac 上提供统一的内存架构，CPU、GPU 与神经引擎共享同一块高带宽内存，雷雳 5 与远程直接内存访问则进一步把多台机器的内存打通，使大模型的权重可以在机器之间流动。</p>

<p class="wp-block-paragraph">Mac Studio 在中国市场通过 Apple 中国官网及零售店销售，对于希望在本地方便运行大模型的国内开发者与团队有一定参考价值。</p>]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>谷歌开源 HEIR：让 AI 在加密数据上直接推理</title>
		<link>https://mylogs.cn/google-heir-homomorphic-encryption/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Fri, 14 Aug 2026 17:59:21 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI 推理]]></category>
		<category><![CDATA[HEIR]]></category>
		<category><![CDATA[同态加密]]></category>
		<category><![CDATA[开源编译器]]></category>
		<category><![CDATA[谷歌]]></category>
		<category><![CDATA[隐私计算]]></category>
		<guid isPermaLink="false">https://mylogs.cn/google-heir-homomorphic-encryption/</guid>

					<description><![CDATA[隐私与智能，长期被视为一对矛盾。端到端加密能防止数据泄露，却也让服务商无法基于这些数据提供垃圾邮件过滤、病毒检 [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">隐私与智能，长期被视为一对矛盾。端到端加密能防止数据泄露，却也让服务商无法基于这些数据提供垃圾邮件过滤、病毒检测、内容推荐等功能。医疗、金融等强监管行业更是两难：机构之间往往因合规要求无法共享数据。2026 年 8 月 14 日，谷歌在其安全博客展示了名为 HEIR 的开源编译器，试图用「全同态加密」技术把这对矛盾重新摆正。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6ab248540424c&quot;}" data-wp-interactive="core/image" data-wp-key="6ab248540424c" class="wp-block-image size-large aligncenter wp-lightbox-container"><img decoding="async" width="1200" height="821" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/994010c19cb16316f555199ac49901fd_header.webp" alt="谷歌开源 HEIR：让 AI 在加密数据上直接推理" class="wp-image-4869" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/994010c19cb16316f555199ac49901fd_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/994010c19cb16316f555199ac49901fd_header-300x205.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/994010c19cb16316f555199ac49901fd_header-1024x701.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/994010c19cb16316f555199ac49901fd_header-768x525.webp 768w" sizes="(max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">AI 生成配图</figcaption></figure>





<h2 class="wp-block-heading">同态加密：服务器「算得了」却「看不见」</h2>



<p class="wp-block-paragraph">同态加密（Homomorphic Encryption）是一类允许直接在密文上做计算的技术。借助它，服务器可以处理加密后的数据、返回加密结果，而全程不暴露任何底层信息。一个直观的例子是：云服务可以在完全看不到用户特征的情况下，给出个性化的内容推荐。这并非概念演示，谷歌博客中展示的示例已经实现了这一场景。</p>



<p class="wp-block-paragraph">当然，同态加密并非免费午餐。它带来可观的计算开销，把「能力—隐私」的取舍变成了「成本」问题。好消息是，这项成本正在快速下降：相关开销从早年九个数量级以上，收敛到如今许多工作负载下约千倍的水平。</p>



<h2 class="wp-block-heading">HEIR 是什么</h2>



<p class="wp-block-paragraph">HEIR 是「Homomorphic Encryption Intermediate Representation（同态加密中间表示）」的缩写，是谷歌构建的一套基于 MLIR 的开源编译器工具链。它的核心能力，是把原本在明文上运行的预训练 AI 模型，转换为能在加密输入上运行的版本。谷歌的愿景，是把 HEIR 做成「一键式」方案，让没有密码学背景的工程师也能把加密推理接进生产系统。</p>



<p class="wp-block-paragraph">这不是凭空起的项目。谷歌自 2023 年公布相关意向以来，同态加密社区已逐渐接纳 HEIR。它先后与多家研发同态加密硬件加速器的公司达成合作，包括 Belfort、Niobium、Cornami 与 Optalysys。HEIR 同时也成了高校研究的平台：佐治亚理工学院、卡内基梅隆大学、加州大学圣塔芭芭拉分校、印度理工学院、普渡大学、爱丁堡大学以及清华大学等团队都基于它开展工作。截至目前，已有四篇经过同行评审的论文建立在 HEIR 之上，更多论文正在准备中。</p>



<h2 class="wp-block-heading">四个已跑通的隐私推理示例</h2>



<p class="wp-block-paragraph">为说明同态加密已经走到哪一步，谷歌公开了四个用 HEIR 编译的私有推理应用（延迟数据均基于单线程 CPU）：</p>



<ul class="wp-block-list"><li>深度学习推荐模型：与 Belfort Labs、LG、纽约大学合作，实现私有内容推荐；</li><li>信用卡欺诈检测：与 Niobium、hardshell.ai 合作编译；</li><li>入侵威胁检测：与 Niobium 合作，把 Kitsune 加密网络流量异常检测系统编译上线，使服务商能在不泄露数据包内容的前提下发现异常；</li><li>唤醒词检测：与 Belfort Labs 合作，让语音触发的 AI 智能体在识别唤醒词的同时，保护录音的隐私。</li></ul>



<p class="wp-block-paragraph">HEIR 目前支持 BGV、BFV、CKKS、CGGI 等多种同态加密方案，并对接 OpenFHE、Lattigo、tfhe-rs、Jaxite 等后端。</p>



<h2 class="wp-block-heading">它和「可信执行环境」不是一回事</h2>



<p class="wp-block-paragraph">需要厘清的是，同态加密与另一种隐私方案——可信执行环境（TEE，如硬件机密计算飞地）——处在不同的位置。TEE 能以接近原生的速度承载大模型推理，代价是必须信任硬件厂商与证明链；同态加密的数学保证则更彻底：服务器在密文上计算，从原理上无法读取用户数据，但付出的代价是延迟和模型规模。一个被广泛引用的判断是：未来数年里，大模型交给 TEE，小而高敏的模型交给 FHE，是更诚实的分工。</p>



<p class="wp-block-paragraph">事实上，目前全球最大规模的全同态加密落地，来自苹果——其在 iOS 18 的来电号码查询、增强视觉搜索等功能中，通过自研的 swift-homomorphic-encryption 在不暴露电话号码与图片特征的前提下查询服务端数据库。</p>



<h2 class="wp-block-heading">仍属「小模型」阶段</h2>



<p class="wp-block-paragraph">对开发者而言，务实的判断不是「要不要加密 AI 管线」，而是手上的负载是否长成示例的样子：小模型、敏感输入、不该信任明文的服务端、且能容忍秒级而非毫秒级延迟。欺诈评分、健康信号分类、网络遥测分析、私有检索都在此列。至于在加密数据上跑大模型，短期内仍不现实。</p>



<p class="has-small-font-size wp-block-paragraph">来源：Google Security Blog（作者 Jeremy Kun，Staff Software Engineer）</p>

]]></content:encoded>
					
		
		
			</item>
	</channel>
</rss>
