<?xml version="1.0" encoding="UTF-8"?><rss version="2.0"
	xmlns:content="http://purl.org/rss/1.0/modules/content/"
	xmlns:wfw="http://wellformedweb.org/CommentAPI/"
	xmlns:dc="http://purl.org/dc/elements/1.1/"
	xmlns:atom="http://www.w3.org/2005/Atom"
	xmlns:sy="http://purl.org/rss/1.0/modules/syndication/"
	xmlns:slash="http://purl.org/rss/1.0/modules/slash/"
	>

<channel>
	<title>模型压缩 &#8211; mylogs.cn</title>
	<atom:link href="https://mylogs.cn/tag/%E6%A8%A1%E5%9E%8B%E5%8E%8B%E7%BC%A9/feed/" rel="self" type="application/rss+xml" />
	<link>https://mylogs.cn</link>
	<description>发现、记录、分享</description>
	<lastBuildDate>Wed, 05 Aug 2026 02:56:44 +0000</lastBuildDate>
	<language>zh-Hans</language>
	<sy:updatePeriod>
	hourly	</sy:updatePeriod>
	<sy:updateFrequency>
	1	</sy:updateFrequency>
	
	<item>
		<title>20B模型压进5.3GB，Mac mini每秒吐218词</title>
		<link>https://mylogs.cn/maple-preview-20b-model-mac-mini-218-tokens/</link>
					<comments>https://mylogs.cn/maple-preview-20b-model-mac-mini-218-tokens/#respond</comments>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Wed, 05 Aug 2026 02:56:24 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI模型]]></category>
		<category><![CDATA[Mac]]></category>
		<category><![CDATA[大模型]]></category>
		<category><![CDATA[开源模型]]></category>
		<category><![CDATA[模型压缩]]></category>
		<category><![CDATA[端侧推理]]></category>
		<guid isPermaLink="false">https://mylogs.cn/maple-preview-20b-model-mac-mini-218-tokens/</guid>

					<description><![CDATA[一个总参数规模 200 亿的推理模型，权重文件只有 5.31 GB，在一台 M4 芯片的 Mac mini 上 [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">一个总参数规模 200 亿的推理模型，权重文件只有 5.31 GB，在一台 M4 芯片的 Mac mini 上每秒能吐出 218 个 token。这是初创公司 DeepGrove 刚刚开源的 Maple-Preview 交出的成绩单。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a75f9c7a3ca7&quot;}" data-wp-interactive="core/image" data-wp-key="6a75f9c7a3ca7" class="wp-block-image size-large aligncenter wp-lightbox-container"><img fetchpriority="high" decoding="async" width="1200" height="648" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/9bd90255b745aa05d04f90a7cce2e888_header.webp" alt="20B模型压进5.3GB，Mac mini每秒吐218词" class="wp-image-3614" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/9bd90255b745aa05d04f90a7cce2e888_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/9bd90255b745aa05d04f90a7cce2e888_header-300x162.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/9bd90255b745aa05d04f90a7cce2e888_header-1024x553.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/9bd90255b745aa05d04f90a7cce2e888_header-768x415.webp 768w" sizes="(max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：DeepGrove / Hugging Face</figcaption></figure>





<p class="wp-block-paragraph">按官方说法，同等规模下 Maple-Preview 的推理能力处于领先水平，甚至能与更大的模型掰手腕，能够解出国际数学奥林匹克（IMO）难度的题目，速度则比 Gemma 4、Qwen3.5、gpt-oss 这类以高效著称的模型快 5 到 16 倍。项目在 Hacker News 上发布时用的标题更直接：在 iPhone 上跑到每秒 120 个 token。</p>



<h2 class="wp-block-heading">三值权重：把每个参数压成三个数</h2>



<p class="wp-block-paragraph">Maple-Preview 的核心不在参数堆料，而在精度。它采用的是三值权重（ternary weight），即每个权重只在 −1、0、+1 三个取值中选一个，而不是常规的 16 位或 8 位浮点数。这种极端压缩直接决定了模型的体积和访存开销——200 亿参数最终落成一个 5.31 GB 的检查点，普通消费级设备的内存就能装下。</p>



<p class="wp-block-paragraph">DeepGrove 并非第一次做这件事。这家 2025 年夏季进入 Y Combinator 的公司此前已经开源过 Bonsai——一个约 5 亿参数的三值权重小模型。团队对自己的定位描述得很清楚：研究高效模型如何学习，从架构、训练基础设施、优化方法到硬件设计通盘重做，把低精度当成头等公民而非事后补丁。Maple-Preview 是这条路线上的第一个正式落点。</p>



<h2 class="wp-block-heading">20B 的架子，1B 的开销</h2>



<p class="wp-block-paragraph">模型标注为 20B-A1B，意思是总参数 200 亿、每次推理只激活约 10 亿。具体结构是 24 层、256 个专家的混合专家（MoE）配置，每次前向传播只激活其中 8 个专家；注意力部分采用 3:1 比例的滑动窗口注意力（SWA-512）与全局注意力混搭。上下文窗口为 131072 个 token。</p>



<p class="wp-block-paragraph">这套组合的意图很直白：用稀疏激活压住计算量，用三值权重压住内存带宽，两头同时省，才可能在没有独立显卡的设备上跑出三位数的生成速度。</p>



<p class="wp-block-paragraph">评测方面，官方使用稠密输出头在 LCBv6、AIME 2026、HMMT 2026 和 GPQA-D 四项基准上做了能力对比，结论是在内存—性能和速度—性能两条曲线上都推进了帕累托前沿。权重以 MIT 许可发布，除标准格式外还提供了适配苹果芯片的 MLX 版本，官方同时上线了在线试用入口和本地部署指南。</p>



<h2 class="wp-block-heading">更值得注意的是「边跑边学」</h2>



<p class="wp-block-paragraph">比跑分更有意思的是 DeepGrove 提到的一组早期实验：Maple-Preview 在 MacBook Pro 上本地运行时，能够一边工作一边学习。模型自主判断哪些事实和用户偏好值得记住，随后在空闲时对这些内容进行「做梦」式的回放，把知识固化进自身权重。</p>



<p class="wp-block-paragraph">这个思路针对的是当下 AI 记忆方案的通病。目前主流做法是把用户偏好写成一堆文本文件，每次对话再塞回上下文，条目一多就会撑爆窗口，而且文字描述往往丢掉那些微妙的个性化细节。DeepGrove 的判断是，未来的端侧模型应该靠调整自己的权重来记住主人，而不是靠散落在几千个笔记文件里的事实条目。之所以敢这么设想，前提正是模型足够小、足够快、足够省电——大模型在云端做同样的事，成本完全不是一个量级。</p>



<h2 class="wp-block-heading">现阶段的边界</h2>



<p class="wp-block-paragraph">DeepGrove 对这个预览版的局限也交代得比较坦率。官方明确说明，Maple-Preview 主要针对原始推理能力做了打磨，针对智能体任务的后训练很少，通用强化学习也只做了小规模，因此在智能体类基准上可能表现不佳，团队计划在正式版发布前继续延长训练。</p>



<p class="wp-block-paragraph">工程上还有一处需要注意：随模型一同提供的 Transformers 实现依赖 Triton 和 FlashAttention，面向的是兼容 CUDA 的环境；而那个 218 tokens/秒的苹果芯片成绩，用的是另一套独立的端侧运行时。想在 Mac 上复现官方速度的开发者，需要走 MLX 路径而不是直接用 Transformers。</p>



<p class="has-small-font-size wp-block-paragraph">来源：DeepGrove / Hugging Face 模型页</p>

]]></content:encoded>
					
					<wfw:commentRss>https://mylogs.cn/maple-preview-20b-model-mac-mini-218-tokens/feed/</wfw:commentRss>
			<slash:comments>0</slash:comments>
		
		
			</item>
		<item>
		<title>俄罗斯顶级黑客组织采用Clickfix技术感染设备，社会工程学攻击升级</title>
		<link>https://mylogs.cn/%e4%bf%84%e7%bd%97%e6%96%af%e9%a1%b6%e7%ba%a7%e9%bb%91%e5%ae%a2%e7%bb%84%e7%bb%87%e9%87%87%e7%94%a8clickfix%e6%8a%80%e6%9c%af%e6%84%9f%e6%9f%93%e8%ae%be%e5%a4%87%ef%bc%8c%e7%a4%be%e4%bc%9a%e5%b7%a5/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Fri, 17 Jul 2026 07:11:39 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[人工智能]]></category>
		<category><![CDATA[人形机器人]]></category>
		<category><![CDATA[创业]]></category>
		<category><![CDATA[数据隐私]]></category>
		<category><![CDATA[模型压缩]]></category>
		<category><![CDATA[网络安全]]></category>
		<guid isPermaLink="false">https://mylogs.cn/%e4%bf%84%e7%bd%97%e6%96%af%e9%a1%b6%e7%ba%a7%e9%bb%91%e5%ae%a2%e7%bb%84%e7%bb%87%e9%87%87%e7%94%a8clickfix%e6%8a%80%e6%9c%af%e6%84%9f%e6%9f%93%e8%ae%be%e5%a4%87%ef%bc%8c%e7%a4%be%e4%bc%9a%e5%b7%a5/</guid>

					<description><![CDATA[一项最新的网络安全研究表明，被称为Clickfix的社会工程学攻击技术已不再局限于普通网络犯罪团伙。据Ars  [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">一项最新的网络安全研究表明，被称为Clickfix的社会工程学攻击技术已不再局限于普通网络犯罪团伙。据Ars Technica报道，就连俄罗斯最精英的黑客组织也开始采用这种手段来渗透目标设备。</p>



<h2 class="wp-block-heading">什么是Clickfix攻击</h2>



<p class="wp-block-paragraph">Clickfix是一种利用虚假人机验证界面实施的社会工程学攻击手法。攻击者通常在网页上植入伪装成&#8221;我不是机器人&#8221;reCAPTCHA验证或系统故障排除提示的恶意界面，诱导用户执行一系列操作，最终导致恶意软件感染。</p>



<p class="wp-block-paragraph">微软威胁情报团队此前披露过相关攻击细节：攻击者会指示目标用户按下Windows + X → I快捷键启动Windows终端，然后将从虚假验证页面复制的十六进制编码命令粘贴到终端中。这些命令经过XOR压缩处理，一旦执行便会触发多阶段攻击链。</p>



<h2 class="wp-block-heading">攻击链的技术解析</h2>



<p class="wp-block-paragraph">当用户将恶意命令粘贴到Windows终端后，攻击链会按以下步骤展开：</p>



<p class="wp-block-paragraph">1. <strong>载荷下载</strong>：生成额外的PowerShell实例，下载ZIP压缩包和一个合法但已重命名的7-Zip二进制文件
2. <strong>持久化建立</strong>：通过创建计划任务确保恶意程序在系统重启后仍能运行
3. <strong>防御规避</strong>：配置Microsoft Defender排除项，避免被安全软件检测
4. <strong>数据窃取</strong>：使用QueueUserAPC()技术将Lumma窃密木马注入chrome.exe和msedge.exe进程
5. <strong>凭证外泄</strong>：收集浏览器的Web Data和Login Data，将存储的密码和敏感信息发送至攻击者控制的服务器</p>



<h2 class="wp-block-heading">精英黑客组织的参与意味着什么</h2>



<p class="wp-block-paragraph">Clickfix攻击此前主要由以经济利益为动机的普通网络犯罪分子使用。此次俄罗斯顶级黑客组织的采用表明，这种低技术门槛但高成功率的攻击手法已经获得了更高级别威胁行为体的认可。</p>



<p class="wp-block-paragraph">安全专家指出，这类攻击的可怕之处在于它不需要利用复杂的技术漏洞，而是直接针对人的心理弱点。虚假的系统提示和验证界面能够有效降低用户的警惕性，使他们在不知不觉中协助完成了整个攻击过程。</p>



<h2 class="wp-block-heading">防御建议</h2>



<p class="wp-block-paragraph">对于普通用户和企业而言，防范Clickfix攻击的关键在于培养安全意识：</p>



<p class="wp-block-paragraph">&#8211; 切勿在不明网页上复制并执行任何系统命令
&#8211; 真正的reCAPTCHA验证不会要求用户打开终端或运行对话框
&#8211; 保持操作系统和安全软件的及时更新
&#8211; 企业应加强对员工的社会工程学攻击防范培训</p>



<p class="wp-block-paragraph">随着AI技术的发展，这类社会工程学攻击可能会变得更加难以识别。攻击者已经开始利用AI生成更逼真的虚假界面和更具说服力的诱导文本，网络安全防御的重心正在从纯技术层面转向人机结合的综合防护体系。</p>
]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>苹果洽谈PrismML：270亿参数大模型或将直接运行于iPhone</title>
		<link>https://mylogs.cn/%e8%8b%b9%e6%9e%9c%e6%b4%bd%e8%b0%88prismml%ef%bc%9a270%e4%ba%bf%e5%8f%82%e6%95%b0%e5%a4%a7%e6%a8%a1%e5%9e%8b%e6%88%96%e5%b0%86%e7%9b%b4%e6%8e%a5%e8%bf%90%e8%a1%8c%e4%ba%8eiphone/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Wed, 15 Jul 2026 00:29:59 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[Siri]]></category>
		<category><![CDATA[人工智能]]></category>
		<category><![CDATA[模型压缩]]></category>
		<category><![CDATA[端侧AI]]></category>
		<category><![CDATA[苹果]]></category>
		<category><![CDATA[隐私保护]]></category>
		<guid isPermaLink="false">https://mylogs.cn/%e8%8b%b9%e6%9e%9c%e6%b4%bd%e8%b0%88prismml%ef%bc%9a270%e4%ba%bf%e5%8f%82%e6%95%b0%e5%a4%a7%e6%a8%a1%e5%9e%8b%e6%88%96%e5%b0%86%e7%9b%b4%e6%8e%a5%e8%bf%90%e8%a1%8c%e4%ba%8eiphone/</guid>

					<description><![CDATA[据CNBC报道，苹果公司正与硅谷AI初创公司PrismML展开初步洽谈，探讨一项有望重塑端侧AI格局的模型压缩 [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">据CNBC报道，苹果公司正与硅谷AI初创公司PrismML展开初步洽谈，探讨一项有望重塑端侧AI格局的模型压缩技术。该消息经格隆汇于7月15日跟进报道，引发业界对苹果端侧AI战略方向的广泛关注。

PrismML的核心技术方向是AI模型深度压缩。据披露，该公司开发的压缩技术能够将AI模型的内存占用降低10至15倍。这一量级的压缩幅度意味着，原本需要依赖云端算力才能运行的大型语言模型，有望被&#8221;塞进&#8221;智能手机的本地存储中。具体而言，该技术能够使拥有270亿参数的大型AI模型在iPhone 15及以上设备上实现本地运行，而无需依赖网络连接和远程服务器。

性能指标方面，这项压缩技术不仅缩减了模型体积，还带来了显著的效率提升。据相关报道，在端侧部署场景下，AI模型的响应速度可提升6至8倍，同时能耗降低3至6倍。对于电池容量和散热条件均受限的移动设备而言，能效比的改善尤为关键。

若该技术经过验证并达到商业化成熟度，苹果有望将更多Siri及生成式AI功能从云端迁移至设备本地运行。这一转变将带来多重优势：首先是响应速度的进一步提升，本地推理省去了数据上传与结果回传的网络延迟；其次是隐私保护能力的增强，用户数据无需离开设备即可完成AI处理；第三是支持离线使用场景，在无网络连接的环境下仍可调用AI功能；此外，大规模本地化推理还将显著降低苹果在云计算基础设施方面的运营成本。

值得注意的是，苹果在今年WWDC 2026上已发布了全新Siri AI，并对全线操作系统进行了AI能力升级。此次与PrismML的接洽，被视为苹果进一步强化端侧AI布局的重要信号。

然而，业内人士也对该技术的实际落地前景保持了审慎态度。一方面，实验室环境下的压缩效果与大规模实际应用之间往往存在差距，该技术仍需经过大量真实场景的验证才能确认其可靠性。另一方面，将270亿参数模型部署于手机端后，对电池续航、系统稳定性以及长期性能表现的影响，目前仍有待观察。移动设备的硬件资源有限，如何在压缩模型与维持输出质量之间取得平衡，将是技术落地的核心挑战。

目前苹果与PrismML的洽谈尚处于初步阶段，双方尚未公布具体合作细节或时间表。但这一动向本身已清晰表明，端侧AI正在成为科技巨头竞争的新焦点，而模型压缩技术则是实现这一愿景的关键桥梁。</p>
]]></content:encoded>
					
		
		
			</item>
	</channel>
</rss>
