<?xml version="1.0" encoding="UTF-8"?><rss version="2.0"
	xmlns:content="http://purl.org/rss/1.0/modules/content/"
	xmlns:wfw="http://wellformedweb.org/CommentAPI/"
	xmlns:dc="http://purl.org/dc/elements/1.1/"
	xmlns:atom="http://www.w3.org/2005/Atom"
	xmlns:sy="http://purl.org/rss/1.0/modules/syndication/"
	xmlns:slash="http://purl.org/rss/1.0/modules/slash/"
	>

<channel>
	<title>稀疏注意力 &#8211; mylogs.cn</title>
	<atom:link href="https://mylogs.cn/tag/%e7%a8%80%e7%96%8f%e6%b3%a8%e6%84%8f%e5%8a%9b/feed/" rel="self" type="application/rss+xml" />
	<link>https://mylogs.cn</link>
	<description>发现、记录、分享</description>
	<lastBuildDate>Mon, 10 Aug 2026 10:59:56 +0000</lastBuildDate>
	<language>zh-Hans</language>
	<sy:updatePeriod>
	hourly	</sy:updatePeriod>
	<sy:updateFrequency>
	1	</sy:updateFrequency>
	
	<item>
		<title>Transformer 统治九年，这些初创公司正用四种路径改写大模型底层</title>
		<link>https://mylogs.cn/post-transformer-startups-llms-plus/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Mon, 10 Aug 2026 10:59:40 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI 初创]]></category>
		<category><![CDATA[Transformer]]></category>
		<category><![CDATA[大模型]]></category>
		<category><![CDATA[扩散模型]]></category>
		<category><![CDATA[液态神经网络]]></category>
		<category><![CDATA[状态空间]]></category>
		<category><![CDATA[稀疏注意力]]></category>
		<guid isPermaLink="false">https://mylogs.cn/post-transformer-startups-llms-plus/</guid>

					<description><![CDATA[Transformer 已经统治大语言模型（LLM）整整九年。从 2017 年 Google 发布论文《Att [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">Transformer 已经统治大语言模型（LLM）整整九年。从 2017 年 Google 发布论文《Attention Is All You Need》算起，这种神经网络结构几乎成为了每一款主流模型的底座。Subquadratic 公司 CEO Justin Dangel 评价说：“Transformer 是计算机科学史上最重要的创新之一，它改变了世界。”</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a79c3a386b3c&quot;}" data-wp-interactive="core/image" data-wp-key="6a79c3a386b3c" class="wp-block-image size-large aligncenter wp-lightbox-container"><img fetchpriority="high" decoding="async" width="1200" height="600" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/13f8f581a9549502420ab360d517c9bb_header.webp" alt="Transformer 统治九年，这些初创公司正用四种路径改写大模型底层" class="wp-image-4309" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/13f8f581a9549502420ab360d517c9bb_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/13f8f581a9549502420ab360d517c9bb_header-300x150.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/13f8f581a9549502420ab360d517c9bb_header-1024x512.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/13f8f581a9549502420ab360d517c9bb_header-768x384.webp 768w" sizes="(max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：MIT Technology Review / Sarah Rogers</figcaption></figure>





<p class="wp-block-paragraph">但眼下，Transformer 正在显露疲态。推理模型的出现、超长上下文的需求、动辄数千瓦的算力消耗，本质上都只是在给同一套架构打补丁。越来越多的研究者开始追问：下一代模型的底座会是什么？《麻省理工科技评论》（MIT Technology Review）在 2026 年“10 件影响 AI 的事”中，将这批未来模型称为 <strong>LLMs+</strong>。一批初创公司正试图从四个方向发起挑战。</p>



<h2 class="wp-block-heading">方向一：改造注意力机制</h2>



<p class="wp-block-paragraph">Transformer 的核心是“稠密注意力”（dense attention）：文本中的每个词都要和每个词做乘法。一篇一万词的文档，可能要消耗 5000 万次乘法。这正是 LLM 能耗惊人的根源。</p>



<p class="wp-block-paragraph">稀疏注意力（sparse attention）的思路很直观：只计算部分词之间的关系，而不是全部。但多年来，稀疏注意力的语义理解能力始终追不上稠密注意力。</p>



<p class="wp-block-paragraph">迈阿密的 Subquadratic 声称打破了这一僵局。其模型 SubQ 会动态判断哪些词重要、哪些不重要，在搜索和编程等任务上已能比肩主流 LLM。公司表示已有数千人加入等待名单，并计划尽快开放。旧金山另一家初创公司 Manifest AI 走得更远：它完全用“能量保持”（power retention）机制替代了注意力，只保留与当前任务最相关的滚动摘要，声称可将现有开源编程模型 StarCoder 改造成 PowerCoder，并在 Qwen 级别任务上取得相近表现。</p>



<h2 class="wp-block-heading">方向二：把模型做得更小、更灵活</h2>



<p class="wp-block-paragraph">MIT 衍生公司 Liquid AI 没有彻底抛弃 Transformer，而是把自己的“液态神经网络”（liquid neural networks）与之混合，推出 LFMs（liquid foundation models）。创始人 Ramin Hasani 透露，最新模型中 Transformer 仅占 20%，液态网络占 80%，且这一比例由公司自研的“设计 AI”自动搜索得出。</p>



<p class="wp-block-paragraph">液态神经网络的灵感来自蠕虫大脑，优势在于运行时可以持续适应新信息，而不像 Transformer 那样训练完成后行为就固定。结果是：Liquid AI 的模型能在售价 50 美元的树莓派上运行，且体积只有竞品的四分之一，却能在 Qwen、Gemma 等基准上追平四倍大的模型。戴姆勒（Mercedes）已在车辆小芯片上部署其方案。</p>



<h2 class="wp-block-heading">方向三：一次性生成整块文本</h2>



<p class="wp-block-paragraph">当前几乎所有 LLM 都是逐词生成。但对计算机来说，更便宜、更快的方式是整句甚至整段同时输出。这就是扩散模型（diffusion）的思路。</p>



<p class="wp-block-paragraph">总部位于加州帕洛阿尔托的 Inception 正把图像/视频生成中常用的扩散技术用于文本。其 CEO Stefano Ermon 是斯坦福教授，2024 年与同事解决了扩散模型处理文本的数学难题，并在 GPT-2 级别的模型上验证：速度提升 10 倍。Inception 最新模型 Mercury 2 号称在部分任务上已接近 OpenAI GPT-4 水平，速度仍是 10 倍。Google 也在跟进，推出了原型 Diffusion Gemma。</p>



<h2 class="wp-block-heading">方向四：跳出语言本身</h2>



<p class="wp-block-paragraph">Pathway 可能是这批新公司中最激进的一家。它的模型名为 Dragon Hatchling，用“状态空间”（state space）替代注意力，把信息压缩成更抽象的表征，而非逐词编码。</p>



<p class="wp-block-paragraph">最引人注目的结果是一道刁难所有主流 LLM 的测试：超过 25 万道高难度数独。Dragon Hatchling 解开了 97% 以上，而多家顶级实验室的模型一题未解。CEO Zuzanna Stamirowska 认为，Transformer 强行用语言完成一切推理，但人类下棋、做数学时的“灵光一闪”并不发生在语言里。如果模型只能在语言中思考，就永远到不了真正的创新。</p>



<h2 class="wp-block-heading">谁会笑到最后？</h2>



<p class="wp-block-paragraph">这四条路线未必互相排斥，也未必都能成功。但它们共同指向一个判断：<strong>规模竞赛不是 LLM 的唯一出路</strong>。在算力成本逼近万亿美元、数据中心耗电量 2030 年可能翻倍的背景下，效率、结构与推理范式的创新，或许比单纯堆参数更重要。</p>



<p class="has-small-font-size wp-block-paragraph">来源：MIT Technology Review</p>

]]></content:encoded>
					
		
		
			</item>
	</channel>
</rss>
