4.3G 内存跑起 800 亿参数大模型

你的电脑大概率跑不动 800 亿参数的大模型——除非换个装法。开源项目 Swiftlet 近日在技术社区 Hacker News 上亮出一组数字:4 比特量化的通义千问 Qwen3-Next-80B-A3B,硬盘要占 42GB,运行时内存峰值却只有 4.3GB,在搭载 M5 芯片的 Mac 上每秒解码 4.5 到 5 个词元;更小的 Qwen3.6-35B-A3B 内存峰值 2.6GB、每秒 7 到 11 个词元,还能在 iPhone 17 上以约 2.5GB 内存原生运行,速度约每秒 1 个词元。

它靠的不是压缩,是搬家。这两代通义千问用的是混合专家架构(MoE,一个大模型内部拆成许多小专家,每次只喊几个干活):800 亿参数版每层从 512 个专家里挑 10 个,实际每个词元只激活约 30 亿参数。Swiftlet 把常驻不变的那部分留在内存里,只占 1.3GB 到 2.5GB;剩下几万个专家权重打包成固定步长的容器文件放进固态硬盘,用哪个读哪个,一次读取对应一个专家,热门专家再用小缓存兜着,实测命中率 43% 到 70%。

说白了,不是模型变小了,是内存这道门槛被硬盘顶掉了。这类”以存换存”的思路,落地速度大概会快过等更大内存的新机器。

代价也得说清楚。作者自己承认,每个词元只激活 30 亿参数,模型”聊天和写作像大模型,记事实像小模型”;长提示词处理更慢,社区实测一万词元的提示要跑约半小时。项目采用 Apache 2.0 协议,要求苹果芯片、macOS 14 或 iOS 17 以上,同时提供命令行工具和兼容主流接口的本地服务。

为了让数据不出本机,你愿意忍受每秒几个词元的速度吗?

来源:GitHub / leonickson1 · Swiftlet,Hacker News「Show HN: Run an 80B Qwen in 4.3 GB of RAM on a Mac, and a 35B on an iPhone」