手机跑本地AI比游戏PC还快?实测原因出人意料
提到在本地设备上运行大语言模型,多数人的第一反应是:得有一台带独立显卡的台式机。但 XDA 撰稿人 Nolen Jonker 分享了一个反直觉的实测结果——他日常真正常用的本地 AI 设备不是游戏 PC,而是手机,而且手机的出词速度经常反超台式机。

实测数据:小模型跑赢大模型
在 iPhone 16 上通过 PocketPal 应用运行本地模型时,4B 参数规模的模型稳定在每秒约 13 个 token,2B 模型甚至能超过每秒 20 个。而在台式机上,用 LM Studio 运行 9B 模型,即便把 GPU 卸载层数推到不影响其他软件使用的极限,同样的任务只有每秒 9 个 token 左右——参数更小、硬件更弱的一方反而更快。
原因出在显存瓶颈上。LM Studio 允许把模型的 transformer 层卸载到 GPU 上运行,但每多推一层都要占用显存。9B 模型塞不进 8GB 显存的显卡时,溢出部分只能放进内存由 CPU 处理,速度随之断崖式下跌。想同时开着浏览器、Figma、Obsidian 等日常软件,就必须给显卡留余量,卸载层数减少,生成速度进一步变慢。
手机反而没有这种取舍。它本来就只能运行小模型,而这些模型正是针对移动端约束设计的——比如 Qwen 3.5 2B 就是该系列面向智能手机部署的版本。A18 芯片采用统一内存架构,不存在独立显存预算的冲突。且小模型的能力差距比参数量看起来小得多:据称 Qwen 4B 在许多基准测试上已能追平上一代 80B 模型的表现。
使用体验:省掉「启动税」
除了速度,手机还省掉了本地模型的「启动成本」。台式机上如果 LM Studio 没有预先加载好模型,从打开到出第一个 token 要等十秒以上;而 PocketPal 打开即自动载入上次使用的模型,几秒内就能开始输入。与手机上的云端 AI 相比,本地模型没有服务器往返延迟,首 token 响应反而更快。
台式机仍有不可替代的场景
这并不是说手机全面胜出。当关闭其他软件、让 LM Studio 独占整台机器时,9B 或 12B 模型可以轻松达到每秒 20 个 token 以上,小模型甚至能冲上三位数。需要长上下文的任务——比如解析整篇论文或长篇转录文本——2B 模型很快就会塞满,且手机在持续生成时会因发热降频。文档解析、研究综合这类需要「坐下来认真干活」的场景,台式机依然是更好的选择。
这次对比的结论是:对本地大模型而言,「合适」比「性能强」更重要,关键是让模型规模匹配设备与使用场景。
来源:XDA Developers