
搭载 M4 Pro 芯片的 MacBook Pro 只有 24GB 统一内存,在本地运行参数量较大的大模型时,预填充(prefill)阶段的速度会受到明显制约。一名 Reddit 用户近日给出一个出人意料的思路:用一根 USB-C 线把 iPhone 17 Pro Max 接上 Mac,让手机的图形处理器分担一部分计算,把预填充性能最高提升了 44%。
跨设备拆层:Mac 算前 40 层,iPhone 算后 24 层
这套方案来自开源项目「backburner」,由 Reddit 用户 u/StayLameBro 发布,已在 GitHub 公开,采用 MIT 许可证。它基于 llama.cpp 的一个分支,专门适配苹果芯片的核间协同。
具体做法是把每一批 256 个 token 的运算拆开:MacBook Pro 负责计算第 1 至第 40 层,再把激活值数据流传输到手机端;与此同时,iPhone 利用 A19 Pro 的图形处理器运行第 41 至第 64 层,而 Mac 这边已经开始处理下一批数据。依靠图形处理器运算,手机端的处理速度相比不使用图形处理器时提升了约 2.4 倍。
神经网络引擎也没有闲置。每 16K 长度的旧上下文会被编译成一套神经网络引擎模型。在 140K 上下文长度下,相较于仅用 A19 Pro 图形处理器,单个 token 的写入耗时从 279 毫秒缩短到 176 毫秒。
实测数据:16K 上下文提速 44%
以把一份 2000 个 token 的文件做预填充并保存会话为例,性能表现如下:
上下文设为 8K 时,仅靠 Mac 本机的速度是每秒 132 个 token;外接 iPhone 之后达到每秒 177 个 token,提升 35%。上下文设为 16K 时,速度从每秒 109 个 token 涨到每秒 157 个 token,增幅高达 44%。当上下文窗口设为 32K 时,预填充速度从每秒 101 个 token 提升到每秒 130 个 token,改善 29%。
局限同样明显:生成环节帮不上忙
正如这名 Reddit 用户自己指出的,现实并没有这么理想。在 64K 以内的场景中,手机并不会加速文本生成,生成工作依旧全部由 Mac 完成。换句话说,这套方案主要改善的是「读取」类任务——比如把长文件或工具结果预填充进已保存的会话,而最影响体感的逐字输出环节,手机目前还插不上手。
未来空间:A20 Pro 余量更大
驱动 iPhone 18 Pro 与 iPhone 18 Pro Max 的 A20 Pro 芯片有望提供更大的性能余量。一方面它整体性能更强,另一方面配备双 16 核神经网络引擎。据称,针对专门适配神经网络处理器的任务,该引擎的数据吞吐能力甚至超过芯片内置的 7 核图形处理器。
即便仅作为一项实验,也能看出预填充加速带来的收益相当可观,后续仍有继续挖掘性能的潜力。不过这也引出一个有趣的猜想:如果这类「手机当外接算力」的用法普及,未来 iPhone 是否也会像内存、固态硬盘那样步入供货紧缺的阶段。
需要提醒的是,该项目目前仅由作者本人在一台 M4 Pro MacBook Pro 与两部 iPhone 上完成测试,数据属于单一来源,实际效果会因设备、模型量化方式与系统版本而异。







