你要是因为显卡只有 4GB 就放弃了本地微调大模型,这个开源项目值得看一眼。

它叫 Soup,最近登上 Hacker News 首页,标题很直白:在 4GB 笔记本显卡上微调 80 亿参数模型。项目采用 Apache-2.0 开源协议,目前在 GitHub 上有 147 颗星、23 个分支,累计 605 次提交。
一个配置文件,一条命令
Soup 想解决的是老问题。项目自述里写道,即便是有经验的团队,也要把 30% 到 50% 的时间花在跟基础设施较劲上,而不是改进模型。它的做法是把整套流程压成一个配置文件加一条命令:安装 `pip install “soup-cli[train]”`,然后 `soup init –template chat` 生成配置、`soup train` 开跑。批大小、显卡识别、量化全部自动处理,不需要远程登录服务器,也不需要云端资源。
真正让它能在 4GB 显卡上跑起来的是「层流式加载」:冻结的基座模型不常驻显存,而是按解码层逐层喂给显卡,配合 4bit NF4 量化把模型体积压到约四分之一,80 亿参数模型就能塞进 4GB 显卡。
新版本把偏好训练也拉了进来
最新的 v0.72.4 版本把这套机制扩展到了偏好对齐训练——也就是让模型学会「这个回答比那个好」的调优阶段。以往层流式加载只支持监督微调,现在直接偏好优化(DPO)以及 ORPO、SimPO、KTO 三种方法也能跑。
其中 DPO 需要一个参考模型做对照,常规做法要再加载一份权重、内存直接翻倍,那样省显存的意义就没了。Soup 的处理是复用同一份流式基座、把适配器关掉,等于一份权重、一条数据流。在 RTX 3050 4GB 显卡上实测,流式 DPO 的显存峰值是监督微调峰值的 0.914 倍;而强行加载真正的第二份模型,同样测试下多吃 730MB,正好是一份权重的大小。
难得的是把代价也写清楚了
这个项目最值得留意的地方,不是省显存,而是它把账算给你看。文档明确写出:参考模型省的是内存不是时间,DPO 每步读取层栈的次数是监督微调的 1.52 倍;GRPO 和 PPO 两种强化学习方法被有意排除在外,因为生成阶段每输出一个词都要重读所有层,流式加载省不出来。作者还标注训练结果与非流式版本逐位一致(差异为 0),并说明整个项目是在一台 4GB 笔记本上开发维护的,因此多显卡、更大模型和苹果芯片的支持都还没验证,相关功能都挂着明确的前置条件说明。该特性目前仍标注为测试版。
官方给出的显存对照是:8GB 约能带 70 亿参数、16GB 约 140 亿、24GB 约 340 亿、48GB 约 700 亿。项目内置 100 多个现成配方,覆盖通义千问、Llama 3、Gemma 3、Mistral、DeepSeek R1/V3、Phi-4 等模型,模板涵盖对话、代码、工具调用、推理、视觉、长上下文等场景。
我的判断是,这类工具的价值在于把「能不能跑」变成「值不值得跑」。手上这块小显卡,你打算拿它微调点什么?
来源:GitHub / Soup 项目页,Hacker News







