训练一个大模型要多少钱?很多人的第一反应是”几百万张显卡、几十亿预算”。GitHub 上一个名为 MiniMind 的开源项目给出了另一个答案:单张 RTX 3090 显卡,约 2 小时、约 3 元人民币的租卡成本,就能从零训练出一个 64M 参数、能对话、会调用工具的语言模型。
这个项目最近重新冲上 GitHub 趋势榜,单日新增上千星标。截至目前,MiniMind 已累计收获超过 5.68 万 Star 和 7400 多次 Fork。需要注意的是,它并非横空出世的新项目——仓库创建于 2024 年 7 月,持续迭代超过两年,最近一次提交落在 2026 年 8 月 31 日,采用完全免费的 Apache 2.0 协议开源。
“大道至简”:不是微调,而是从零造一遍
MiniMind 的核心理念写在 README 的开头:”用乐高自己拼出一架飞机,远比坐在头等舱里飞行更让人兴奋。”
与市面上大多数”挂个 LoRA 微调一下”的教程不同,MiniMind 的所有核心算法——Transformer 结构、分词器、训练循环、对齐流程——全部用原生 PyTorch 从零实现,不依赖 transformers、trl、peft 等任何高层框架封装。训练过程中的每一次张量变换、每一处注意力计算都清晰可见。
作者在项目说明中打过一个比方:只会调用现成模型,就像教牛顿使用 21 世纪的智能手机——手机玩得再溜,物理还是没碰着。MiniMind 想解决的就是这个问题:让学习者亲手把”预训练””SFT””RLHF”这些被说烂的名词跑一遍。
“2小时3块钱”的账,官方自己算清楚了
“2 小时、3 元钱”听起来像营销话术,但 README 里给出了实测口径:所谓 2 小时,指的是 SFT(指令微调)阶段在单张 RTX 3090 上跑完 1 个 epoch 的实测耗时,约 1.10 小时;预训练约 1.21 小时,两者合计约 2.31 小时。按 3090 租卡单价约 1.3 元/小时计算,全程约 3 元人民币。
这条最快路线使用 1.2GB 的 mini 版预训练数据和 1.6GB 的 SFT 数据,产出的是一个名为 MiniMind-3 Zero 的对话模型。想训得更充分,也有 10GB/14GB 的完整版数据集可选。
训出来的模型有多大本事?64M 参数,约为 GPT-3 的两千七百分之一。作者自己在 README 里反复强调:它打不过任何商用模型。官方保留的对话样例里,这个模型会一本正经地编造”杭州特色美食是鸡肉串、鳗鱼头”。在中文评测 C-Eval 上它只拿到 24.89 分——几乎贴着四选一瞎蒙的期望线。
但有两组数据值得认真看:其一,数学工具调用任务的 20 道题,SFT 权重答对 12 道,经过 Agentic RL(智能体强化学习)后答对 17 道,正确率从 60% 提升到 85%——一个 64M 的模型学会了”先调计算器再报答案”;其二,强化学习后的权重在开放问答上事实性会下降、幻觉更明显,这就是常说的”对齐税”,作者的坦率记录本身就是很好的学习材料。

技术上怎么做到的
MiniMind 的省钱秘诀从词典开始:主流模型的词表动辄十几万(Qwen2 为 151,643、Llama 3 为 128,000),MiniMind 只配了 6,400 个词元。词典薄,分词就碎,但 embedding 层省下的参数可以匀给真正干活的网络主体。主线模型配置为 8 层 Transformer、隐藏维度 768,结构对齐 Qwen3 生态,训完可直接扔进 ollama、vllm、llama.cpp 等推理框架运行。
训练流水线覆盖了语言模型的完整生命周期:预训练让模型学会”词语接龙”;SFT 让它理解 user、assistant、system、tool 等对话角色;之后的对齐阶段,DPO、PPO、GRPO、CISPO 等强化学习算法全部以原生 PyTorch 从零实现。一个值得注意的细节是,SFT 主线数据里直接混入了约 10 万条由 qwen3-4b 合成的工具调用样本,所以训完的模型天然就会一点 Tool Call。
进阶的 Agentic RL 部分更激进:让模型在多轮工具调用中自己摸索,整条轨迹跑完才结算一次总奖励。大厂强化学习框架里显得最玄的”训推分离””延迟奖励”,在这里被串成了能一口气读完的代码。

评测部分还藏着一个有价值的细节:MiniMind-3 在 C-Eval 存在数据污染的子集上能跑到约 97%,去掉泄漏的题目后只剩 25 分上下。作者据此提醒:下次看到哪个新模型榜单刷得漂亮,先问一句它见过原题没有。
谁适合上手
环境要求很低:Python 3.10 加一张消费级显卡即可。没有大显卡也有变通——训练脚本支持断点续训,LoRA 支路在 CPU 上也能跑;想先看看效果,直接执行 ollama 命令就能体验 64M 模型的”嘴硬”程度。
项目还延伸出一系列子项目:视觉多模态的 MiniMind-V、全模态的 MiniMind-O、扩散语言模型 MiniMind-dLM、线性注意力版本 MiniMind-Linear,以及 198M 参数(激活 64M)的 MoE 版本。ICML 2025 上还有论文被作者列入由该项目促成的成果清单。
客观地说,MiniMind 的价值不在生产力——想直接要生产力的用户继续调 API 更划算。它的价值在于把大模型的”黑盒”打开:当预训练、奖励稀疏、对齐税这些词变成亲手跑过的 loss 曲线,再看各家厂商的发布稿时,眼光会完全不同。
]]>







