<?xml version="1.0" encoding="UTF-8"?><rss version="2.0"
	xmlns:content="http://purl.org/rss/1.0/modules/content/"
	xmlns:wfw="http://wellformedweb.org/CommentAPI/"
	xmlns:dc="http://purl.org/dc/elements/1.1/"
	xmlns:atom="http://www.w3.org/2005/Atom"
	xmlns:sy="http://purl.org/rss/1.0/modules/syndication/"
	xmlns:slash="http://purl.org/rss/1.0/modules/slash/"
	>

<channel>
	<title>PyTorch &#8211; mylogs.cn</title>
	<atom:link href="https://mylogs.cn/tag/pytorch/feed/" rel="self" type="application/rss+xml" />
	<link>https://mylogs.cn</link>
	<description>发现、记录、分享</description>
	<lastBuildDate>Thu, 10 Sep 2026 20:58:09 +0000</lastBuildDate>
	<language>zh-Hans</language>
	<sy:updatePeriod>
	hourly	</sy:updatePeriod>
	<sy:updateFrequency>
	1	</sy:updateFrequency>
	
	<item>
		<title>3块钱、2小时从零训一个大模型：MiniMind 火了</title>
		<link>https://mylogs.cn/3%e5%9d%97%e9%92%b1%e3%80%812%e5%b0%8f%e6%97%b6%e4%bb%8e%e9%9b%b6%e8%ae%ad%e4%b8%80%e4%b8%aa%e5%a4%a7%e6%a8%a1%e5%9e%8b%ef%bc%9aminimind-%e7%81%ab%e4%ba%86/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Thu, 10 Sep 2026 20:58:09 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI学习]]></category>
		<category><![CDATA[GitHub]]></category>
		<category><![CDATA[MiniMind]]></category>
		<category><![CDATA[PyTorch]]></category>
		<category><![CDATA[从零训练]]></category>
		<category><![CDATA[大模型]]></category>
		<category><![CDATA[开源项目]]></category>
		<guid isPermaLink="false">https://mylogs.cn/3%e5%9d%97%e9%92%b1%e3%80%812%e5%b0%8f%e6%97%b6%e4%bb%8e%e9%9b%b6%e8%ae%ad%e4%b8%80%e4%b8%aa%e5%a4%a7%e6%a8%a1%e5%9e%8b%ef%bc%9aminimind-%e7%81%ab%e4%ba%86/</guid>

					<description><![CDATA[训练一个大模型要多少钱？很多人的第一反应是&#8221;几百万张显卡、几十亿预算&#8221;。GitHub  [&#8230;]]]></description>
										<content:encoded><![CDATA[<p class="wp-block-paragraph">训练一个大模型要多少钱？很多人的第一反应是&#8221;几百万张显卡、几十亿预算&#8221;。GitHub 上一个名为 MiniMind 的开源项目给出了另一个答案：单张 RTX 3090 显卡，约 2 小时、约 3 元人民币的租卡成本，就能从零训练出一个 64M 参数、能对话、会调用工具的语言模型。</p>
<p class="wp-block-paragraph">这个项目最近重新冲上 GitHub 趋势榜，单日新增上千星标。截至目前，MiniMind 已累计收获超过 5.68 万 Star 和 7400 多次 Fork。需要注意的是，它并非横空出世的新项目——仓库创建于 2024 年 7 月，持续迭代超过两年，最近一次提交落在 2026 年 8 月 31 日，采用完全免费的 Apache 2.0 协议开源。</p>
<h2 class="wp-block-heading">&#8220;大道至简&#8221;：不是微调，而是从零造一遍</h2>
<p class="wp-block-paragraph">MiniMind 的核心理念写在 README 的开头：&#8221;用乐高自己拼出一架飞机，远比坐在头等舱里飞行更让人兴奋。&#8221;</p>
<p class="wp-block-paragraph">与市面上大多数&#8221;挂个 LoRA 微调一下&#8221;的教程不同，MiniMind 的所有核心算法——Transformer 结构、分词器、训练循环、对齐流程——全部用原生 PyTorch 从零实现，不依赖 transformers、trl、peft 等任何高层框架封装。训练过程中的每一次张量变换、每一处注意力计算都清晰可见。</p>
<p class="wp-block-paragraph">作者在项目说明中打过一个比方：只会调用现成模型，就像教牛顿使用 21 世纪的智能手机——手机玩得再溜，物理还是没碰着。MiniMind 想解决的就是这个问题：让学习者亲手把&#8221;预训练&#8221;&#8221;SFT&#8221;&#8221;RLHF&#8221;这些被说烂的名词跑一遍。</p>
<h2 class="wp-block-heading">&#8220;2小时3块钱&#8221;的账，官方自己算清楚了</h2>
<p class="wp-block-paragraph">&#8220;2 小时、3 元钱&#8221;听起来像营销话术，但 README 里给出了实测口径：所谓 2 小时，指的是 SFT（指令微调）阶段在单张 RTX 3090 上跑完 1 个 epoch 的实测耗时，约 1.10 小时；预训练约 1.21 小时，两者合计约 2.31 小时。按 3090 租卡单价约 1.3 元/小时计算，全程约 3 元人民币。</p>
<p class="wp-block-paragraph">这条最快路线使用 1.2GB 的 mini 版预训练数据和 1.6GB 的 SFT 数据，产出的是一个名为 MiniMind-3 Zero 的对话模型。想训得更充分，也有 10GB/14GB 的完整版数据集可选。</p>
<p class="wp-block-paragraph">训出来的模型有多大本事？64M 参数，约为 GPT-3 的两千七百分之一。作者自己在 README 里反复强调：它打不过任何商用模型。官方保留的对话样例里，这个模型会一本正经地编造&#8221;杭州特色美食是鸡肉串、鳗鱼头&#8221;。在中文评测 C-Eval 上它只拿到 24.89 分——几乎贴着四选一瞎蒙的期望线。</p>
<p class="wp-block-paragraph">但有两组数据值得认真看：其一，数学工具调用任务的 20 道题，SFT 权重答对 12 道，经过 Agentic RL（智能体强化学习）后答对 17 道，正确率从 60% 提升到 85%——一个 64M 的模型学会了&#8221;先调计算器再报答案&#8221;；其二，强化学习后的权重在开放问答上事实性会下降、幻觉更明显，这就是常说的&#8221;对齐税&#8221;，作者的坦率记录本身就是很好的学习材料。</p>
<figure data-wp-context="{&quot;imageId&quot;:&quot;6aa32e165b6cc&quot;}" data-wp-interactive="core/image" data-wp-key="6aa32e165b6cc" class="wp-block-image size-large wp-lightbox-container"><img decoding="async" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/09/r24_01_inner_1.webp" alt="MiniMind 模型结构与训练流程"/><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：MiniMind GitHub 仓库（jingyaogong/minimind）</figcaption></figure>
<h2 class="wp-block-heading">技术上怎么做到的</h2>
<p class="wp-block-paragraph">MiniMind 的省钱秘诀从词典开始：主流模型的词表动辄十几万（Qwen2 为 151,643、Llama 3 为 128,000），MiniMind 只配了 6,400 个词元。词典薄，分词就碎，但 embedding 层省下的参数可以匀给真正干活的网络主体。主线模型配置为 8 层 Transformer、隐藏维度 768，结构对齐 Qwen3 生态，训完可直接扔进 ollama、vllm、llama.cpp 等推理框架运行。</p>
<p class="wp-block-paragraph">训练流水线覆盖了语言模型的完整生命周期：预训练让模型学会&#8221;词语接龙&#8221;；SFT 让它理解 user、assistant、system、tool 等对话角色；之后的对齐阶段，DPO、PPO、GRPO、CISPO 等强化学习算法全部以原生 PyTorch 从零实现。一个值得注意的细节是，SFT 主线数据里直接混入了约 10 万条由 qwen3-4b 合成的工具调用样本，所以训完的模型天然就会一点 Tool Call。</p>
<p class="wp-block-paragraph">进阶的 Agentic RL 部分更激进：让模型在多轮工具调用中自己摸索，整条轨迹跑完才结算一次总奖励。大厂强化学习框架里显得最玄的&#8221;训推分离&#8221;&#8221;延迟奖励&#8221;，在这里被串成了能一口气读完的代码。</p>
<figure data-wp-context="{&quot;imageId&quot;:&quot;6aa32e165b93a&quot;}" data-wp-interactive="core/image" data-wp-key="6aa32e165b93a" class="wp-block-image size-large wp-lightbox-container"><img decoding="async" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/09/r24_01_inner_2.webp" alt="MiniMind 评测雷达图"/><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：MiniMind GitHub 仓库（jingyaogong/minimind）</figcaption></figure>
<p class="wp-block-paragraph">评测部分还藏着一个有价值的细节：MiniMind-3 在 C-Eval 存在数据污染的子集上能跑到约 97%，去掉泄漏的题目后只剩 25 分上下。作者据此提醒：下次看到哪个新模型榜单刷得漂亮，先问一句它见过原题没有。</p>
<h2 class="wp-block-heading">谁适合上手</h2>
<p class="wp-block-paragraph">环境要求很低：Python 3.10 加一张消费级显卡即可。没有大显卡也有变通——训练脚本支持断点续训，LoRA 支路在 CPU 上也能跑；想先看看效果，直接执行 ollama 命令就能体验 64M 模型的&#8221;嘴硬&#8221;程度。</p>
<p class="wp-block-paragraph">项目还延伸出一系列子项目：视觉多模态的 MiniMind-V、全模态的 MiniMind-O、扩散语言模型 MiniMind-dLM、线性注意力版本 MiniMind-Linear，以及 198M 参数（激活 64M）的 MoE 版本。ICML 2025 上还有论文被作者列入由该项目促成的成果清单。</p>
<p class="wp-block-paragraph">客观地说，MiniMind 的价值不在生产力——想直接要生产力的用户继续调 API 更划算。它的价值在于把大模型的&#8221;黑盒&#8221;打开：当预训练、奖励稀疏、对齐税这些词变成亲手跑过的 loss 曲线，再看各家厂商的发布稿时，眼光会完全不同。</p>
<p class="wp-block-paragraph">]]&gt;</p>]]></content:encoded>
					
		
		
			</item>
	</channel>
</rss>
