9B 小模型跑赢 35B?先看显存够不够

想在自己电脑上跑大模型,最常见的劝退理由是硬件。参数量往上走,显存需求跟着涨,一台 16GB 内存的普通笔记本似乎只配跑最小号的模型,回答质量也就那样。

MakeUseOf 撰稿人 Yadullah Abidi 分享了一个反例。DeepReinforce 的 Ornith 1.0 家族中体积最小的 Ornith 9B,在他 16GB 内存的笔记本上给出了接近 35B 级别的回答,换个版本还能读图。要复现这个结果,第一步是把硬件账算清楚。

一、先分清内存和显存

  1. 全精度 bf16 运行 Ornith 9B 大约需要 19GB 内存,官方建议用 80GB 显存的 GPU 做非量化部署,个人机器基本无缘。
  2. 量化版本才是可行路径。Q4_K_M 量化后模型体积压到约 5.6GB,扣掉系统占用和一个合理的上下文窗口,16GB 内存放得下。
  3. 这里的 16GB 指系统内存,不是苹果芯片 Mac 那种 GPU 可以直接调用的统一内存。Abidi 的机器是 16GB 内存搭配 RTX 4060,显存 8GB。
  4. 在装了独立显卡的机器上,决定速度的是显存而非总内存。5.6GB 的量化模型若塞不进显存,Ollama 会把一部分交给 CPU 处理,速度立刻掉下来。这与显卡品牌无关,显存只有几 GB 就会撞上同一堵墙。Mac 的内存和 GPU 共用一个池子,在这件事上反而占便宜。

二、想要读图能力,别拉错版本

  1. Ornith-1.0-9B 的官方模型卡把文本列为主要模态。直接拉默认的 GGUF 或标准权重,是没有图像能力的。
  2. 视觉能力来自单独导出的版本,在 Ollama 上以社区标签 robit/ornith-vision:9b 分发,并非 DeepReinforce 官方发布,它在同一套推理骨干上叠加了视觉和工具调用。
  3. 另有至少一个量化 MLX 版本在模型卡上同时标注了文本和图像两种模态。也就是说多模态是特定构建的附加项,并非所有 Ornith 9B 文件都具备。
  4. 结论很直接:按命名空间拉带 vision 标签的那一个,别随手拉搜索结果里第一个 Ornith 9B 量化包。Ollama 和 LM Studio 目前对多模态模型的支持都已经比较顺畅。

三、它强在哪,弱在哪

这个家族的特别之处在训练方式。Ornith 1.0 以 Qwen 3.5 为底座做后训练,采用自我改进的强化学习配方,让模型自行搭建并打磨解题脚手架,而不是依赖人工写死的智能体流程。体积小却能打,靠的是这一点,不是参数量。家族里还有 31B 稠密版、35B 混合专家版和一个 397B 混合专家版。

成绩方面,Ornith 9B 在 SWE-bench Verified 拿到 69.4%,Terminal-Bench 2.1 得 43.1,对手是 Gemma 4-31B、Qwen 3.6-35B 这类三到四倍体积的模型。不过同门的 35B 混合专家版在相同基准上仍明显更强。

短板也很明确:面对很长的多步智能体任务,9B 版本容易打转或卡住,大一号的兄弟处理得从容得多;如果模型有一部分跑在 CPU 上,这种情况来得更早。它的优势集中在编程和终端类任务,通用推理不要按 35B 的水准去期待。

来源:MakeUseOf