想在自己电脑上跑大模型,最常见的劝退理由是硬件。参数量往上走,显存需求跟着涨,一台 16GB 内存的普通笔记本似乎只配跑最小号的模型,回答质量也就那样。

MakeUseOf 撰稿人 Yadullah Abidi 分享了一个反例。DeepReinforce 的 Ornith 1.0 家族中体积最小的 Ornith 9B,在他 16GB 内存的笔记本上给出了接近 35B 级别的回答,换个版本还能读图。要复现这个结果,第一步是把硬件账算清楚。
一、先分清内存和显存
- 全精度 bf16 运行 Ornith 9B 大约需要 19GB 内存,官方建议用 80GB 显存的 GPU 做非量化部署,个人机器基本无缘。
- 量化版本才是可行路径。Q4_K_M 量化后模型体积压到约 5.6GB,扣掉系统占用和一个合理的上下文窗口,16GB 内存放得下。
- 这里的 16GB 指系统内存,不是苹果芯片 Mac 那种 GPU 可以直接调用的统一内存。Abidi 的机器是 16GB 内存搭配 RTX 4060,显存 8GB。
- 在装了独立显卡的机器上,决定速度的是显存而非总内存。5.6GB 的量化模型若塞不进显存,Ollama 会把一部分交给 CPU 处理,速度立刻掉下来。这与显卡品牌无关,显存只有几 GB 就会撞上同一堵墙。Mac 的内存和 GPU 共用一个池子,在这件事上反而占便宜。
二、想要读图能力,别拉错版本
- Ornith-1.0-9B 的官方模型卡把文本列为主要模态。直接拉默认的 GGUF 或标准权重,是没有图像能力的。
- 视觉能力来自单独导出的版本,在 Ollama 上以社区标签
robit/ornith-vision:9b分发,并非 DeepReinforce 官方发布,它在同一套推理骨干上叠加了视觉和工具调用。 - 另有至少一个量化 MLX 版本在模型卡上同时标注了文本和图像两种模态。也就是说多模态是特定构建的附加项,并非所有 Ornith 9B 文件都具备。
- 结论很直接:按命名空间拉带 vision 标签的那一个,别随手拉搜索结果里第一个 Ornith 9B 量化包。Ollama 和 LM Studio 目前对多模态模型的支持都已经比较顺畅。
三、它强在哪,弱在哪
这个家族的特别之处在训练方式。Ornith 1.0 以 Qwen 3.5 为底座做后训练,采用自我改进的强化学习配方,让模型自行搭建并打磨解题脚手架,而不是依赖人工写死的智能体流程。体积小却能打,靠的是这一点,不是参数量。家族里还有 31B 稠密版、35B 混合专家版和一个 397B 混合专家版。
成绩方面,Ornith 9B 在 SWE-bench Verified 拿到 69.4%,Terminal-Bench 2.1 得 43.1,对手是 Gemma 4-31B、Qwen 3.6-35B 这类三到四倍体积的模型。不过同门的 35B 混合专家版在相同基准上仍明显更强。
短板也很明确:面对很长的多步智能体任务,9B 版本容易打转或卡住,大一号的兄弟处理得从容得多;如果模型有一部分跑在 CPU 上,这种情况来得更早。它的优势集中在编程和终端类任务,通用推理不要按 35B 的水准去期待。
来源:MakeUseOf







