16GB 显存曾被认为过剩,如今跑本地 AI 刚好被吃满

你给显卡买了 16GB 显存,朋友说「根本用不完」。等你在本地跑起 AI 工作流,这句话可能就该改口了。

How-To Geek 作者 Nick Lewis 用自己的经历给出了对照:8GB 显存大致只能跑 70 亿参数(7B)模型,12GB 能跑 140 亿(14B),到了 16GB 才够跑 240 亿(24B)量级;而一个 270 亿(27B)的 Q4_K_M 量化模型,单是权重就要吃掉约 16GB 显存。

这还没算注意力缓存(KV cache)。它是模型记住上下文的临时内存,会额外占用显存的 25%(在 8K 上下文下)到翻倍(32K 上下文)。很多工具的默认上下文很短,比如 Ollama 默认只有 4096,所以小测试里显得很省,一旦把上下文拉长,显存立刻见底。

更关键的是,真实场景往往是好几个模型一起跑:主对话模型、负责向量检索的嵌入模型、再做一遍重排序的模型……一条典型的自动化流水线里同时跑 4 到 5 个模型并不稀奇。

混合专家模型(MoE)是个出路。这类模型只在每次推理时激活其中一部分参数,一个 200 亿级量化模型配 6 万上下文,在 RTX 5070 Ti 这样的显卡上能跑出每秒 100 个词以上的速度。优化手段还包括:把注意力缓存量化到 8 位或 4 位(一行配置即可)、主动限制上下文长度、用 MoE 替代稠密模型、把放不下的层卸载到 32GB 或 64GB 的系统内存。

说白了,16GB 不是「过剩」,而是「刚好及格」。想同时舒服地跑多个模型、留足上下文,24GB 才是真正的甜点档。打算本地玩 AI 的人,买卡时显存容量比核心频率更该排在前头。

来源:How-To Geek(作者 Nick Lewis,2026-08-09)