RTX 4080 打游戏绰绰有余,但它的 16GB 显存跑大语言模型就捉襟见肘了。据 Wccftech 7 月 26 日报道,一位名叫 Tymscar 的硬件玩家想出了一个便宜的解法:把英伟达退役的数据中心显卡 Tesla V100 塞进自己的游戏电脑,总共只花了约 200 英镑(约合 266 美元)。

100 美元一张的”老将”,宝刀未老
Tesla V100 是英伟达多年前的数据中心加速卡,如今在 eBay 上单张只要 100 美元左右。别看便宜,这张 16GB HBM2 显存的老卡拥有 5120 个 CUDA 核心和 4096-bit 位宽,显存带宽高达 900GB/s——放到今天跑 AI 推理,依然有可观的余力。
不过想把它装进普通台式机,远不是”即插即用”。V100 采用的是服务器专用的 SXM2 接口,没有 PCIe 插槽、没有视频输出、也没有 PCIe 供电接口,Tymscar 必须额外购买一块 SXM2 转 PCIe 的转接板才能装上主板。
最大的坎不是接口,是噪音
装好之后,新问题来了:给 V100 配的均热板式散热器风扇全速运转时噪音高达 82 分贝——这个响度足以让任何人坐立难安。
Tymscar 的解决方式颇有动手党风范:用一节 9V 电池配合 PWM 跳线小改了一下风扇调速,把转速压到原最大转速的 10%,噪音问题就此解决。至此,他的游戏电脑拥有了 RTX 4080 + V100 共 32GB 的可用显存。
32GB 显存能干什么:27B 模型每秒 32 个 token
没有任何游戏需要 32GB 显存(除非你想用 16K 分辨率玩新作),所以这套配置的真正用武之地是本地大模型。
Tymscar 实际运行的是 Qwen3.6-27B-MTP 模型(Q5_K_M 量化版本,体积 19GB),在 128K token 上下文的设置下,生成速度达到每秒 32 个 token,提示词处理速度在每秒 133 到 160 个 token 之间——对于一套花费不到 300 美元的扩展方案来说,这个表现相当能打。
对想在家跑中小规模 AI 模型的玩家来说,这条路线的吸引力显而易见:不用联网、不付订阅费,捡一张上一代数据中心显卡,就能让本地大模型真正跑起来。当然,代价是折腾转接板、散热和噪音——这本来就是属于动手党的乐趣。
来源:Wccftech