人工智能实验室 PrismML 推出三值量化版本的开源模型 Bonsai 2 27B。该模型基于 Qwen3.8 27B 微调,以不到 1/9 的内存占用,在综合基准测试中取得了基础模型 98.2% 的分数,整体表现甚至优于此前的 Qwen3.6 27B 版本,为本地部署大模型提供了新的性价比选择。

从 95% 到 98.2%
PrismML 今年早些时候推出的 Bonsai 27B,以显著更低的内存占用实现了 Qwen3.6 27B 基础模型 95% 的性能。而在新版本中,基础模型升级至 Qwen3.8 27B,推理、编程、视觉、长程智能体性能全面提升,内存占用进一步压到不足原来的 1/9,综合基准仍保留 98.2% 的水平。
PrismML 表示,Bonsai 2 27B 足以在本地承担”真正的知识工作”——包括编程智能体循环、计算机使用工作流、私有文档解析、多模态调试与混合编排,仅在需要时再调用云端 API。
5.9GB 装下 27B 参数
Bonsai 2 27B 采用 FP16 分组缩放的三值量化,每个权重的有效比特为 1.76,模型总大小仅 5.9GB,并支持 262K 上下文窗口。这意味着一张消费级显卡或一台 Apple 设备就能跑起原本需要数十 GB 显存的 27B 量级模型。
性能方面,该模型在 NVIDIA GeForce RTX 5090 上可达 143TPS(词元/秒)的吞吐量,在 Apple Silicon M5 Max 上可达 46.8TPS。在 GeForce RTX 4090 上,其能效为 0.714mWh/Token,比全精度 8B 模型低 40%。
开源可本地运行
Bonsai 2 27B 可通过 CUDA 在 NVIDIA GPU 上运行,也可通过 MLX 在 Apple 设备上运行,并以 Apache 2.0 许可证开放权重。对于希望在本地、离线、低成本运行较强大模型能力的开发者而言,这一组合显著降低了门槛。







