Saluki 27B:2-bit 量化 Qwen,仅 7.89GB

人工智能实验室 Underdog AI 本月发布 Saluki 27B 模型。这个「27B」背后,是一次把大模型塞进极小体积的尝试:它把约 54 GB 的全尺寸模型压缩到 7.89 GB,目标只有一个——在普通显卡上也能跑得动的本地 AI 智能体。

2-bit 量化,只留文字能力

Saluki 27B 是 Qwen3.8-27B 的 2-bit 量化调优版本,采用 IQ2-mix 混合 2-bit 方案,仅保留文字输入/输出能力,文件大小仅 7.89 GB。该模型由 ConwayResearch 在 Hugging Face 以 Apache 2.0 许可发布。

工具调用反而更强

Underdog 表示,Saluki 27B 针对智能体(Agent)应用设计,擅长日常推理与工具使用,数学表现则相对逊色。值得注意的是,其工具选择和多工具并行调用表现甚至优于全尺寸的 Qwen3.8-27B。据模型卡在 120 项工具调用测试中的结果,Saluki 27B 通过 88 项,高于原版的 84 项。

即拖即跑,兼容标准生态

模型采用标准 llama.cpp 格式(GGUF),可在标准 llama.cpp 及基于它构建的应用中直接加载,无需任何自定义编译。若需要图像能力,可额外加载约 629 MB 或 928 MB 的视觉插件文件。官方给出的运行命令为:llama-server -m Underdog-Saluki-27B-1.0-IQ2-mix.gguf –jinja -ngl 99 -fa on -c 32768,其中 –jinja 用于开启 Qwen3.8 对话模板,以正确处理工具调用与思考模式。

对开发者而言,这款模型的价值在于「轻」:单张消费级显卡甚至树莓派级设备即可部署,适合桌面与边缘侧的智能体场景。