微软 Win11 原生支持 GGUF 本地大模型推理

微软把本地大模型塞进系统层

科技媒体 NeoWin 于 10 月 8 日报道,微软正与开源项目 llama.cpp 及 GGUF 社区合作,升级面向 Windows 11 的本地人工智能推理框架 Windows ML,实验性地原生支持 GGUF 与 ONNX 两类模型格式的本地推理,并推出 Windows ML Runtime API。相关进展在 Windows 与 Surface 十月活动上作了介绍。

Windows ML 是微软面向 Windows 11 的本地人工智能推理框架,开发者可在设备端直接运行人工智能模型,构建文本生成、语音识别等应用,并减少对特定硬件优化的依赖。

从 Hugging Face 导入,在本地运行

微软表示,通过社区合作,开发者现在可以借助 llama.cpp 的实验性集成,从开源模型平台 Hugging Face 导入 GGUF 模型并直接在本地运行。在性能方面,微软还携手英伟达公司向 llama.cpp 及相关性能优化贡献代码。

Windows ML 新增的实验性 Windows 原生推理路径,可同时运行 ONNX 与 GGUF 两类模型。该路径正式名称为 Windows ML Runtime API,微软称其具备更高性能、更深的系统集成以及更细粒度的控制能力。

两种格式,各自是什么

GGUF 是本地运行大语言模型常用的模型文件格式,开发者可从 Hugging Face 等平台获取相关模型,并通过 llama.cpp 等工具在个人电脑上加载与推理。ONNX 则是用于在不同框架和硬件之间迁移人工智能模型的开放神经网络交换格式,其常用运行环境为 ONNX Runtime。

在 Windows ML Runtime API 的支持下,微软同时推出文本生成接口 TextGenerationAPI 与语音识别接口 SpeechRecognitionAPI,开发者可基于这两组接口在 Windows 应用中集成文本生成与语音识别功能。

微软表示,ONNX Runtime API 仍获得完整支持,未来针对 Windows 的优化将优先投向 Windows ML Runtime API。两种运行时均已包含在当前版本中,开发者可按自己的熟悉程度选择迁移时机。

对端侧应用开发者而言,本地人工智能推理从「自己搭环境」变成「系统自带能力」,意味着在个人电脑上跑大模型的关键一步——环境配置,被显著简化了。