断网也能语音转文字:Mac开源神器用上千问模型

语音转文字工具不少,但大多要联网、要注册账号、要按月付费,录音还得上传到别人的服务器。7 月 29 日,一款名为 Qwen Scribe 的开源工具在 GitHub 上发布了首个公开测试版(v0.1.0-beta.1),思路完全相反:模型跑在本地、数据不出电脑、不要账号也不要 API 密钥,代码以 Apache-2.0 协议完全开源。项目上线当天就冲上了 Hacker News 首页。

核心是阿里开源的千问语音模型

Qwen Scribe 的底层是阿里巴巴开源的 Qwen3-ASR 语音识别模型,通过 mlx-qwen3-asr 项目跑在 Mac 的 Metal GPU 上。Qwen3-ASR 是目前最强的开源语音识别模型之一,有第三方移植测试显示,它在多语言和嘈杂环境下的识别表现优于 OpenAI 的 Whisper-large-v3。

工具提供两档模型可选:追求准确率可以用 17 亿参数版本,占用约 3.4GB 统一内存;追求速度可以用 6 亿参数版本,只占约 1.2GB 内存。模型权重在首次使用时自动下载,之后即使断网也能正常转写。

两种用法:拖文件转写,或全局听写

Qwen Scribe 的功能分两块。第一块是文件转写:在本地网页界面里把音频或视频文件拖进去,工具会自动识别语言,支持强制指定语言、专有词汇提示、逐词时间戳,还能直接导出 SRT 字幕文件。所有转写记录自动保存在本地,可以随时重新打开或删除。

第二块是系统级听写,这也是最实用的部分:在任意应用的文本输入框里,按住右侧 Command 键说话,松开后文字就会在光标处自动粘贴出来——全程在本地完成识别。屏幕上会显示一个不抢焦点的悬浮提示,标明「聆听中」「转写中」以及成功或失败状态。

隐私设计上,这款工具做得相当细致:本地服务只监听 127.0.0.1,并做了 Host 和浏览器来源校验;听写助手只响应右 Command 键,粘贴文字前会在内存里暂存剪贴板内容,粘贴后如果剪贴板没被改动就自动恢复原状。

上手门槛:目前需要自己动手编译

想尝鲜的用户需要注意几个条件:必须是搭载 Apple Silicon 芯片的 Mac,系统要求 macOS 14 或更新版本,还需要安装 Python 3.12 以上版本和 ffmpeg。

目前的测试版只提供源码,没有现成的安装包——因为应用还没有经过苹果的开发者签名和公证,开发者不希望用户绕过系统安全警告安装未签名程序。用户需要克隆代码仓库后用 make app 命令自行编译。按照路线图,签名和公证过的正式安装包计划在 v0.2 版本推出。

另外要说明的是,Qwen Scribe 是独立的社区项目,与阿里云、千问团队以及苹果公司均无官方关联。

对于经常需要整理录音、写字幕,又不放心把敏感内容传到云端的用户来说,这类「模型在本地、数据不出门」的工具正在变成一个值得关注的方向——大厂的开源模型加上社区开发者的打磨,免费方案的体验已经越来越接近付费云服务。

来源:GitHub – VladUZH/qwen-scribe(via Hacker News)