在 Mac 上使用 AI,通常绕不开一套固定动作:打开聊天窗口、输入提示词、复制回复、切回文档粘贴。谷歌希望把这套流程彻底砍掉。

7 月 29 日,谷歌为 Mac 版 Gemini 应用推出重要更新:用户只需长按键盘左下角的 Fn 键,就能在任意窗口中直接对 Gemini 说话,让 AI 把语音变成润色好的文字,或者根据屏幕内容执行更复杂的任务。这项功能曾在今年 5 月的 I/O 2026 开发者大会上预告,如今随 Mac 版 Gemini 1.88 版本正式落地。
智能听写:自动去掉「嗯」「啊」
更新的第一项核心能力是「智能听写」。用户在任何应用里把光标放到目标位置,长按 Fn 键开口说话,Gemini 就会把语音实时转成文字,直接落在光标处。
与系统自带听写不同的是,Gemini 会在转写过程中自动删掉「嗯」「啊」之类的口头填充词,还能识别说话人的中途改口——比如先说了一个时间又马上纠正,最终稿只保留改过之后的版本,输出的是一段格式规整的成品文本。触发后屏幕底部会出现一个带声波动画的悬浮胶囊,提示正在聆听。
值得一提的是,双击 Fn 键本就是 macOS 自带听写功能的默认触发方式之一,谷歌选择长按同一个键位,明显是想让老用户无缝迁移。
屏幕感知:AI 能「看懂」你在干什么
第二项能力叫「屏幕感知推理」,需要用户在设置中主动开启。启用后,Gemini 可以理解 Mac 屏幕上的可见内容,配合语音指令完成跨应用任务。
谷歌给出了几个典型场景:选中桌面上的一批文件后开口说「读一下这些宠物医院的档案,把狗的病史总结成一封发给寄养机构的邮件」;在任意应用里高亮一段笔记,然后说「把这些笔记改写成一份执行摘要,开头加一段要点速览」,改好的文字会直接插回原处;还可以对着屏幕上的插画说「基于这张图生成一个深色模式版本」,让 Gemini 生成或修改图片。
苹果生态里其实早有类似的单点能力:macOS 内置听写可以语音转文字,Apple Intelligence 写作工具能校对、改写、摘要选中文本,Siri AI 也具备屏幕感知。科技媒体 AppleInsider 评价称,Gemini 的真正差异点在于把听写、编辑、屏幕感知三件事收进了同一个快捷键,省掉了在聊天窗口和工作文档之间来回搬运的所有步骤。
隐私细节仍待谷歌交代
屏幕感知被设计成可选项,用户可自行决定是否允许 Gemini 访问屏幕信息。但谷歌尚未说明该功能需要调用哪些 macOS 系统权限、屏幕内容数据如何处理,以及能否覆盖所有应用和输入框。相比普通听写,这类功能获取的信息要多得多,透明度问题预计会成为后续关注焦点。
谷歌今年 4 月才推出原生 Mac 版 Gemini 应用,6 月加入可自动执行任务的 Spark 智能体,如今又补上语音入口,桌面端的迭代节奏相当激进。新语音功能目前已面向全球所有 Mac 版 Gemini 用户推送,暂时仅支持英语,谷歌表示更多语言将在今年晚些时候跟进。
来源:MacRumors(https://www.macrumors.com/2026/07/29/gemini-for-mac-dictation/)、9to5Google、AppleInsider
发表回复