
Adobe 在 8 月 20 日宣布,Firefly 平台上的三款音频生成工具结束测试阶段,正式转为普遍可用版本。这三款工具分别负责配乐、配音和音效,加上此前已有的图像、视频与设计工具,Firefly 由此把一条视频从画面到声音的生产链条收进了同一个界面。
三款工具各管一段声音
生成音乐(Generate Music)用于产出原创曲目,并会根据视频的长度和情绪基调做调整。它可以分析视频内容,再据此给出它判断最合适的提示词,这些提示词是可以编辑的。用户也能在生成前手动调整节奏、情绪强度和时长等参数,点击生成后一次会返回四个版本供挑选。
生成语音(Generate Speech)负责把脚本转成听起来自然的配音。这一项提供两种模型可选:Adobe 自家的 Firefly 语音模型,或者第三方的 ElevenLabs。用户可以对脚本中的特定片段添加表现力标签和发音标签,用来控制某一句该怎么读。
生成音效(Generate Sound Effects)用于制作与画面动作、时间点和力度相匹配的自定义音效。它接受文字提示,也允许用户直接用自己的声音录一段作为参考音,再由模型生成对应效果。
三款工具目前运行在 Firefly 的桌面端和移动端网页应用中。
真正的卖点不是音质,而是授权
在这次发布中,Adobe 反复强调的并非音频听起来有多好,而是它能不能安全地用于商业项目。按照 Adobe 的说法,生成音乐产出的是完整授权的原创曲目,可以直接用于成品;并且与生成语音、生成音效一样,用户无需额外订阅任何服务,就能生成可商用的素材。换句话说,成品交付出去之后,不必再担心授权问题或被平台下架。
Adobe 在公告中这样描述这个环节的痛点:
声音通常是最后才添加的东西,却是观众最先注意到的东西。它也最容易打断创作节奏——你得跑去用专门的工具和另外的服务,再回来把这些素材拼到一起。今天我们很高兴地宣布,Firefly 广受欢迎的音频工具,包括生成音乐、生成语音和生成音效,已经普遍可用,可以直接进入创作流程,从社交内容、直播视频日志,到短片、产品教程和播客片段。
一份自家调研解释了动机
为了说明这件事的必要性,Adobe 拿出了一份与伯克利音乐学院合作开展的调研,对象是视频创作者、音乐人和市场营销人员。
按 Adobe 公布的结果,100% 的受访者表示会在视频里使用音乐,其中 32.7% 使用 AI 生成的音乐。而在阻碍使用音乐的原因中,43.2% 的受访者提到法律与版权风险,38.9% 提到授权成本。
需要说明的是,这份调研由 Adobe 主导发布,公开信息中并未给出样本量和具体调研方法,因此这些比例更适合当作 Adobe 对市场需求的判断依据来看,而不是行业普查数据。不过它至少解释清楚了 Adobe 为什么把”授权”当作这次发布的核心话术——如果版权顾虑确实是最大障碍,那么一个自带授权的音频生成工具,卖的就是省心。
模型清单继续扩张
同一天,Adobe 还宣布把 Gemini Omni Flash 接入了 Firefly。按官方说法,这个模型让用户”能够在文本之外,用视频、音频和图像作为输入来给出提示,从而有更多方式来推进视频创作,并通过来回编辑重新调整它”。
这一步距离 Adobe 上一次扩充模型清单只隔了几天——此前它刚刚把 Runway Aleph 2.0 和可灵 2.0 加入第三方模型工具集。算下来,Firefly 内部目前汇集的模型来自 Google、可灵 AI、Luma AI、OpenAI、Runway,以及 Adobe 自己。
这种做法值得留意:Adobe 一边自研 Firefly 语音模型,一边把 ElevenLabs 这样的竞争者摆在旁边供用户选择。它似乎更在意创作流程发生在哪个窗口里,而不坚持每个环节都必须由自家模型完成。当然,这也带来一个现实问题——Adobe 反复承诺的”商业安全”,是与 Firefly 自家模型绑定的,这份保证并不天然覆盖平台上其他公司的模型输出。对需要交付客户成品的创作者来说,具体用了哪个模型,仍然值得在动手前确认一遍。







