
10 月 9 日,Cloudflare 发布开放权重决策模型 Clef-omni,支持通过单次 API 调用同时处理文本、图像、音频和视频。这是 Clef 系列模型在 10 月初接连推出 Clef 与 Clef-flash 之后,面向多模态决策场景的又一次扩展,模型权重已在 Hugging Face 以 Apache 2.0 协议开放。
从文本到音视频:一次调用处理全部模态
在 Clef-omni 之前,Clef 已支持文本、图像,以及从视频中按时间抽取的连续静态画面。Clef-omni 在此基础上新增了音频与完整视频输入,支持 wav、mp3、mp4 和 webm 格式。Cloudflare 表示,开发者无需再自行搭建语音转写、音视频拆分等前置流程,用一个模型即可对多种输入做出判断。
技术实现上,Clef-omni 基于 Qwen3-Omni-30B-A3B-Instruct 构建,采用 30B 参数的混合专家(MoE)架构、活跃参数约 3B,并保留了原模型的主要理解能力。它面向结构化决策任务,不生成常规文本输出,而是在单次前向计算中直接对所有允许的答案选项打分。
性能与基准表现
根据 Cloudflare 公布的测试数据,纯文本请求的中位响应时间约为 130 毫秒,图像约 150 毫秒;一段带声音的 21 秒视频约 1.5 秒即可完成评分。在基准测试中,Clef-omni 取得 BFCL 精确匹配率 98.2、API-Bank 准确率 92.7、BANKING77 宏平均 F1 94.8、CLINC150+OOS 宏平均 F1 97.7 的成绩,在家用电器任务上的精确匹配率为 69.3。
定价下调,托管版上下文窗口收窄
伴随此次发布,Cloudflare 同步下调了 Clef-flash 的价格:输入价从每百万 Token 0.09 美元(约合 0.6 元人民币)降至 0.038 美元(约合 0.25 元),降幅约 58%,使其低于同类决策模型 Jev;不过托管版上下文窗口也从 64k 缩小至 24k。Clef-omni 本身的定价为输入每百万 Token 0.15 美元(约 1 元)、输出 0.60 美元(约 4 元)。
典型应用包括设备巡检:将一台设备的照片、运行录音与风扇视频一并提交给同一个模型,即可判断铭牌是否清晰、运转声音是否正常、风扇是否在转,无需串联多个专用模型。对于希望把多模态判断嵌入工作流、又不愿自行维护级联管线的开发者而言,这类开放权重决策模型提供了更直接的落地路径。







