当地时间 2026 年 10 月 1 日,Cloudflare 宣布推出两款开源多模态决策模型 Clef 与 Clef-flash。与传统大语言模型不同,这类决策模型不生成自由文本,而是针对给定的若干选项返回 calibrated 概率,帮助 AI 智能体在路由、分类、工具选择等场景中做出可量化的判断。

模型规格与能力
Clef 系列选用阿里巴巴通义千问(Qwen)作为基座模型。其中,Clef 基于 Qwen3.8-27B 构建,Clef-flash 则基于更小尺寸的 Qwen3.5-9B。两款模型均通过 Apache 2.0 协议在 Hugging Face 上开源权重。
Clef 原生配备了视觉编码器,可直接解析图像输入并对视觉内容进行判别分类。在上下文窗口方面,Clef 系列扩展至 64k,而同类决策模型 Jev 为 32k,这使得开发者能够为模型载入更丰富的系统状态信息,从而做出更全面的综合判定。
性能与延迟表现
Cloudflare 公布的基准测试数据显示,Clef 与 Clef-flash 在 Jev Decision Index 0.2.1 评测中处于领先位置,并且完全兼容 Jev-API,方便开发者进行测试验证。具体指标包括:
– Clef 中位延迟约为 209 毫秒,决策指数得分 61.2;
– Clef-flash 中位延迟约为 38.8 毫秒,决策指数得分 57.1;
– 在 BFCL 函数调用准确率测试中,Clef 达到 98.47%,Clef-flash 达到 98.76%;
– 在 BANKING77 意图分类数据集上,Clef 的 macro-F1 得分达到 94.20。

决策模型的应用价值
在 AI 智能体的实际运行中,大量步骤并非创意写作,而是结构化决策:工单应该分派到哪个类别?这张截图是否安全可发布?下一步该调用哪个工具?传统聊天模型需要先生成文本再解析格式,既慢又容易偏离预期格式。Clef 直接输出各选项的概率分布,让系统可以设置阈值、记录日志,并在置信度不足时转交人工处理。
Cloudflare 还同步推出了面向定制化微调的强化学习产品,帮助客户针对自身业务场景进一步优化 Clef 的决策能力。







