Cloudflare 今天发布并开源了两个自研决策模型 Clef 与 Clef-flash,托管在自家的 Workers AI 平台上。按官方说法,Clef 目前在 Jev Decision Index 评测中排名第一;模型权重以 Apache 2.0 协议在 Hugging Face 开放下载。同日,Cloudflare 还推出了首款强化学习(RL)微调产品,让客户把 Clef 调成贴合自身业务的专用分类器。
决策模型和 LLM 是两条路线
决策模型只输出「有边界的结构化结果」——带概率的类别判断,而不是生成整段文本。典型用法是把一条客服消息丢进去,问「是否紧急」「该由哪个团队处理」「严重程度如何」,模型返回带概率的类型化答案,代码据此自动派单、升级或转人工。Cloudflare 把这一系列命名为「谱号」(音乐记谱法中放在五线谱开头的符号),理由与乐理相同:它定义了后续音符(动作)的音高;CF 后缀则指向 Cloudflare 自己。
内部实测:2.2 秒 vs 4.7 秒
最能说明问题的是自用数据。Cloudflare 威胁情报团队把域名交给 Clef(配合 Browser Run),模型可同时给出「95% 是时尚网站、85% 是电商、低于 1% 是钓鱼」这类多类别判断,抓取、渲染、分类全程 2.2 秒。同一流程中,它最快的通用 LLM gpt-oss-120b 用了 4.7 秒,且只返回两个分类。延迟与结果数量各差一倍,对需要在热路径上快速判定恶意域名的安全团队来说,这直接决定响应速度。
与 Jev 的三点差异
对标 Typesafe AI 的 Jev,Cloudflare 列了三条:Clef 带视觉编码器,可直接对图像分类,而 Jev 目前只做文本;Clef 上下文窗口 64k,Jev 为 32k;两者 API 完全兼容,官方称替换成本极低。在其自跑的 43 项评测中,Clef 系列延迟优于市面各家决策模型,只有 Laya 更快,但代价是质量明显下滑。而在 Typesafe 自家评测套件上,Clef 在 4 个场景中赢了 3 个,更快的 Clef-flash 表现尤其突出。
训练:冻结 Qwen,只做概率打分
Clef 以 Qwen 为骨干:Clef 冻结 Qwen3.8-27B,Clef-flash 冻结 Qwen3.5-9B,再联合优化一个路由头与 rank-256 低秩适配器。推理时 Qwen 只做一次 prefill,随后并行给所有合法 schema 选项打分;决策是非自回归的,不需要逐 token 生成中间文本,这正是它比自回归 LLM 快得多的原因。后训练用 label-smoothed 交叉熵搭配 Brier loss 做概率校准,并引入「面向校准决策的强化学习」(RLCD):对相邻序数选项给部分分,对完全精确的记录给奖励,同时加参考惩罚防止分布漂移。最终模型被约束为只输出概率,而非文本。
RL 流水线怎么搭
Cloudflare 把已有构件串成一条 RL 链路:AI Gateway 自动沉淀请求/响应数据集,Workers AI 跑 rollout,Containers 提供 RL 沙箱做打分与动作回放,新增的 Trainer 更新权重,最后经 Workers AI 的 BYO Model 重新部署。这套能力与其收购 Replicate 后推进的 Cog 工作直接相关。Cloudflare 称自己在不同领域积累了 15 年以上的网络数据,微调后的专用分类器会比通用 Clef 更准更快。目前微调以 FDE(前置部署工程师)团队驻场服务的形式提供,后续会上线自助平台。
开发者今天即可调用,端点形如 api.cloudflare.com/client/v4/accounts/$CLOUDFLARE_ACCOUNT_ID/ai/run/@cf/cloudflare/clef,请求体用 state 传输入、questions 定义字段类型(布尔、单选、评分)。企业客户获得承诺:Cloudflare 不读取、不存储、不拿请求与响应做训练,除非你主动使用微调产品。
为什么值得关注
这是 Cloudflare 从 CDN 与安全厂商向「agent cloud」叙事延伸的一步:把决策模型放进智能体的热路径负责判断,再搭配自家 LLM 负责执行。对国内开发者而言,Apache 2.0 的权重意味着可以自行部署验证,但真正的门槛在数据——微调效果的好坏,往往取决于你手里有多少标注好的历史决策记录。