Cloudflare Clef 决策模型凭借开放权重和 RL 平台挑战 Jev
Cloudflare 于 10 月 1 日发布了两款决策模型,其中规模较大的模型已宣称在基准测试中领先 Jev。Cloudflare Clef 决策模型——Clef 和 Clef-flash——返回的是类型化概率,而非生成不受限制的文本。两者均可通过 Workers AI 使用,并以 Apache 2.0 许可证开放模型权重。
这一组合直接挑战了 TypeSafe AI。后者仅在数周前推出 Jev 及其 System One 模型类别。Cloudflare 采用了 Jev 的 API 格式,公布了具有竞争力的基准测试结果,并加入图像支持。它还将这些模型连接到一项新兴的强化学习服务。
此次发布并不只是又一次开放模型发布。Cloudflare 希望让受限决策成为智能体的基础设施层,由其网络负责推理、数据收集、训练和重新部署。Jev 确立了这一产品模式,而 Cloudflare 正试图将其发展为完整平台。
这种区别至关重要,因为智能体做出的决策远多于生成润色完善的回答。它们要分类请求、选择工具、评估风险、路由记录,并决定何时寻求帮助。能够快速处理这些选择的模型,可以置于每个自动化工作流的运营路径中。
Cloudflare 的早期数据值得进一步测试,但尚不足以定论市场格局。相关评估来自发布模型的公司,而其客户微调平台仍部分依赖人工、部分尚在规划中。真正的竞争在于,谁能针对私有且持续变化的工作负载提供经过校准的决策。
Cloudflare Clef 决策模型将选择变为基础设施
Clef 放弃自由形式生成,让软件能够在一次前向传播中获得预定义选项的概率。
决策模型接收一个状态、一组问题以及这些问题可能的答案。该状态可以描述客服请求、发票、文档、网站或拟议中的智能体操作。随后,模型会为允许的选项分配概率。
该接口与普通聊天机器人不同。通用大语言模型预测 token 并组合出回答;决策模型则为应用开发者选定的受限答案空间评分。
例如,客服系统可能会询问哪个部门应处理一项请求。允许的选项可能包括账单、技术支持、账户访问和欺诈审核。另一个问题则可以询问该请求是否需要紧急升级处理。
输出可直接接入代码。高置信度答案可以自动路由请求,而不确定的案例则转交给更强的模型或人工审核员。
Cloudflare 基于 Qwen 主干模型构建了这两款模型。Clef 使用 Qwen3.8-27B,Clef-flash 使用 Qwen3.5-9B。较大的模型侧重精度,较小的版本则面向对延迟敏感的工作流。
两者均保留了基础模型的视觉编码器。它们可在为可选项评分前处理文本、JSON、图像或视频。根据 Cloudflare 的比较,Jev 目前专注于文本。
这些模型还提供 64,000-token 的上下文窗口。Cloudflare 将其与 Jev 的 32,000-token 窗口对比,不过更长的上下文本身并不能保证更好的决策。
该架构避免了常规的自回归解码,即模型逐个生成 token。Cloudflare 表示,Clef 仅通过 Qwen 主干模型执行预填充阶段,然后并行评估每个有效 schema 选项。
专门的路由头将输入状态连接至每个问题及其选项。在模型生成最终评分前,问题之间也可以交换信息。该设计使多个相关决策能够共享同一份编码上下文。
已发布的 Clef 模型权重包含主干模型、联合 schema 头、配置文件和支持代码。较小的 Clef-flash 模型采用相同的基本结构,并使用 Apache 2.0 许可证。
开放权重改变了竞争格局。开发者可以检查文件、在自己的基础设施上运行模型、创建量化版本,并在无需将每个输入发送至 Cloudflare 的情况下测试敏感工作负载。
本地运行仍需要大量硬件资源。Cloudflare 的模型卡显示,其在单张 H200 GPU 上测试了 Clef-flash。因此,该发布支持自托管,但并未让一款拥有 90 亿参数的多模态模型对每个组织而言都变得轻量。
Workers AI 提供托管路径。Cloudflare 托管两款模型,并提供与 Jev 的 System One API 兼容的接口。因此,现有 Jev 实验无需重新设计完整请求格式,即可测试 Clef。
这种兼容性具有战略意义。Cloudflare 并未要求开发者采用一个全新的类别或编程模型。它进入了 Jev 最近定义的类别,并降低了比较不同提供商所需的工作量。
Cloudflare 还提供了一个具体的内部应用案例。其 Threat Intelligence 团队通过 Browser Run 测试 Clef 用于网站分类,后者会在模型评估前抓取并渲染网页。
在 Cloudflare 的示例中,Clef 返回了时尚、电商和钓鱼等类别的概率。完整工作流耗时 2.2 秒,而 gpt-oss-120b 为 4.7 秒。
通用模型在该测试中只返回了两个分类结果,而 Clef 则评估了预定义类别。该比较说明了预期优势,但并未证明它在所有工作负载中的速度比率都具有普遍性。
两套系统通过不同的输出机制完成任务。输入规模、schema 设计、服务条件和所要求的输出都会影响结果。
更稳妥的结论是:为受限选项评分而设计的模型可以避免生成不必要的文字。这使其成为重复性决策的可信组件,因为每一次额外延迟都会累积。
Clef 与 Jev 的较量,是对智能体控制层的争夺
Cloudflare 通过复制 Jev 的接口,同时在开放性、多模态输入、基准测试成绩和基础设施分发方面展开竞争,向 Jev 施压。
TypeSafe AI 于 9 月 15 日推出 Jev,将其定位为首款 System One 模型。该公司将其描述为面向软件的快速决策引擎,提供类型化输出和经过校准的置信度,而非对话式回答。
Jev 帮助确立了 Cloudflare 如今所使用的术语。其 API 接收结构化问题,并返回选项、评分或概率。其工作流包括分类、路由、评估和自动化分支。
TypeSafe 的 Jev 发布公告认为,通用语言模型针对面向人类的回答进行了优化。Jev 则专注于高频软件决策,在这些场景中,自由形式生成会带来延迟和解析问题。
Cloudflare 明确承认了这种影响。其模型实现了兼容 API,基准测试套件也包括 Jev Decision Index 和 TypeSafe 的工作流评估。
这使 Jev 成为主要对手,而非一组泛泛的大语言模型。Clef 和 Jev 都在确定性规则与开放式推理之间争夺相同的位置。
当决策能够被精确表达时,规则效果很好。当任务需要规划、解释或综合时,通用模型更有帮助。决策模型瞄准的是模糊的中间地带:语言理解有用,但输出选项仍然是已知的。
Cloudflare 表示,Clef 在 BFCL case-exact 评估中达到 98.47,Clef-flash 达到 98.76,Jev 则为 95.75。在 API-Bank 准确率方面,Clef 得分 91.93,Clef-flash 得分 93.11,Jev 得分 88.19。
不同测试中的结果有所差异。Clef 以 64.7 领先所报告的发票处理工作流,Jev 为 61.8。Clef-flash 则以 77 分领先客户服务任务,仅略高于 Jev 的 76 分。
Jev 在智能体轨迹可观测性方面仍然领先。其得分为 71.6,而 Clef-flash 为 69.8,Clef 为 68.5。没有任何单一模型在所有工作负载中领先。
延迟带来了最鲜明的宣称差异。在 43 项评估中,Cloudflare 报告 Clef 的中位延迟为 209.3 毫秒,Clef-flash 为 38.8 毫秒。其测得 Jev 为 524.1 毫秒。
因此,Clef-flash 似乎尤其积极地定位为快速控制模型。其报告的中位数不到 Jev 的十分之一,尽管 Cloudflare 控制了评估环境并公布了这项比较。
Laya 的报告速度更快,为 5.8 毫秒,但它在多项列出的测试中质量评分低得多。这一结果强化了该类别的核心权衡:只有当模型的概率仍然可信时,延迟才有价值。
Cloudflare 还宣称具备基础设施优势。Workers AI 可以将推理部署在靠近其网络上运行应用的位置,从而缩短模型调用周边的传输时间。
网络邻近性无法消除计算时间、冷启动、拥塞或区域硬件限制。但当一个决策处于交互式产品的关键路径时,它仍可能产生重要影响。
设想一个处理发票的智能体。它可能对文档进行分类、识别负责团队、标记政策例外情况,并决定是否需要人工批准。工作流执行任何可见操作前,可能已经发生多次模型调用。
同样的模式也出现在安全领域。智能体可以检查工具请求是否符合用户目标、是否涉及敏感信息,或是否会将数据发送至经批准边界之外。
每项检查都很具体,但总量可能非常大。快速模型使持续审核变得比在每一步都使用前沿推理模型更可行。
这并不意味着 Clef 会取代 Jev,也不能证明开放权重必然胜出。TypeSafe 可以改进其模型、训练数据和服务栈。它也可以通过校准实现差异化;当软件根据置信度阈值采取行动时,校准的重要性高于原始准确率。
Cloudflare 的 API 兼容性降低了双向切换成本。开发者可以在不同提供商之间运行相同的概念工作流,并基于私有数据衡量结果。
这种可移植性会对 Jev 形成压力。它也使 Cloudflare 无法仅依赖分发优势,因为客户无需重建应用就能比较决策质量。
OpenAI 和 AWS 提供了补充背景。OpenAI 已推出处于有限预览阶段、面向预定义选择的 Decisions API;AWS 则发布了实验性的 Strands Decider 模型。
这些产品验证了对独立决策层的需求。不过,Clef 与 Jev 的比较仍是最清晰的竞争,因为两款产品都通过高度一致的接口提供类型化概率。
胜者不会由发布首周的基准测试平均成绩决定。生产环境买家将关注错误批准、不必要的升级、响应一致性、硬件需求,以及经过领域专属训练后的行为表现。
RL 微调才是 Cloudflare 更大的押注
这些模型吸引了关注,但 Cloudflare 更大的目标,是掌控从工作流数据到定制决策模型的完整路径。
通用决策模型面临一个不可避免的限制。公开模型不了解某一家公司的审批规则、滥用模式、客户类别或运营例外情况。
零售商和安全服务商可能以不同方式使用相同的词语。在一个组织中看似紧急的请求,在另一个组织中可能只是例行事务。即使经过良好校准的公开概率,在这种分布发生变化后也可能变得不可靠。
Cloudflare 给出的答案是面向 Clef 的强化学习服务。初始版本将客户与前置部署工程团队配对。Cloudflare 计划利用这些合作项目开发自助式平台。
这一差异值得关注。模型现已可用,但完整的自动化训练产品尚未成为成熟的自助式服务。Cloudflare 将其中若干部分描述为仍在开发中。
拟议系统连接了该公司已运营的服务。AI Gateway 捕获请求和响应,使客户能够基于真实流量构建工作负载数据集。
Workers AI 针对基础模型生成 rollout。在强化学习中,rollout 是一系列可依据奖励或预期结果进行评分的模型行为。
Cloudflare Containers 提供隔离环境,用于重放操作并计算这些分数。名为 Trainer 的新组件会更新模型权重。
Workers AI 和 Bring Your Own Model 则构成预期的部署目标。Cloudflare 希望客户能够在不离开其平台的情况下,捕获数据、训练专用模型并将其重新投入生产环境。
因此,完整的 RL 服务设计连接了可观测性、计算、隔离执行、权重更新和推理服务。Clef 是这一技术栈的首个聚焦工作负载。
Cloudflare 将其训练目标称为“面向校准决策的强化学习”(Reinforcement Learning for Calibrated Decisions,RLCD)。TypeSafe 也用同一名称描述 Jev 的训练方法,这使双方的竞争关系更加直接。
Cloudflare 表示,当预测结果接近正确的有序选项时,其版本会给予部分奖励。例如,目标为 critical 时,预测为 major 的严重性评级所获奖励可能高于模型选择 no impact 的情况。
训练过程还会奖励完全正确的结构化记录。一项参考惩罚机制旨在限制模型行为过度偏离原始模型。
在进入 RL 阶段前,Cloudflare 使用标签平滑交叉熵和 Brier loss 训练模型。Brier loss 衡量预测概率与观测结果之间的差距,因此与校准密切相关。
该公司在优化秩为 256 的低秩适配器和路由头时,冻结了主要的 Qwen 主干模型。低秩适配通过改变一组较小的新增参数,而非更新模型的全部权重。
Cloudflare 还使用了合成数据,并对提示词措辞、字段顺序和 schema 结构进行变化。这些排列组合旨在避免模型依赖某一种固定的请求布局。
这一方法在技术上是自洽的,但公开证据仍不完整。Cloudflare 尚未发布独立审计,说明其报告的置信度在微调后与现实世界正确性的对应程度。
该服务也带来了数据治理问题。AI Gateway 可以捕获使训练变得有用的精确流量,但这些请求可能包含机密文档、客户消息、安全事件或个人信息。
Cloudflare 表示,其不会读取、存储或使用普通 Clef 请求和响应进行训练。选择加入微调的客户必然需要不同的数据路径,因为他们的示例必须成为训练材料。
组织需要针对同意、保留、访问、删除和区域处理建立精确控制。它们还必须区分可接受的训练示例与绝不应被重放的事件。
Cloudflare 的网络业务历史为其带来了相关经验。该公司称,其在滥用、机器人、支持和威胁情报等领域积累了超过 15 年的标注决策数据。
这些内部数据不会自动迁移至客户工作负载。不过,它们确实提供了让 Cloudflare 测试收集标签和重新部署专用模型等运营机制的环境。
该公司将信任与安全审核、支持工单分流和良性机器人分类列为内部候选场景。它们是强有力的决策模型用例,因为都涉及针对已知类别的重复判断。
微调会带来取舍。模型可以在某一领域获得更高准确率,同时损失部分通用性能。当部署边界明确且经过衡量时,这种交换是可以接受的。
当专用模型悄然获得新职责时,情况就会变得危险。机器人分类器不应仅因两项任务都会返回概率,就变成访问控制的决策权威。
团队需要版本化数据集、评估关卡和回滚计划。可搜索的技术知识库可帮助将每个模型版本关联到其策略、测试和已知限制。
因此,RL 平台才是此次公告中影响更深远的部分。如果 Cloudflare 能让专用训练变得可重复,Clef 将成为持续基础设施合作关系的切入点。
如果该服务仍高度依赖咨询,开放模型获得的采用可能会多于训练平台。未来几个月应会揭示开发者最看重此次发布的哪一面。
基准测试未能回答校准与控制问题
快速的类型化输出能减少格式错误,但不能证明代理应信任所选操作。
决策模型无法创造出所提供 schema 之外的值。这一特性可以防止格式错误的 JSON、意料之外的标签,以及代码只需要简短回答时出现冗长解释。
但它无法阻止模型选择错误的允许答案。结构完全正确的错误,仍然是错误。
当置信度控制自动化时,这一区别至关重要。假设某个工作流会执行置信度高于 90% 的操作,并将其他所有情况升级处理。只有当类似预测约十次中有九次被证明正确时,这一阈值才有意义。
总体准确率并不能证明这种关系。一个模型可能取得很强的平均表现,却在罕见但后果严重的案例上保持过度自信。
已发布的 Clef 评估比较了多项任务中的质量和延迟。它们为实验提供了有用证据,但并未揭示每个模型在各类客户领域中的完整校准曲线。
Cloudflare 自己的结果也显示出差异。Clef-flash 在部分任务中击败了更大的模型,而 Jev 在代理轨迹可观测性方面领先。这些差异表明,模型大小不会产生普适的排序。
私有工作流会引入更多变化。行业术语、多语言消息、模糊类别和对抗性输入,都可能使性能偏离公开结果。
Schema 设计还会增加另一类错误来源。如果两个选项重叠,模型可能在它们之间分配概率。如果正确选项不存在,它仍必须将概率分配给其余选项。
明确的弃权路径会有所帮助。开发者可以加入 unknown、insufficient context 或 require human review 等选项,然后测试模型是否恰当地使用它们。
周边应用还应评估操作的严重程度。读取公开网页不需要与删除记录或发送私密信息相同的置信度阈值。
确定性控制仍然必不可少。权限、支出限额、目的地限制和不可逆操作,不应仅依赖某个学习得来的概率。
决策模型最适合作为策略系统中的信号。它们可以解读混乱输入并路由不确定性,而代码负责执行不可逾越的边界。
提示词注入同样仍然相关。代理可能遇到试图操纵任何读取它的模型的文档。Clef 的有界输出限制了响应形式,但恶意内容仍可能影响哪个选项获得最高分。
可信指令、不可信内容、拟议操作和工具元数据应保持结构性分离。高影响决策需要包含对抗性示例的评估。
多模态输入同时扩大了实用性和攻击面。Clef 可以分类截图、文档和视频,但视觉指令中同样可能包含误导性或隐藏内容。
Cloudflare 的 64,000 token 上下文窗口支持更大的状态。更长的输入能够提供必要证据,却也可能加入无关材料,使模型偏离决定性事实。
开放发布有助于开发者调查这些问题。他们可以检查实现、创建私有评估,并将本地结果与托管推理进行比较。
开放权重并不意味着完整的训练透明度。Cloudflare 描述了其目标和合成数据策略,但尚未发布重现每种行为所需的完整训练数据集。
自托管也会转移责任。组织必须保护模型服务器、选择硬件、监控延迟、管理更新,并验证量化变体。
托管式 Workers AI 减轻了这类运维负担。但它要求客户信任 Cloudflare 的推理环境和可用性保障。
无论哪种选择,都不能免除评估需求。团队应记录输入状态、schema、模型版本、概率、所选操作、升级路径和最终结果。
这些日志支持漂移检测。部署时表现良好的模型,可能随着产品、策略或用户行为的变化而变得不那么可靠。
微调可以纠正漂移,但也可能过拟合近期示例。评估集应与训练数据分离,并包含常规流量不足以代表的罕见失败案例。
因此,Cloudflare 在基准测试中的领先地位只是一个起始假设。该公司已经表明 Clef 值得与 Jev 比较,但尚未证明它已准备好控制每一项代理操作。
最安全的早期部署涉及可逆选择。工单路由、文档分流、相关性筛选和模型选择能够提供可衡量结果,同时不会赋予分类器不可逆的权力。
Cloudflare Clef 接下来值得关注什么
三个信号将表明 Clef 会成为持久的代理基础设施,还是又一次短暂的模型发布。
第一个信号是独立的基准复现。研究人员和开发者需要在未见数据、一致硬件和完全相同的请求 schema 上重新运行这些比较。
这项工作应衡量的不仅是平均准确率。对于运营使用而言,校准误差、错误批准、升级率、多语言性能和对抗性输入下的行为更为重要。
稳定的结果将加强 Cloudflare 的主张,即 Clef 在质量与延迟之间提供了更好的平衡。若在公司发布的测试套件之外出现大幅下降,则会支持 Jev 的观点:训练质量仍是更难获得的优势。
第二个信号,是从前置部署支持转向自助式 RL 平台。Cloudflare 需要证明,客户能够创建数据集、定义奖励、安全训练、评估版本并重新部署,而无需经历漫长的咨询项目。
一个可信的平台应公开数据沿袭、评估关卡、隐私控制、回滚支持和模型版本历史。当最终概率会控制业务操作时,训练不能被视为一个单一按钮。
客户案例研究将很重要,但应包含可衡量的结果。有效证据应比较微调前后的错误率、延迟、升级处理量和整体表现。
第三个信号是竞争对手的回应。TypeSafe 可以通过更有力的校准证据、更快的服务速度、更完善的多模态支持或私有部署选项来捍卫 Jev。
OpenAI 和 AWS 也能缩小 Cloudflare 的机会窗口。即使另一种模型在孤立基准测试中表现更佳,直接集成到大型 Agent 平台的决策服务仍可能吸引开发者。
Cloudflare 的优势在于垂直整合。AI Gateway 可以观察工作流,Containers 可以支持受控发布,Trainer 可以更新权重,Workers AI 可以提供结果服务。
同样的整合也带来了集中化风险。客户可能依赖单一供应商完成流量采集、训练、部署,以及管理 Agent 运行时决策。
开放模型提供了一条退出路径,但前提是组织能够有效运营它们。因此,微调权重的实际可移植性,将与基础版本采用 Apache 2.0 许可证同等重要。
开发者不必等待最终胜者出现。他们可以选择一项重复发生、可逆的决策,并在相同的私有样例上测试 Clef、Clef-flash、Jev、传统分类器和小型生成式模型。
一项有价值的试点应包含明确的升级处理选项以及更强大的后备模型。团队应测试类别变化、上下文缺失、误导性输入,以及所提供答案均不适用的情况。
Cloudflare Clef 决策模型让这类实验更容易开展,因为托管路径和开放权重路径均已可用。其更大的意义取决于 Cloudflare 能否将有前景的概率转化为值得信赖的运营成果。
在你的 Agent 工作流中,哪一项决策发生得足够频繁,值得采用专门模型?在让这一概率触发行动之前,你又需要哪些证据?



