top of page

Flower Labs 以 Endeavor 1.0 挑战 Anthropic、Google 和 OpenAI

9月2日
讀畢需時 15 分鐘

Flower Labs 于 9 月 1 日发布 Endeavor 1.0,声称该模型在部分指标上可匹敌 Anthropic、Google 和 OpenAI 的替代方案,同时可运行在由客户控制的基础设施上。这一组合——具备竞争力的性能加上私有部署——让此次发布的分量超过了又一次模型基准测试公告。

这家从剑桥大学孵化出来的公司正进入一个由 Anthropic、Google 和 OpenAI 参与、并由集中式云服务塑造的市场。客户通常通过由提供商控制的 API 使用领先的专有模型。Flower 希望企业先使用托管服务,随后将部分工作负载或整套部署迁移到自有环境中。

这一说法在 Flower 自身的评估流程之外仍未得到验证。Endeavor 最初仅向部分组织开放,其公开结果来自公司自行选择并报告的测试。因此,核心问题并非 Flower 是否已经击败了最大的实验室,而是本地控制能否成为一项重要的采购优势,同时不要求客户接受较弱的智能能力。

Endeavor 1.0 将前沿能力主张与私有部署结合

Flower Labs 将对模型的控制权作为模型能力的一部分出售,而非将其视为独立的基础设施功能。

Endeavor 1.0 是一个通用系统,面向推理、编程、工具使用和长时间运行的智能体任务。Flower 表示,客户既可通过托管服务使用它,也可将其部署在自己控制的基础设施内。

第二种选择使此次发布区别于标准的专有模型使用关系。使用封闭 API 的公司,会将请求发送至由提供商控制的基础设施。提供商负责管理模型、容量、升级和访问条件。

私有部署改变了这一关系。客户可以决定工作负载在哪里运行、哪些数据会跨越系统边界,以及模型版本何时变更。这些决定对于医院、银行、政府机构及其他处理受监管信息的组织尤为重要。

根据 Flower 的模型公告,Endeavor 在 GPQA 上得分 92.0、在 HumanEval 上得分 98.2、在 AIME 2026 上得分 99.9、在 IFEval 上得分 94.1。这些评估分别测试科学推理、代码生成、数学能力和指令遵循能力。

Flower 的对比显示,Endeavor 在 HumanEval 上领先于所有列出的竞争对手。在 AIME 2026 上,它与 OpenAI 的 GPT-5.6 Sol 及 Anthropic 的 Claude Fable 5 并列。

该模型在 GPQA 和 IFEval 上落后于 GPT-5.6 Sol。在 GPQA 上也落后于 Claude Fable 5,但在 HumanEval 和 IFEval 上超过后者。

与 Moonshot AI 的 Kimi K3 相比,Endeavor 在四项公开测试中的三项领先。Flower 还称,Endeavor 在四项测试中均领先 Nvidia 的 Nemotron 3 Ultra。

这些结果所支持的结论,比 Flower 标题中的定位更为有限。它们显示,在 Flower 所报告的配置下,Endeavor 具备竞争力的性能;但并不能证明其在所有企业任务、部署环境、延迟目标或安全要求下都拥有同等表现。

Endeavor 也是预览版,而非不受限制的公开发布。Flower 正在为部分组织接入服务,同时扩展可用算力。这限制了独立评估者复现结果的速度。

不过,这一预览版仍为买家提供了可供考察的具体产品。Flower 提供许可证、私有部署支持,以及面向不希望立即承担运营责任客户的托管路径。

这种结构让组织可以先通过 API 开始,同时保留退出路径。如果某项工作负载变得敏感或具有战略重要性,客户可以将其迁移至受控基础设施。

这种区别对 AI 智能体尤其重要。智能体是利用模型规划并执行多个相互关联行动的软件。这些行动可能涉及内部文档、源代码、客户记录和运营系统。

一次聊天机器人请求只会产生短暂的数据交换。长时间运行的智能体则可能跨越文件、应用程序和决策累积上下文。更大的运营范围使部署控制更具价值。

因此,Flower 挑战的不只是模型质量。它还在挑战一种假设:前沿智能能力必须依附于由前沿实验室拥有的基础设施。

Anthropic、Google 和 OpenAI 的模式为何面临压力

Endeavor 瞄准了企业采用中隐藏的依赖关系:公司围绕自己无法控制的模型构建了有价值的工作流。

OpenAI、Anthropic 和 Google 让集中式访问颇具吸引力。它们的服务免去了托管大型模型、管理加速器和运行复杂推理系统的负担。

这种便利也带来结构性取舍。客户在模型可用性、版本稳定性、使用政策、地域覆盖和安全控制方面依赖提供商。这些领域中的任何变化,都可能影响下游应用。

更换提供商也并非只是更改一个 API 地址。生产系统会积累针对特定模型行为定制的提示词、评估、路由逻辑、安全规则和工具集成。

模型升级可能提升总体性能,却削弱某个特定工作流。团队随后需要进行回归测试、调整提示词并增加新的防护措施。即使模型仍归提供商所有,这些工作依然由客户承担。

Flower 认为,稳定且可私有部署的模型,可将其中一部分集成工作转化为客户自有的能力。客户能够构建智能体、评估、数据管道和改进闭环,而不必将一切绑定到单一远程端点。

这一论点并不意味着托管 API 没有吸引力。许多组织仍会选择它们,因为内部托管需要基础设施、安全专业知识和模型运营能力。

压力主要落在服务于敏感数据客户或有严格连续性要求客户的提供商身上。这些客户日益希望看到证据,证明 AI 系统能够在自身治理框架下持续可用。

这篇发布报道将 NHS 和 JPMorgan 列为 Flower 的客户。该公司尚未公开说明这些组织将运行哪些 Endeavor 工作负载。

医疗行业清楚地说明了部署问题。患者记录可以留在医院环境内,而计算移动至数据所在之处。这种方法减少了将敏感记录集中到单一外部地点的需求。

金融机构同样面临涉及机密文件、客户信息、交易系统和监管记录的担忧。私有运营的模型可以支持更严格的数据边界,尽管仅靠托管本身并不能保证合规。

竞争问题也延伸至 Google,尽管 Flower 公开的 Endeavor 表格重点强调 OpenAI 和 Anthropic 的模型。Google 将专有模型与云基础设施、企业身份系统和办公软件结合起来。

这种整合为 Google 带来重要优势,也进一步强化了 Flower 正在质疑的集中式平台模式。Endeavor 为买家提供了另一条路径:模型访问与对单一云所有者的永久依赖相分离。

由此形成的 Anthropic、Google 和 OpenAI 之争,并不是一场单纯追逐最高分的竞赛,而是一场围绕谁控制智能能力周边运营层的竞争。

对于企业买家而言,获得更多控制权并不要求拥有模型。实际要求是可强制执行的部署选择、稳定访问,以及足够的文档以便安全运行系统。

Flower 仍须证明,客户无需承担不合理的复杂性便能实现这些益处。如果私有部署变成昂贵的工程项目,API 的便利性仍将难以被取代。

尽管如此,这次发布改变了谈判格局。买家如今可以询问,领先模型是否支持本地运行、客户管理的升级和长期可移植性。即使最终未选择 Endeavor,这些问题也会给每一家提供商带来压力。

Flower 构建的是一个系统,而非从零训练模型

Endeavor 的主要技术押注是:模型集成和推理软件的重要性,可以不亚于训练一个庞大的基础模型。

Flower 并未将 Endeavor 描述为从空白起点训练的全新模型。它将成熟开放权重模型的能力、Flower 的专有技术及其自身模型项目结合起来。

开放权重模型提供可下载的参数,开发者可以自行运行和适配。它们不同于封闭服务:后者由提供商保留模型,并通过接口提供访问。

Flower 表示,Endeavor 利用开放基础模型提供广泛的语言知识、公开信息和常见编程模式;随后再加入内部开发的专门能力、后训练、集成和推理行为。

该公司还融合了其早期 70 亿参数模型 Lizzy 的知识和推理能力;Lizzy 专注于英国应用。Endeavor 在该模型发布四个月后推出。

这种系统级策略减少了重建每项能力的需求。Flower 可以在既有开放成果的基础上发展,再将资源集中于编排、推理时推理、验证和企业部署。

推理时推理是指模型在回答请求时进行额外计算。系统可以将工作拆分为多个步骤、使用工具、检查中间结果,并修正未成功的方法。

这些外围机制会显著影响实际性能。相同的底层模型权重,搭配不同的提示词、工具、上下文管理和验证循环后,可能产生不同结果。

因此,Endeavor 是作为一个完整系统参与竞争。Flower 表示,它通过多种编程和智能体 harness 测试模型;这些 harness 是将模型与工具及执行环境连接起来的软件层。

这种设计使直接比较变得复杂。一项基准结果可能反映底层权重、推理预算、harness、可用工具,或四者的共同作用。

在将分数视为可互换之前,客户需要了解这些配置细节。在现实硬件限制下,本地部署的 Endeavor 实例必须能够复现托管服务所宣传的行为。

Flower 的历史为这种方法提供了合理基础。其最初的联邦学习框架旨在让模型跨分布式设备训练,而无需将所有源数据收集到单一云端存储库中。

联邦学习将计算推向分布式数据,并返回经过选择的更新而非原始记录。这种方法可减少集中式数据移动,但也会带来协调、安全和统计方面的挑战。

该研究项目于 2020 年在剑桥启动。Daniel Beutel、Taner Topal、Nicholas Lane 及其合作者报告了涉及多达 1,500 万个模拟客户端的实验。

Flower Labs 随后将这一研究方向发展为开源框架和企业平台。该公司称,其社区包括数千名开发者和超过 1,000 个开源项目。

这一背景很重要,因为私有 AI 不只是模型封装的问题。客户还需要部署软件、分布式计算、监控、评估,以及围绕不断变化的数据集建立控制机制。

Flower 早期的工作解决了这类运营问题的一部分。Endeavor 则为其已开发的基础设施增添了一个具备竞争力的通用模型。

这一战略更像系统工程,而不是试图在资金投入上直接与最大的实验室竞争。Flower 正将开放组件、专有改进、部署工具和评估信号整合为一款产品。

即使 Endeavor 从未登顶所有公开排行榜,这种模式依然可能具备商业效力。企业通常根据完整的运营特征来选择系统,其中包括可靠性、治理和集成成本。

不过,系统组合也带来了自身的问题。客户需要明确组件许可证、升级权利、安全责任、模型来源,以及 Flower 支持服务的边界。

他们还必须了解哪些能力能够在离线状态下持续可用。如果某项部署在不知不觉中依赖外部服务,其独立性就会低于“本地部署”这一标签所暗示的程度。

这一机制具备足够的可信度,值得测试。它能否成功,如今取决于 Flower 是否能够让这套组合系统在自身环境之外同样具备可预测性、可支持性和可复制性。

基准测试结果需要独立验证

四项由厂商自行报告的分数,无法证明 Endeavor 能在各类生产工作负载中匹敌前沿模型。

Flower 公布的表格提供了有价值的证据,但这些证据仍由提出主张的公司掌控。独立实验室尚未报告广泛的 Endeavor 测试结果。

该比较也只涵盖四项评测。GPQA 测试高难度科学问题,HumanEval 衡量代码生成能力,AIME 聚焦数学问题,IFEval 则衡量对可验证指令的遵循程度。

这些基准测试共同覆盖了重要能力,但并未衡量决定企业系统能否可靠运行的所有因素。

它们几乎无法揭示模型在专业领域的幻觉问题、网络安全行为、多语言表现、文档检索、延迟、吞吐量、能耗或长上下文一致性。

它们也无法证明 Endeavor 在持续数小时的智能体任务中如何处理工具故障。这一点很重要,因为 Flower 明确将该模型定位于长周期工作。

随着模型接近能力上限,公开基准测试可能变得越来越缺乏区分度。Endeavor 在 AIME 2026 上取得的 99.9 分便说明了这个问题。三款模型获得了相同的报告分数,几乎没有拉开差距。

HumanEval 也有类似局限。该基准使用一组预先定义的编程题目,而真实的软件工作涉及代码库、依赖项、模糊需求、测试和评审。

Flower 通过 FlowerBench 承认了这一差距的一部分。该公司将其描述为一种评估系统,用于在客户环境中执行专有企业任务。

参与组织可以贡献工作负载,而无需转移底层私有数据。Flower 接收经过脱敏处理的结果,以指导模型开发和评估设计。

这种方法解决了一个真实的企业问题。公司无法将机密任务和数据集上传到每一个公开基准测试服务。

但它也带来了验证问题。外部研究人员无法检查隐藏任务、确认其代表性,或复现所声称的改进。

这些证据对参与的客户仍然有用,因为他们可以直接测试自身工作。但在 Flower 公布可复现的方法,或允许受信任的独立审计之前,它对更广泛市场的参考价值仍然有限。

访问限制又增加了一层不确定性。获选参与预览的用户可能获得密集支持,而这未必代表最终面向大众的产品。

Flower 表示,正在扩充算力以支持更广泛的发布。这一披露很重要,因为有限的容量可能影响客户接入、延迟、可用性以及可同时服务的客户数量。

私有部署并不会消除算力需求。它只是将一部分运营责任转移给客户和 Flower 的支持团队。

因此,评估 Endeavor 的企业应当进行针对自身工作负载的测试。通用基准的领先表现应被视为评估邀请,而不是采购结论。

测试集应包括常见任务、棘手边缘案例、对抗性输入和完整的智能体工作流,并衡量错误、恢复行为、响应时间和运营开销。

团队还应比较托管版本与私有版本。当硬件、量化、推理设置或工具访问存在差异时,相同的模型名称并不保证性能等效。

量化会降低模型参数的数值精度,以减少硬件需求。它可以提升部署效率,但也可能改变性能。

安全审查必须超越数据所在地这一层面。本地系统仍会面临提示注入、过度权限、不安全的工具调用、遭入侵的依赖项以及未经授权的模型访问等风险。

治理团队应审查日志记录、保留策略、身份控制、更新流程和事件响应。当这些运营保障薄弱时,私有服务器依然可能不安全。

因此,Flower 的基准测试主张既非毫无意义,也非决定性结论。它提出了一个可验证的命题:欧洲系统可以在提供实质不同部署权利的同时,接近领先专有模型。

下一阶段取决于独立评估和生产试验。在这些证据出现之前,“具备竞争力”仍应被视为 Flower 的表述,而非既定的市场事实。

主权 AI 正成为采购问题

Endeavor 将主权 AI 从政治口号转化为关于部署方式、数据边界和供应商依赖的具体选择。

主权 AI 通常指在一个国家或组织自主选择的法律和技术控制框架下开发或运营 AI 的能力。该术语可以指基础设施、数据、模型、人才,或这四者的组合。

Flower 聚焦于运营主权。客户可以通过 Flower 运行 Endeavor,将选定工作负载置于受控基础设施中,或逐步转向更大规模的私有部署。

Flower 联合创始人兼首席科学家 Nicholas Lane 以异常直白的措辞概括了公司的立场。他告诉 The Times:“欧洲不应永远向少数几家美国公司租用自己的智能。”

这句话比任何基准表格都更准确地指出了主要对手。Flower 所挑战的是对集中式美国模型提供商的永久依赖,而不只是 Anthropic 或 OpenAI 的某一次发布。

欧洲政府有多种理由考察替代方案。公共机构处理敏感记录、国家安全信息,以及受区域数据法规约束的工作负载。

它们也担心经济依赖。当核心应用依赖外国模型访问时,知识产权和运营知识可能会围绕外部平台积累。

本地部署并不会自动创造国家层面的技术独立。Endeavor 融入了成熟的开放权重能力,客户仍需要加速器、系统软件和专业知识。

因此,主权是一个连续光谱。一个国家可以控制数据位置,同时依赖进口硬件;一个组织可以托管模型,同时依赖供应商提供更新和支持。

Endeavor 涵盖了若干层面,但并非所有层面。Flower 提供对部署和升级时机的控制,但采取的是许可模式,而非转让不受限制的所有权。

这一差异在采购过程中值得关注。买方应询问:如果 Flower 改变其产品、支持条款或商业战略,会发生什么?

他们还应确定组织能否独立继续运行已获许可的版本。真正的可移植性需要技术文档、兼容的基础设施和合同权利。

Flower 的融资为应对这一挑战提供了资源,但与最大的 AI 实验室相比仍相对有限。该公司在 2024 年 2 月宣布完成 2,000 万美元 A 轮融资,此前还完成过一轮 360 万美元融资。

Felicis 领投该 A 轮融资。其他投资者包括 First Spark Ventures、Factorial Capital、Betaworks Ventures、Y Combinator、Pioneer Fund 和 Mozilla Ventures。

该公司表示,这轮融资将支持去中心化和联邦式 AI 的采用。Endeavor 现在为这一战略提供了一个面向广泛企业工作的模型。

Flower 无需匹配 Anthropic、Google 或 OpenAI 的总研发投入,也能建立可行的业务。它需要的只是足够的性能,让部署控制权对特定买方成为决定性因素。

这是一个更狭窄的市场,但可能很有价值。政府、医疗保健、金融服务、工业运营和研究机构都管理着无法自由流动的数据。

一个实际部署场景可能是内部编程智能体审查机密代码库;另一个则可能是在安全研究环境中分析临床文件。

这些工作负载天然适合与私有知识系统结合。组织还需要可靠的 AI knowledge base,以控制模型能够检索哪些信息。

价值并不只来自本地托管,而是来自受治理的数据、经过测试的模型行为、受限的权限和可追责的人工审查的组合。

这使得采购证据比国家品牌叙事更重要。买方需要其工作负载上的实测性能、清晰的部署要求和可执行的权利保障。

如果 Flower 能提供这些要素,主权 AI 就会成为一个实用的产品类别。如果它主要依赖爱国主义定位,成熟的云服务商将保留其优势。

三个信号将决定 Endeavor 是否重要

独立结果、真实的私有部署和更广泛的可用性,将决定 Endeavor 是成为替代方案,还是停留在一个有趣的预览阶段。

第一个信号是可复现的第三方评估。研究人员需要在有文档记录的设置下访问 Endeavor,包括其推理预算、工具和模型配置。

独立测试应超越 Flower 已公布的四项基准,覆盖长时间运行的智能体、代码库级编程、多语言工作、幻觉率、安全性,以及受限硬件下的性能。

如果测试结果与 Flower 报告的分数相符,将强化其前沿模型主张。若存在较大差距,则可能表明发布表格反映的是有利配置或有限任务。

第二个信号是来自生产部署的证据。Flower 需要愿意说明其运行内容、选择 Endeavor 的原因,以及私有托管提供哪些控制能力的客户。

案例研究应包含可量化结果,而非笼统背书。有效证据应涵盖任务完成率、错误率、部署时间、可用性以及运营所需人员。

最有力的例子会比较 Flower 托管部署与客户自主管理部署。这将显示可移植性是否能够在不显著损失性能或可靠性的情况下实现。

企业买方还应关注哪些工作负载最先迁移。敏感代码开发、受监管文档分析和内部研究,比广泛的自主决策更适合作为早期应用。

一次成功的 NHS 部署将具有特别重要的意义,因为医疗行业同时涉及敏感数据和严格的可靠性要求。不过,现有报道尚未证实 NHS 正在使用 Endeavor 本身。

第三个信号是大规模访问能力。Flower 目前仅向特定组织开放 Endeavor,同时持续增加算力。

更广泛的发布将让更多开发者、安全团队和评估人员测试该系统,也将揭示 Flower 能否同时支持多家需求严苛的客户。

若继续维持受限访问,将削弱其与广泛可用服务之间的比较。若产能仍不确定,买家就无法将一款模型视为可靠的替代方案。

竞争对手的应对也会影响这三个信号。Anthropic、Google 和 OpenAI 可以通过扩大私有化、区域化或由客户自主控制的部署选项,削弱 Flower 的差异化优势。

开放权重开发者则可能从另一方向施加压力。Meta、Mistral、Moonshot AI 和 Nvidia 的模型,已为组织提供多条实现本地运行的路径。

Flower 必须占据中间地带。它需要具备专有模型级别的易用性,同时提供比封闭 API 更强的控制权,以及比原始开放权重模型更多的支持。

这也解释了 Endeavor 为何值得关注。该公司并未要求企业将智能能力与主权视为彼此割裂的优先事项来做选择。

其主张是,企业可以通过同一套系统同时获得两者。基准测试表提供了智能能力方面的论据,而部署许可则提供了主权方面的论据。

但目前,这两项论据都尚不完整。分数仍由厂商自行报告,访问仍然受限,公开的生产环境证据也依然有限。

不过,对 Anthropic、Google 和 OpenAI 格局的挑战已足够具体,值得进一步调查。Flower 已为该模型命名、公布了对比结果,并描述了两条部署路径。

开发者应关注能否出现复现其宣称能力的独立测试。企业买家则应要求开展针对具体工作负载的试用,并采用完全相同的托管与私有配置。

安全负责人应询问哪些组件仍在外部运行、更新机制如何运作,以及在服务商中断期间,组织是否能够安全地维持运营。

最重要的问题在于实践:当 Endeavor 离开 Flower 的环境、进入客户基础设施后,能否仍保持具有竞争力的表现?

若得到经验证的肯定答案,将增强本地自主控制的前沿 AI 的论据;若答案是否定的,则会印证为何集中式供应商仍主导高要求的模型运营。

目前,Endeavor 1.0 应被视为一项严肃、可检验的主张,而非已获确认的胜利。下一次独立评估或有据可查的部署案例,其重要性将超过又一份由公司撰写的排行榜。

 
 

免费开始

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

你的 AI 工作伙伴

remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page