Snorkel AI 融资额达 3.5 亿美元,数据实验室模式迎来真正考验
Snorkel AI 于 9 月 22 日宣布融资额达到 3.5 亿美元,在据称实现年增长 18 倍后,公司估值达到 35 亿美元。这轮 E 轮融资使 Snorkel 成为日益拥挤的训练数据、评估与模拟环境市场中的重要竞争者,也为其研究驱动的方法提出了严苛的业绩要求。
Snorkel 表示,其年化收入运行率已超过 3.75 亿美元。这一数字仍是公司自行披露的指标,而非经审计的年度营收。不过,快速增长与估值较此前接近三倍的组合,表明投资者将 AI 数据视为一个具有持久性的基础设施类别。
时机至关重要。Meta 对 Scale AI 的投资在 2025 年扰乱了数据供应链中的合作关系。前沿实验室也开始要求更复杂的任务、更丰富的环境以及更专业的专家。Snorkel 正押注于研究、软件和审慎管理的人类专业能力,能够取代仅仅将更多标注工作分配给更大承包商群体的旧模式。
Snorkel AI 融资轮支持一种新型数据供应商
E 轮融资将支持 Snorkel 从销售数据软件,转向为先进 AI 系统交付完整的数据产品。
Insight Partners 和 S32 共同领投本轮,现有投资者 Addition 大幅参与。Third Point、March Capital、Blumberg Capital、Allegis Capital、Standard VC、Frontline Ventures、Lightspeed Venture Partners、Greylock、GV、Prosperity7 Ventures、Wells Fargo、Walden Catalyst Ventures 和 Factory 也参与了本轮融资。
根据 Snorkel 的 E 轮融资公告,该公司计划扩展其所谓的智能体数据工厂。该术语指一种将软件智能体、研究方法、领域专家和运营工作流结合起来,以产出训练和评估数据的系统。
该公司表示,新资金将提高这座工厂的产能。它还计划投资垂直领域和企业级 AI,并将技术扩展至更多数据类型和应用领域。
这比传统标注的使命范围更广。基础数据标注是为样本分配已知类别,例如标记一张图片中是否有行人。前沿模型开发则需要正确答案更难界定、评估和复现的任务。
例如,编程智能体必须跨代码仓库、命令行工具、配置文件和依赖项开展工作。法律智能体可能需要查找权威依据、区分不同司法辖区,并给出可追溯的答案。保险系统则必须在不虚构事实的前提下,对保单和证据进行推理。
这些任务所需的不只是孤立的标签。供应商必须设计任务、构建执行环境、识别失效模式、建立评分规则,并判断成功是否反映了真正的能力。
Snorkel 将其方法追溯至一个以数据编程为核心的斯坦福研究项目。该方法允许领域专家编写标注函数,即能够大规模生成带噪声标签的规则或启发式方法。随后,统计过程会估计这些函数的可靠性,并协调它们之间的冲突。
最初的 Snorkel 研究论文 表示,这种方法可在多种应用中减少对人工标注数据集的依赖。如今的前沿数据业务规模大得多,但其基础论点依然清晰:专业知识应被编码为可重复的系统,而不是逐个样本地应用。
Snorkel 最初通过 Snorkel Flow 将这一理念商业化,这是一个企业可用于内部开发数据和模型的平台。随后,该公司向数据即服务拓展,即客户获得完成的数据集、基准测试或环境。
这种区别会影响收入和运营。软件平台要求客户学习系统并运行自己的项目;托管数据服务则承担产出结果的责任,可能带来更大的合同,但也伴随更多交付工作。
Snorkel 表示,其数据即服务产品在融资公告发布前近一年便已推出。公司将其 18 倍增长和 3.75 亿美元年化收入运行率归功于这项服务。这些说法使服务转型成为新估值背后的核心事实。
本轮融资紧随 2025 年 5 月宣布的 1 亿美元 D 轮融资,当时公司估值为 13 亿美元。因此,新融资增加了 3.5 亿美元,并在大约 16 个月内将披露估值提高了 22 亿美元。
这种快速增长并不能证明该模式具有持久性。它说明投资者预计当前需求将持续,也表明 Snorkel 已获得足够资本,可在市场格局稳定前建设产能。
为什么先进模型需要更困难的数据
AI 实验室不再只购买带标签的样本。它们购买的是复杂问题、真实环境,以及模型是否真正解决这些问题的可信衡量标准。
早期机器学习系统通常会在开发人员添加更多带有明确标签的样本后得到提升。现代生成式模型在预训练期间已经吸收了海量文本、代码、图像和视频。其剩余弱点往往较为狭窄、依赖上下文且难以衡量。
模型可以写出看似可信的法律文本,却引用并不存在的案例。编程智能体可以生成看起来正确的补丁,却破坏某项依赖。客服智能体可以解决常规请求,却可能错误处理不常见的政策例外。
为这些失效情况生产有用数据,需要理解相关领域的人,也需要一个让模型能够行动、获得反馈并承受后果的环境。
这正是强化学习环境变得重要的原因。强化学习通过与模型行动或输出相关的反馈来训练模型。对于智能体而言,环境可能包括文件、工具、模拟用户、数据库或软件服务。
奖励必须反映有意义的成功。薄弱的奖励机制可能让模型满足表面检查,却遗漏真正任务。泄露答案的环境可能在未提升可迁移能力的情况下夸大结果。
评估带来了相关挑战。公开基准有助于研究人员比较模型,但反复接触会削弱其价值。模型可能在训练期间吸收基准问题,开发者也可能直接针对熟悉的测试进行优化。
一项经过同行评审的污染调查 描述了训练数据与基准数据重叠如何导致不可靠的评估。当基准分数影响产品宣传、采购决策和研究优先级时,这个问题会变得更严重。
Snorkel 的应对方式是构建和支持用于智能体编程、法律工作、保险及其他专业场景的评估体系。其公开编程基准包含跨四个难度等级的 100 项多步骤任务,更大的任务集合则向客户提供。
这一基准说明了商业机会所在。实验室所需的不只是另一批源代码,而是能够暴露智能体失效位置的任务、可以安全运行尝试的沙盒,以及能区分可用解决方案与看似有说服力的错误的评分器。
Snorkel 还表示将继续支持开放基准的开发。开放基准可以扩大审查范围,让外部研究人员检查任务设计。但如果其答案在训练管线中流传,随着时间推移也可能变得不再有用。
因此,该公司的业务处于一个不可避免的循环之中。新模型需要新测试;一旦这些测试变得熟悉,研究人员就需要更新任务;评估中发现的失效随后又成为新训练数据的目标。
这一循环能够支撑持续性需求,尤其是在 AI 进入受监管或高价值工作领域时。但它也可能成本高昂,因为每个专业领域都需要新的专业知识、工具和质量控制。
2025 年 AI Index 报告 指出,随着网站限制 AI 抓取,数据使用限制有所增加。报告还强调,围绕合成数据、许可、透明度和可复现性的问题仍未得到解决。
合成数据是由模型生成而非直接从现实世界收集的信息。它可以扩充数据集、覆盖罕见案例并降低部分采集成本。然而,它也可能复制生成模型的错误,并缩窄可用于学习的变化范围。
当正确性取决于事实、专业判断或现实世界程序时,人类专家依然不可或缺。有价值的服务不仅仅是获得这些专家的渠道,而是能够将其判断转化为模型可学习、评估者可检查的数据。
这一转变解释了为何 Snorkel 将自己描述为前沿 AI 数据实验室。这一定位强调实验、测量和研究,同时让公司与传统标注市场的形象保持距离。
然而,这种变化并非只是品牌宣传。如果前沿数据成为经过设计的研究产物,供应商将围绕任务质量、可复现性和可衡量的模型改进展开竞争。人员规模和交付速度仍然重要,但不再能决定竞争结果。
Snorkel 的研究模式迎来 Scale AI 时代
Snorkel 面临的主要竞争,是研究驱动的数据工厂与围绕大规模人力运营建立的行业之间的较量。
Scale AI 通过协调大规模标注运营并围绕其构建工具,成为训练数据领域最知名的公司。Surge AI、Mercor、Turing、Handshake、Invisible Technologies 和其他供应商则形成了不同的专家招募、托管项目、软件和评估服务组合。
竞争边界并不清晰。大多数主要供应商如今都声称同时具备某种技术基础设施和人类专业能力。前沿实验室也会使用多家供应商,而非将每项敏感项目都交给一家公司。
不过,这些战略的起点不同。人力市场将招募、匹配和运营视为核心优势;Snorkel 的历史理念则将程序化数据开发和研究基础设施视为根基。
市场在 Meta 于 2025 年 6 月同意向 Scale AI 投资约 143 亿美元后发生转变。这笔交易让 Meta 获得了 49% 的无投票权股份,而 Scale 创始人 Alexandr Wang 则加入 Meta,领导新的超级智能项目。
这种绑定带来了中立性问题。其他实验室有理由质疑,是否应与一家同直接竞争对手密切关联的供应商分享敏感的训练优先事项。
关于数据市场转变 的报道指出,竞争对手在该交易后看到需求大幅增加。据报道,OpenAI 和 Google 减少了与 Scale 的合作,而其他供应商则争取新释放出来的合同。
这远不只是普通的客户流失。前沿实验室的数据需求可能暴露其模型弱点、即将推出的能力、评估方法和研究方向。与一家在战略上高度一致的供应商分享这些细节,会带来基础采购比较中无法显现的风险。
Snorkel 在 Meta 交易前不久已完成 D 轮融资。随着买家重新评估供应商以及自身所需的数据类型,该公司随后扩展了服务范围。
这一组合创造了有利条件。更多合同变得可供竞争,而推理模型和智能体则提升了对高难度、由专家设计任务的需求。Snorkel 的 Stanford 背景和技术平台,为寻求替代方案的实验室提供了差异化叙事。
3.75 亿美元的年化收入运行率声明表明,Snorkel 抓住了部分机会。然而,这一数字并未披露客户集中度、合同期限、毛利率,或由人工而非可复用软件交付的工作占比。
这些细节至关重要,因为并非所有数据收入都具备软件业务的经济模型。平台以较低的边际成本即可服务另一位客户;而针对专业智能体的定制评估,则可能需要新的专家、基础设施、项目管理和验证工作。
Snorkel 的智能体数据工厂旨在通过自动化可重复步骤来改善这一经济模型。软件智能体可帮助生成候选任务、检查输出、管理工作流,并识别需要人工审查的样本。
但自动化无法自行完成验证。生成的任务可能存在歧义;自动评分器可能奖励不完整的答案;模拟环境也可能遗漏令真实工作变得困难的约束条件。
Snorkel 模式最有力的版本,是利用自动化将专家注意力集中于关键环节。专家定义重要差异、审查不确定案例并审核结果;机器则处理重复性操作并发现异常。
这种方式类似于设计完善的知识工作流。价值来自保留上下文与专家判断,而不只是收集更多文档或示例。
竞争对手同样可以采用类似方法。Mercor 强调将高技能合同工与实验室匹配;Surge 则围绕数据质量建立了声誉。Scale 已扩展至模型评估领域,而其与 Meta 的关系使其获得了庞大的技术和财务资源。
因此,Snorkel 并不独占研究驱动型赛道。其优势必须来自执行力、值得信赖的中立性、专有系统,以及其数据能够改善客户模型的证据。
E 轮融资为公司在上述四个方向进行投资提供了空间,同时也提高了市场预期:Snorkel 能够扩大定制研究工作规模,而不沦为又一家高度依赖人工的服务商。
35 亿美元估值仍留下重要疑问
这轮融资验证了需求,但并未证明 Snorkel 的增长中有多少具备可复制性、盈利能力或可防御性。
首个不确定性涉及收入质量。年化运行率是将近期表现外推为全年数字;它不一定等同于已确认收入,也无法说明近期激增能否持续。
Snorkel 表示,在实现超过十八倍增长后,其运行率已超过 3.75 亿美元。这意味着公司从相对较小的基数实现了极为陡峭的扩张。当一家企业赢得数个大型项目时,尤其是在集中度较高的市场中,就可能出现这样的增长。
前沿 AI 实验室的支出能力很强,但数量相对有限。失去一名大客户,对供应商的影响可能远大于在广泛的企业软件市场失去一个账户。
合同的持续性同样尚不明确。一些数据项目服务于一次模型发布,之后便会结束;另一些则会随着实验室更新评估、针对失败案例优化和构建新环境而持续推进。
Snorkel 工作中可持续复现的部分,将决定当前势头更像订阅软件,还是一系列大型研究项目。该公司尚未公开提供必要的拆分数据。
第二个问题是毛利率。Snorkel 的软件背景意味着它可以将数据开发中的重要部分自动化;但其转向已完成的数据集和环境,也增加了运营成本。
法律、医学、科学、金融或软件工程领域的专家,报酬要求高于执行简单分类任务的人员。他们的工作也更难标准化和审查。
如果每个新领域都需要几乎全新的团队和工作流,收入可以增长,却未必能形成软件式利润率。如果 Snorkel 能将反复出现的专家决策转化为可复用的标注函数、评分器和环境,其经济效益应会随规模提升。
投资者实际上押注的是后一种结果。现有公开证据尚不足以判断这一进程发生得有多快。
第三个不确定性涉及衡量。一个基准测试看似困难,可能是因为任务不清晰、环境不稳定或评分系统不完整。困难本身并不意味着评估有用。
Snorkel 在公开基准测试上的工作,为外部研究人员提供了可供检视的材料。其商业项目仍属私有,这限制了外界对其质量和效果的独立评估。
客户或许拥有更有力的内部证据,因为他们能够比较使用数据前后的模型表现。但公众不能仅凭融资公告就推断这些私有结果。
第四项风险是对合成数据的依赖。模型生成的示例有助于针对特定弱点,但质量不佳的生成和筛选也会放大错误。对狭窄合成模式的反复训练,还可能降低多样性。
Snorkel 的研究驱动方法旨在管理数据质量,而非消除这一根本风险。人工审查、来源追踪、对抗性测试和独立评估依然必不可少。
第五项问题是客户中立性。Meta 投资 Scale 后,Snorkel 受益于将自己定位为独立供应商。只有当客户信任其围绕机密数据、员工访问权限和跨客户信息的控制措施时,这一定位才成立。
中立供应商不能仅仅避免被某家实验室持有或控制。它还需要技术和组织层面的边界,防止一位客户的敏感工作影响另一位客户的项目。
最后一个不确定性是竞争反应。Scale 保留了深厚的经验和资源;Surge 已与主要实验室建立关系;Mercor 和 Turing 则招募能够打造新型模型所需专家数据的专业贡献者。
实验室也可以将更多数据开发工作内部化。最大的公司拥有研究人员、工程师以及接触领域专家的渠道。它们可能将外部供应商用于补充产能,同时将具有战略重要性的评估留在内部。
因此,Snorkel 必须证明其价值不止于提供人手。它需要让数据开发比内部团队或其他托管供应商更快、更可衡量且更易复现。
公司此前的研究支持这一方向,但过去在程序化标注上的成功,并不会自动确立其在智能体环境中的主导地位。这类工作负载交互性更强、目标更不稳定,失败结果也更难评分。
这一区别才是 Snorkel AI 融资背后的真正考验。资本可以扩大产能,却无法替代“该工厂能够持续产出更优模型和更可信评估”的证据。
三个信号将显示这场押注是否奏效
客户留存、可衡量的模型提升,以及可复用的跨领域扩展能力,将决定 Snorkel 是否配得上其新估值。
第一个信号,是当前这一波前沿实验室合同之后的走向。Snorkel 报告的增长反映了强劲的即时需求,但续约情况将揭示其工作是否成为客户持续开发周期的一部分。
更长期的合作关系将表明,实验室将 Snorkel 视为研究基础设施,而非临时产能。公开点名的客户、重复开展的基准合作和不断扩大的项目,都会强化这一判断。
客户集中度与总增长同样重要。更广泛的前沿实验室、企业买家、政府机构和垂直 AI 公司组合,将降低对少数大客户的依赖。
第二个信号,是 Snorkel 的数据能否在并非由其设计的测试中带来可衡量的提升。内部客户结果或许仍然保密,但研究合作可以提供更有力的公开验证。
有用的证据应比较模型在使用 Snorkel 开发的数据训练前后的表现,同时还应在独立任务上测试模型,以降低性能提升仅反映狭窄优化的可能性。
独立复现尤其有价值。基准创建与训练数据生产紧密相连,因此开发与评估之间的清晰分隔有助于建立可信度。
Snorkel 的公开基准工作提供了一个起点。该公司支持了涉及编程、法律研究、保险承保和持续学习的智能体评估。未来发布应显示,随着模型能力提升,这些测试是否仍具有区分度。
基准维护同样将体现运营纪律。Snorkel 列出的 Terminal-Bench 修订纠正了 89 个任务中的 28 个,并增加了持续验证。修正是高难度评估中的正常现象,但一次修订的规模也说明了任务审计为何重要。
可信的供应商应识别错误、公开披露并更新评分机制。隐藏有缺陷的任务会让基准看似稳定,却削弱建立在其上的每一项比较。
第三个信号,是 Snorkel 能否进入新领域,而不让成本以与收入相同的速度扩张。这是智能体数据工厂最核心的经济问题。
可复用基础设施应能缩短各项目的启动时间。通用组件可能包括安全沙箱、任务生成工具、质量检查、专家审查队列和评估仪表板。
领域知识仍将具有专属性。软件工程系统不能仅通过更换提示词就成为保险基准。Snorkel 必须证明,共享基础设施能够处理足够多的流程,从而形成运营杠杆。
招聘模式或许能提供线索。研究工程和平台岗位的快速增长将支持自动化论点;而项目运营岗位的大幅增加,则可能表明交付仍高度依赖人工。
竞争对手的行为将提供另一项线索。如果 Scale、Surge、Mercor 和 Turing 日益强调基准设计和研究基础设施,它们就在验证 Snorkel 所选择的战场,同时也让差异化变得更困难。
如果前沿实验室继续将工作分配给多家供应商,中立性和专业化就会很重要。没有任何供应商能仅凭筹集最大一轮融资,就成为通用数据层。
Snorkel AI 融资公告表明,投资者预计即使模型、芯片和应用层不断变化,数据开发仍将是一个瓶颈。这一期待是合理的,因为模型进步持续带来新的评估问题。
悬而未决的问题是谁将捕获其中的价值。专家市场可以提供稀缺人才;大型运营商可以交付规模;内部团队可以保护战略知识;研究驱动型供应商则可以将专家判断转化为可复用的系统。
Snorkel 现已具备在这一格局中竞争所需的资金实力和营收基础。其 35 亿美元估值意味着,市场相信该公司能够在以大型供应商的规模运营时,保留实验室模式的优势。
接下来应关注客户续约情况、独立测量的模型改进,以及进入新领域的成本。这些信号将共同表明,这笔融资究竟打造了一个可持续发展的 AI 数据平台,还是仅仅为短期需求激增提供了资金支持。
对于开发者和企业买家而言,实际问题已不再是谁能标注最多的数据,而是谁能设计最具挑战性且有实际价值的任务、验证答案,并将每一次失败转化为可靠的训练材料。Snorkel 的下一阶段将检验:其研究方法能否在不牺牲质量、保密性或经济纪律的前提下,让这一流程在不同客户之间实现可重复复制。



