AIUC 获得 4000 万美元融资押注 AI Agent 安全,但认证并非保证
AIUC 融资 4000 万美元,旨在将 AI Agent 安全转化为企业可在自主系统获得敏感访问权限前进行测试、认证和投保的能力。这轮 A 轮融资为 Artificial Intelligence Underwriting Company 注入新资金,以扩展其围绕审计、定期技术评估和责任保障构建的模式。
这一模式挑战了企业应对 AI 风险的常规做法。供应商通常会记录自身控制措施,买方则单独开展审查,部署团队则在获批后添加监控。AIUC 希望以一套独立标准将这些活动串联起来,并在 Agent 造成承保损失时赋予相应的财务后果。
该公司由 Anthropic 首位产品及市场进入岗位员工 Rune Kvist,以及前 METR 首席运营官 Rajiv Dattani 创立。他们的核心观点很直接:如果买方无法衡量或转移相关风险,Agent 能力的提升就无法推动企业采用。
这也构成了此次融资公告背后真正的较量。AIUC 并不只是与另一家创业公司竞争。它正在验证,独立认证和保险能否控制供应商承诺与传统合规审查无法完全解决的风险。
AIUC 为 AI Agent 安全押注 4000 万美元
这笔融资将 AIUC 的认证模式从一项实验,转变为构建企业风险基础设施的一次严肃尝试。
AIUC 于 2026 年 9 月 15 日宣布完成 A 轮融资。Ribbit Capital 领投,First Harmonic 参与投资。该公司此前曾完成由 NFDG 领投的 1500 万美元种子轮融资,使其披露的累计融资总额达到 5500 万美元。
公司计划将工作重点从应用层 Agent 扩展至前沿模型。这一扩展颇为重要,因为模型行为正越来越多地决定 Agent 能访问什么、做出什么决策以及执行什么操作。不过,AIUC 最显著的成果目前仍出现在应用层。
AIUC 列举了 Cursor、ElevenLabs、Harvey、KPMG、Lovable、UiPath 和 Intercom 的 Fin 等采用其 AIUC-1 信任标识的机构。这些产品涵盖编程、法律工作、客户支持、自动化和语音生成等领域。
这一覆盖范围有助于 AIUC 论证:Agent 风险并不局限于某一个类别。编程 Agent 可能泄露凭证,或引入不安全的依赖项;客户服务 Agent 则可能披露个人信息,或编造政策内容。
该公司称,AIUC-1 会依据每种业务场景定制的约 5000 种风险与攻击组合对 Agent 进行评估。这些测试涵盖越狱、幻觉、数据泄露及其他运营故障相关行为。
越狱是指通过精心设计的指令绕过 AI 系统限制的尝试。幻觉则是系统在将信息呈现为可靠内容时,生成缺乏依据的信息。
据该公司介绍,测试结果会汇总为一份约 100 页的报告。AI Agent 会运行部分评估并分析结果,而人工审查员则核验最终审计结论。
这一流程反映了企业评估方式的重要转变。传统审查会检查政策、访问控制、保留规则和事件处置程序;AIUC 还会测试 Agent 在对抗性压力下实际会如何行动。
该公司的融资公告称,超过 250 名安全和风险负责人参与制定该标准。这一群体代表的是潜在买方,而不仅仅是 AI 供应商。
AIUC 表示,获得认证的 Agent 会接受独立审计和季度再认证。其公开文档还描述了对运营控制措施的年度审查,以及至少每季度一次的技术测试。
这一区别很重要。年度审计能够反映政策和既定实践,而定期测试则可应对不断变化的模型、提示词、工具和攻击技术。
AIUC 实际上是在押注:Agent 的行为变化过快,无法依靠一次性证书来应对。模型更新、新增集成或权限扩大,都可能在初步审查后改变风险状况。
这轮 4000 万美元融资并不能证明 AIUC-1 会成为长期标准。但它表明,投资者将企业信任视为一个独立市场,而不只是供应商能够在内部处理的一项功能。
这一市场能否形成,将取决于买方是否会在采购过程中将认证视为有意义的证据,也取决于保险公司能否将测试结果转化为有用的保障条款。
更智能的 Agent 为何带来更难的审批问题
企业日益增长的阻力,更多来自对行为、责任和损失的不确定性,而非缺乏令人印象深刻的 AI 能力。
AI Agent 与传统聊天机器人的不同之处在于,它们能够通过软件工具采取行动。根据所获权限,它们可以编辑代码、查询数据库、发送消息或更新业务系统。
这种自主性提高了错误的代价。一个错误答案可能变成一笔错误交易;一个被操纵的提示词可能导致未经授权地访问文档或外部服务。
Kvist 告诉 TechCrunch,银行、医院、政府和军方不再仅仅因为模型缺乏智能而拒绝 AI。他认为,这些机构无法保证已部署系统会做什么或不会做什么。
这一说法是公司创始人的判断,并非对市场需求的独立衡量。但它确实概括了一个常见的企业问题:成功的试点项目并不自动满足安全、法务和采购团队的要求。
试点通常只涉及有限的数据、用户和集成。生产部署则会将系统接入真实工作流、客户信息、知识产权和受监管记录。
因此,安全审查必须同时评估供应商和实际部署配置。底层模型固然重要,但检索系统、提示词、身份控制、工具以及人工审批环节同样关键。
这些要素可以独立变化。供应商可能更新模型,而客户可能修改权限;当 Agent 获得生产系统访问权限后,原本安全的工作流也可能变得更具风险。
AIUC 表示,许多 Agent 虽然完成了试点,却在安全审查阶段停滞,因为买方缺乏关于安全性和可靠性的可信证据。其提出的解决方案,是结合独立验证的通用测试框架。
压力首先落在向大型机构销售产品的 AI 供应商身上。否则,每个买方都可能要求不同的问卷、测试、合同条款和技术证据。
这种碎片化流程会消耗时间,却未必能产生可比较的结果。如果买方接受其范围和方法论,共享标准可以减少重复工作。
企业买方面临的则是相反压力。他们希望更快获得有用的自动化能力,但当 Agent 泄露信息或采取不当行动时,审批团队仍需承担责任。
内部团队无法完全依赖供应商的说法,也无法为每一个考虑中的 Agent 复现所有对抗性评估。
NIST AI 框架提供了一套识别和管理 AI 风险的自愿性结构。不过,它不会认证单个 Agent,也无法保证其在特定部署中的行为。
SOC 2 报告则提供了另一个有用的参考点。它们评估与安全性、可用性、处理完整性、保密性和隐私有关的控制措施。
AIUC 借鉴了公认保障文档的思路,但它针对的是不同的问题。其测试重点在于,Agent 面临高风险指令和运营条件时会如何行为。
这并不意味着 SOC 2 已经过时。AIUC-1 与传统保障审查考察的是不同层面,企业很可能两者都需要。
由此形成的审批体系可能会变得更严格,而非更简单。买方可能要求传统安全证据、AI 专项测试、监控计划、合同保护和保险。
只有当 AIUC 的认证能显著简化这一体系,足以证明额外审查的合理性时,它才能成功。若没有采购认可,一个标识只会增加文书工作,而不是减少它。
AIUC-1 如何结合测试、审计与保险
AIUC 的关键机制并非单一安全测试,而是一个将技术证据与认证及财务风险敞口连接起来的反馈闭环。
第一部分是一套涵盖安全性、可靠性、隐私、问责以及更广泛社会风险的标准。AIUC 将 AIUC-1 描述为一套专为 Agent 设计的基准标准。
第二部分是技术评估。测试人员会在既定条件下,尝试触发不安全行为、暴露信息、操纵指令,或揭示不可靠输出。
第三部分是独立审计。AIUC 已开始授权包括 Schellman 在内的外部审计机构审查证据,并判断相关组织是否符合该标准。
第四部分是保险。AIUC 提供责任保险,旨在当 Agent 故障造成承保业务损失时,为供应商和企业客户提供保障。
保险改变了激励结构,因为风险获得了财务层面的表达。保险公司需要证据来决定哪些损失符合赔付条件、哪些控制措施重要,以及哪些系统面临更高风险敞口。
这正是 AIUC 的模式区别于自愿信任标识之处。该公司希望评估结果能够影响保障的可得性和具体条款。
Kvist 此前告诉 Fortune,保险可以激励降低风险的措施。他将这种激励与影响传统保险决策的车辆安全功能进行了类比。
这一类比有用,但并不完整。车辆运行在成熟的测试体系、大量损失历史和既定法律框架之中;Agentic AI 尚缺乏可比的历史数据。
保险公司需要有关故障频率和严重程度的可信信息,也需要清晰界定模型缺陷、部署错误、客户误用和第三方攻击之间的边界。
AIUC 可以通过审计和评估收集结构化证据。随着时间推移,理赔数据可能揭示哪些测试结果确实能够预测高成本事故。
这种关系尚未得到大规模公开证明。AIUC 尚未披露足够的理赔历史,无法说明认证评分与现实损失之间的相关性有多强。
尽管如此,该公司仍具备一个合理的起步机制:测试识别已知弱点,审计检查控制措施,保险则为明确结果引入财务问责。
其与 Cursor 的合作说明了这一方法。AIUC 表示,这款编程 Agent 在 12 个风险类别中接受了数千次评估。
测试检查了密钥泄露、隐蔽提示词注入和不安全的编码默认设置,也覆盖了桌面开发环境和云端 Agent。
AIUC 的 Cursor certification 表示,Schellman 在审查技术行为的同时,也审核了运营控制措施。这些控制措施包括数据保留、访问管理、事件响应和人工监督。
据称,测试配置采用了规则、钩子、忽略文件设置和自动化审查。这一点很重要,因为智能体的安全性取决于整个组合系统,而不仅仅是语言模型本身。
设想一下:恶意指令被隐藏在某个代码仓库文件中。编码智能体在检查项目时可能会遇到这段文本,并将其视为经过授权的命令。
一项有价值的评估必须测试智能体是否会遵从隐藏指令、泄露机密信息,或安装不安全的依赖项。它还应审查周边控制措施能否遏制后果。
这比询问一家 AI 提供商是否制定了安全政策更具体。它评估的是一种可能直接影响开发团队的行为。
同样的逻辑也适用于客户服务。评估人员可以测试智能体是否会披露账户信息、编造退款规则,或遵从未经授权用户提供的指令。
AIUC 表示,其标准会随着威胁、能力和法规的演变而更新。季度更新和定期测试旨在防止认证沦为静态快照。
频繁变化也带来另一项挑战。买家需要知道适用的是哪个版本的标准、测试了何种产品配置,以及哪些重大变化需要再次审查。
没有这种可追溯性,证书可能会比其描述的系统存续得更久。随着客户将智能体部署到更多集成和使用场景中,AIUC 将需要严格的范围界定规则。
认证无法保证智能体一定会按预期行事
AIUC-1 可以为经过测试的条件提供证据,但无法保证在每一种提示、用户、集成或未来模型更新下都能安全运行。
AI 系统面对的可能输入范围极其庞大。评估人员可以抽样测试重要攻击模式,但无法穷尽智能体可能遇到的每一种交互。
测试套件也反映了其设计者已知且能够表达的威胁。新的攻击方法可能在认证后出现,而合理的产品变更也可能带来不同的失效路径。
AIUC 通过定期评估来应对这一问题。这能降低其证据的时效性风险,但无法消除根本的不确定性。
该公司的方法论还带来了另一个问题。AIUC 使用智能体执行部分测试并分析结果数据,由人工核验最终审计。
自动化可以扩大测试覆盖范围。但如果评估智能体误解任务、忽略模糊结果,或偏向其指令中已有的模式,它也可能复制盲点。
人工核验有所帮助,但读者不应将其视为每项测试结果都正确的证明。审计质量取决于抽样、审查人员的判断,以及对相关系统信息的访问。
独立性也需要谨慎界定。AIUC 制定标准、支持认证,并参与与同一风险模型相关的保险安排。
当失败会带来财务成本时,这种组合可能使激励保持一致。但如果该组织会从认证和承保范围扩大中获益,也可能引发被认为存在利益冲突的情况。
获授权的第三方审计机构可以将标准制定与个别评估分离开来。然而,市场仍需要了解审计机构监督、未通过的审查、申诉和执法方面的透明信息。
公开的认证公告自然会强调成功结果。买家还需要了解系统未通过的频率、反复出现的弱点,以及供应商是否会在获得批准前加以修复。
详细报告并不总是公开,因为它们可能暴露安全弱点。这种保密做法是合理的,但也限制了对广泛主张进行独立审查。
AIUC 表示,可通过供应商的信任门户获取 Cursor 的完整范围和评估细节。受访问控制的证据能够帮助企业买家,同时避免公开攻击指令。
不过,信任门户仍将解释责任留给客户。安全团队必须判断经过测试的配置是否与自身部署相符。
一张针对受限代码仓库访问权限智能体的证书,未必适用于另一位客户授予其部署凭据的情形。产品名称可以不变,但运营风险可能大幅增加。
保险也有类似的局限性。保单无法阻止事故发生。它只是在适用承保条件、除外责任和损失定义后,转移部分财务后果。
有些伤害难以定价或修复。泄露的数据不一定能够追回,不安全的自动化决策也可能带来超出承保赔付范围的监管或声誉后果。
承保争议还可能暴露责任界定的模糊性。保险公司可能审查究竟是供应商、模型提供商、部署企业还是用户造成了损失。
这使合同设计成为 AI 保险的核心。承保范围必须界定被保险系统、获准用途、必要控制措施、报告义务和被排除的行为。
AIUC 的公开材料并未提供足够信息,以评估每一项保单条件。企业买家应审查实际的承保文件,而不是仅凭认证推断其获得的保障。
监管带来了另一层不确定性。私有标准可以帮助组织构建证据体系,但无法取代各司法管辖区的法律义务。
一个框架可以将控制措施映射到法规要求,却无法判断某一具体部署是否符合法律。这一结论仍需要法律和运营层面的分析。
因此,AIUC 最站得住脚的主张比“安全 AI”更为有限。它提供了一种可重复的方法,用于审查选定风险、记录控制措施并支持保险决策。
这依然可能具有价值。企业风险管理很少能消除不确定性。它所做的是建立证据、分配责任,并为仍可能发生的失败制定程序。
真正的竞争是独立保障与供应商承诺之间的较量
AIUC 押注于企业买家会要求外部证据,而不是接受完全由 AI 供应商自行出具的安全主张。
AI 开发者已经开展内部评估、红队演练和安全审查。大型模型提供商也会发布系统卡和部分测试结果。
这些做法能提供有用信息,但供应商会自行选择许多测试假设和披露边界。商业压力可能影响其如何表述或优先处理弱点。
独立评估试图在销售智能体的公司与用于批准该系统的证据之间建立距离。评估机构会判断该系统是否满足共同要求。
METR 提供了一个有用的历史参照。该研究组织会在受控条件下评估先进模型和智能体能否完成难度不断提高的任务。
据 TechCrunch 报道,Dattani 曾在 2024 年至 2025 年间担任 METR 的 COO,目前仍是其董事会成员。他转投 AIUC,将评估经验带入了商业保障模式。
这两个组织并不完全等同。METR 一直专注于前沿模型能力及其相关风险,而 AIUC 的目标则是企业采用、认证和保险。
它们共同的前提是,模型开发者不应继续成为其自身系统的唯一裁判。独立测试人员可以为买家、政策制定者和公众提供证据。
AIUC 将这一前提进一步推进到了采购环节。其报告旨在帮助企业判断智能体在哪些方面达标、哪些问题仍然存在,以及是否可以接受部署。
这种面向决策的框架很重要。一项评估不必将整个系统简单标记为安全或不安全。它可以记录控制措施在哪些地方有效,以及在哪些地方仍需要人工审查。
这种方法类似于成熟的产品保障体系。当制造商、买家、审计机构、保险公司和监管机构认可同一套证据时,技术标准才会产生影响力。
Ribbit Capital 投资人 Nick Shalek 将建设者、企业、安全负责人、审计机构和保险公司之间的协调称为 AIUC 的冷启动挑战。投资人的支持表明其信心,而不是独立验证。
标准市场可能会偏向早期领导者,因为每一方参与都会吸引更多参与者。供应商想要买家要求的证书,而买家则会要求众多供应商都能提供的证书。
这种网络效应也会带来围绕正当性的竞争。AIUC 必须说服市场,其标准具有足够的独立性、技术严谨性和适应性。
替代方案包括供应商主导的测试、企业内部审查、政府规则、行业特定框架和开放评估项目。大多数组织会结合多种方法。
因此,AIUC 无需取代每一种框架。它需要成为技术测试与商业风险决策之间值得信赖的桥梁。
该公司的客户名单让它在知名智能体类别中获得了早期立足点。但采用公告并未揭示认证究竟在多大程度上缩短了采购流程。
这一结果应当变得可衡量。买家可以比较采用 AIUC-1 前后审查周期、整改工作、事故率和保险决策的变化。
最有力的证据将来自重复行为。企业客户会要求续期证书,审计机构会发现实质性问题,保险公司则会根据观察到的结果调整决策。
最糟糕的结果将是徽章泛滥。供应商可能只是再收集一个标识,而买家仍继续进行同样的定制审查,并接受同样未解决的风险。
AIUC 的未来取决于能否避免这种结局。其审计必须发现有意义的弱点,认证也必须保持足够难度,才能传递有效信息。
三个信号将表明 AIUC 的模式是否奏效
下一项考验是,AIUC 能否将融资、认证和保险公司参与转化为企业部署决策中可观察到的变化。
第一个信号是更广泛的独立审计能力。Schellman 成为 AIUC 首家获授权的审计机构,但一项持久的标准需要多家合格机构采用一致方法。
更多审计机构可以扩大能力,并降低对 AIUC 内部运营的依赖。不过,只有在认证和质量控制仍然严格的情况下,扩张才会增强这一模式。
关注有关审计机构培训、利益冲突、审查一致性和处罚的公开规则。清晰的治理将强化 AIUC 关于该证书代表独立保障的主张。
薄弱或不透明的监督将削弱这一主张。当不同审计机构以不相容的方式解读同一项要求时,标准的信息价值会降低。
第二个信号是证明认证会改变采购结果的证据。AIUC 表示,安全审查经常会在成功试点后阻止智能体部署。
该公司最终应展示,获得认证的供应商是否能更快完成审查、面对更少的重复问卷,或以更少例外进入生产环境。汇总数据可以保护客户机密,同时检验这一核心商业主张。
续期比发布公告更重要。一名持续进行季度测试和年度审查的客户,证明了超出初始营销之外的持续价值。
买家还应核实,认证是否适用于他们计划采用的配置。产品团队需要一个可搜索的知识库,其中包含适用范围、测试证据、例外情况和部署变更。
这一记录在更新后变得至关重要。安全团队必须了解,新模型、新工具或新权限是否会使先前的结论失效。
第三个信号是保险表现。如果测试结果能够影响承保决策并预测实际损失,AIUC 的综合模式就会更具可信度。
有价值的证据包括匿名化的理赔模式、常见失效类别、控制措施的有效性,以及承保决策的变化。这些数据将表明,认证是否衡量了具有财务相关性的风险。
相反的结果则会削弱这一论点。如果获得认证的系统遭受了类似损失,或保险公司忽视评估结果,那么测试与承保之间的联系仍未得到证实。
在这一信号中,前沿模型的扩展值得关注。应用审计评估完整的智能体系统,而模型层面的评估则针对众多产品共有的能力。
向上游延伸会提升 AIUC 的潜在影响力,但也会增加方法论上的难度。通用模型在开发者加入工具、提示词、记忆和访问控制后,会表现出不同的行为。
AIUC 需要说明模型证据如何与应用证据相衔接。任何单一层面都无法完整涵盖部署风险。
企业买家不应等待完美的保障。无论是 AIUC、模型供应商、监管机构还是内部审查团队,都无法提供这种保障。
他们应提出具体问题:测试的是哪种配置?哪些风险未能通过测试?整改后发生了哪些变化?证书何时到期?保单排除了哪些损失?
随着智能体获得对关键系统的访问权限,开发者应预期这些问题将成为常态。清晰的证据可以成为产品优势,尤其是在买家无法自行复现每一项评估时。
知识工作者也应关注这一问题,因为智能体失误正日益影响其工作所涉及的信息和决策。当软件能够据此采取行动时,错误答案的后果会更加严重。
AIUC 的 4,000 万美元融资支持了一项可信的私营 AI 治理试验。该公司围绕一个共享风险模型,将技术测试、定期审计、认证和保险结合在一起。
这一方法无法约束每一个失控的智能体,认证也无法承诺实现这一结果。它的价值取决于一个更务实的问题:独立证据能否让高风险部署更易于评估,也更难被轻易开脱?
未来几个月,请关注审计机构、采购数据和保险结果。这些信号将显示,AIUC 的 AI 智能体安全会成为基础设施,还是仍只是一枚信任徽章。



