AIUC 以 4000 万美元押注独立监督,启动前沿模型审计
AIUC 已融资 4000 万美元,启动 AIUC 前沿模型审计,将其认证业务从应用程序延伸至支撑应用程序的底层模型。这轮 A 轮融资为这家初创公司提供资金,用于检验独立审计和保险能否化解日益突出的矛盾:AI 开发者希望加快采用速度,而企业和政府则希望看到证据,证明能力不断增强的系统会在既定边界内运行。
Ribbit Capital 领投本轮融资,First Harmonic 参与投资。此前,Nat Friedman 旗下 NFDG 于 2025 年 7 月领投了该公司 1500 万美元的种子轮融资。据该公司及一份融资报道称,AIUC 目前累计融资 5500 万美元。
此次扩张标志着业务范围的重大变化。AIUC 此前主要专注于基于基础模型构建的智能体,包括 Cursor、Harvey、ElevenLabs 及其他软件公司开发的系统。如今,该公司计划审计为这些智能体提供底层推理、语言和工具使用能力的前沿模型。
这一转向使 AIUC 更贴近围绕先进 AI 的核心信任争议。模型开发者通常自行进行评估,并公布经过筛选的结果。独立审计机构认为,自我评估无法给予买家、保险公司或监管机构足够信心,尤其是在重要证据仍属机密的情况下。
AIUC 押注,缺失的一环既不是又一项基准测试,也不是又一份自愿安全声明。它希望将标准、技术测试、独立审计员和保险作为一个系统运作。更棘手的问题是,前沿实验室是否会接受可信审计所需的访问权限与审查力度。
AIUC 前沿模型审计深入应用层之下
这笔新融资让 AIUC 从智能体认证服务商,转向有志于审计决定数千个下游系统行为的模型的机构。
AIUC 于 2026 年 9 月 15 日宣布 A 轮融资。联合创始人兼首席执行官 Rune Kvist 表示,Ribbit Capital 和 First Harmonic 领投了本轮融资。该公司计划利用这笔资金,将其审计和保险业务扩展至前沿 AI 模型。
前沿模型是处于 AI 发展前沿、能力极强的通用系统。企业将这些模型作为编程助手、研究工具、客户服务智能体和工作流自动化工具的基础。
此前,AIUC 主要评估构建于这些模型之上的智能体。智能体将模型与指令、数据访问权限、软件工具和执行任务的授权结合在一起。这样的外围系统可能引入通用模型评估无法捕捉的风险。
例如,企业编程智能体可能读取私有代码库、创建软件变更,并与部署系统交互。其风险取决于底层模型,也取决于权限、身份验证、监控以及应用自身的防护措施。
AIUC 现有的 AIUC-1 标准针对的正是这一系统层面。该公司称,一次评估可让智能体面对约 5000 种攻击与风险组合。测试类别包括越狱、幻觉、数据泄露、不安全的工具调用,以及涉及人工监督的失效情形。
越狱是指通过精心设计的提示词或交互方式,试图绕过 AI 系统限制的行为。技术评估人员还会测试提示词注入,即不可信内容试图重定向智能体或获取信息。
AIUC 表示,自动化智能体承担了大部分测试工作,而人工审计员负责审查证据并作出最终结论。其框架还检验运营和法律控制措施,而非将基准表现视为安全性的充分证据。
公开的认证范围包含六个基础领域和 50 项要求。这些领域涵盖数据与隐私、安全性、可靠性、问责制和社会风险。审计员会在测试开始前界定哪些系统和控制措施属于评估范围。
AIUC 表示,认证需要每年续期,技术测试至少每季度进行一次。这一频率反映了 AI 保障面临的核心问题:模型、攻击方式、工具和产品架构的变化速度,可能远快于传统合规计划。
进入前沿模型领域改变了被审计的对象。应用审计可以检查明确的部署、其权限及运行环境;模型审计则必须考虑可能在众多产品和情境中显现的广泛能力。
模型层面的工作可能包括对网络能力、生物风险、欺骗性、自主性及对防护措施的抵抗能力进行评估,也可能审查开发者的安全实践、内部治理和响应计划。
这些调查需要比公开测试更深入的访问权限。外部审计员可能需要获得保密评估结果、开发文档、事件记录、模型版本以及内部控制相关信息。
AIUC 尚未公开详述其前沿模型审计将采用的每项评估、访问要求或保障等级。这一缺失很重要,因为“审计”一词可以指从外部红队测试到对实验室内部系统进行持续验证的各种工作。
因此,这项融资公告确立的是方向,而非证明一套完整的前沿审计体系已经存在。AIUC 仍须展示其智能体框架将如何转化为对先进模型开发者的审查。
这一差异对企业买家十分重要。对某个智能体的认证,并不意味着使用同一模型的每个应用都具有相同风险。反过来,模型审计也无法验证每一个下游产品的权限和防护措施。
AIUC 正进入这两个层面之间的空间。其机会在于将模型层面的发现与应用控制及财务后果连接起来;其挑战则在于清晰界定每份认证实际验证的内容。
为什么 AI 风险正成为采用瓶颈
AIUC 的论点是,AI 能力的发展速度已超过企业用于批准、监控和承保这些能力的系统。
Kvist 表示,许多企业已经拥有在试点阶段表现成功、却在安全审查中停滞的智能体。这些项目或许能完成有用的任务,但买家无法就可靠性、数据处理或责任建立可接受的证据。
这一缺口给多个群体带来压力。AI 供应商必须回答大量安全问卷,并证明其产品能够抵御滥用。企业团队则必须在不暴露敏感数据或关键系统的前提下快速推进。
首席信息安全官面临最尖锐的冲突。管理层希望他们支持 AI 的采用,同时又要求防止数据泄露、有害输出和控制不当的自动化。一场有前景的演示并不能消除这项责任。
采购团队也遇到类似问题。对于传统软件控制措施,他们可以索取 SOC 2 报告或审查 ISO 27001 认证。但这两种工具都不是为评估智能体在对抗性提示词下不断变化的行为而设计的。
SOC 2 审查与安全性、可用性和保密性等领域相关的控制措施。它仍然有用,但无法告诉买家智能体会如何应对提示词注入或缺乏依据的指令。
ISO/IEC 42001 为组织层面的 AI 治理提供管理体系框架。它帮助公司建立政策、职责和持续改进流程,但无法替代对特定智能体或前沿模型的技术测试。
AIUC 将 AIUC-1 定位为补充层。该标准将运营证据与针对 AI 系统能力及部署情境定制的评估结合起来。
该公司指出,获得认证的产品名单正在扩大。Cursor 已为其编程智能体取得认证,Harvey 则为用于法律工作的系统完成认证。ElevenLabs、KPMG 及其他组织也已宣布依据该标准开展工作。
这些名称支持了企业 AI 供应商希望获得可复用保障形式的观点。然而,客户参与并不能独立证明 AIUC-1 能预测更低的事件发生率。要获得这类证据,仍需要时间、透明的方法和可比较的结果。
保险旨在强化这一激励机制。据相关公司称,ElevenLabs 利用 AIUC-1 认证支持了覆盖其智能体相关特定损失的保险安排。该安排将测试与可能在承保失效发生后面临财务风险的一方连接起来。
这种联系使 AIUC 的策略不同于止步于报告的框架。保险公司有理由关注评估是否识别出实质性风险;当系统或证据发生变化时,它也有理由调整保障范围。
这一模式类似于其他认证与承保共同发展的行业。AIUC 联合创始人 Rajiv Dattani 提到 Underwriters Laboratories;当保险公司面临火灾损失时,该机构曾帮助测试电气产品。
这一类比为 AIUC 提供了清晰的叙事,但 AI 系统不同于实体产品。经认证的灯具拥有边界明确的组件和可预测的运行条件;模型则可能因更新、工具、上下文及与用户的互动而变化。
AI 失效也可能难以归因。有害结果可能源自基础模型、应用开发者、客户的配置,或忽视警告的操作人员。
保险合同必须在能够转移有意义风险之前界定这些边界。免责条款、证据要求、事件报告和损失衡量,将与供应商展示的信任标识同样重要。
这正是前沿模型扩张会带来更广泛影响的原因。如果 AIUC 能将实验室实践与下游认证连接起来,保险公司就能审视技术栈更多环节的风险。
届时,模型开发者将面临提供支持可保性证据的压力。应用供应商可将这些证据与自身评估结合使用。买家或许能更清楚地了解由哪一方控制每一项风险。
这不会让 AI 默认安全,但会让责任更清晰可辨,而这或许已足以解除对严格限定部署的阻碍。
对于知识工作者而言,当智能体能够访问消息、文件、会议记录和内部文档时,这一区别尤为重要。组织需要对系统可检索的内容及其可执行的操作设置明确控制。
良好的知识管理可通过围绕明确工作情境组织访问权限,减少不必要的暴露。它无法替代模型测试,但有助于限制智能体失效的后果。
独立审计直面实验室自我评估
核心冲突并非 AIUC 与另一家认证初创公司的竞争,而是独立保障与由实验室自行评估其模型的体系之间的较量。
前沿实验室已经设有评估、安全和准备度计划。它们聘用了解自身系统、并能获取外部研究人员无法获得信息的专家。
内部访问至关重要,但也带来了可信度问题。开发者在发布模型、赢得客户以及避免可能延迟部署的披露方面,存在商业动机。
实验室可以发布评估结果而不暴露敏感细节。然而,外部人士可能难以判断测试是否覆盖了正确的风险、采用了合适的阈值,或是否代表了已发布的系统。
同一开发者可能负责设计模型、选择评估方式、解读结果,并决定哪些内容对外公开。即使是审慎的团队,也无法消除这种结构所带来的潜在利益冲突印象。
独立的前沿 AI 审计旨在分离这些角色。2026 年 1 月的一项审计研究将这一实践定义为:基于对非公开信息的安全访问,由第三方进行严格验证。
该研究的作者提出了从限时系统审查到持续、抗欺骗验证的不同保证等级。他们认为,仅靠透明度无法弥合这一缺口,因为部分安全与安保信息必须保持机密。
这一观察支持了 AIUC 的市场论点。买方需要可信的证据,但实验室无法安全地公开每一种漏洞利用方式、模型弱点或内部安全细节。审计机构有可能审查受保护材料,并发布更有限的结论。
不过,独立性不止意味着组织上的分离。审计机构还需要技术能力、安全设施、一致的方法,以及质疑不完整证据的权限。
它们还需要经济独立性。如果模型开发者选择并支付审计机构,竞争中的审计公司可能面临降低成本、缩短测试周期,或避免作出令客户不满的发现的压力。
AIUC 希望通过保险来对冲这种逐底竞争。承担承保损失的保险承保方,有动力要求更严格的测试和可信的证据。理论上,金融风险会使薄弱审计的代价变得高昂。
Kvist 曾将这一问题描述为:应由谁来担任监督者。在 9 月的一次采访中,他认为前沿实验室无法完全为自己承担这一角色。
这一观点在方向上颇具说服力,但并未解决制度设计问题。AIUC 本身也是一家寻求客户、投资者和行业影响力的商业公司。其激励机制同样需要审视。
可信的体系需要在标准制定者、审计机构、保险公司和认证组织之间实现分离。即使所有人都意在提升安全性,角色集中也可能制造利益冲突。
AIUC 表示,组织可以选择自己中意的审计机构合作,其文档也提及经认可的审计机构。Schellman 于 2026 年初成为 AIUC-1 的首家获认可审计机构。
这一模式类似于成熟的保证市场:独立机构依据公认标准评估组织。与依赖单一内部审计团队相比,这种模式能够更快扩展。
但认可机制带来了另一个问题:谁来评估评估者?标准所有者必须验证审计机构的能力,同时不能偏袒那些能产出便利结果的公司。
前沿模型评估进一步增加了难度。审计机构可能接触危险能力信息、模型权重、未发布系统以及高度敏感的安全细节。访问权限必须有实际价值,同时不能形成新的攻击面。
它们还可能面对能够识别评估条件,或在测试期间表现不同的模型。当系统能够适应语境,或开发者直接针对已知测试进行优化时,静态基准的参考价值会下降。
持续监测提供了一种应对方式。审计机构可以在重大更新后重复评估,并将生产环境信号与此前结果进行比较。AIUC 已对智能体认证采用季度测试,这为其提供了一个初始流程。
然而,持续监督需要针对模型变更制定明确规则。供应商可能更新权重、系统提示词、过滤器、工具或推理基础设施,却不给产品更换名称。
审计机构必须决定哪些修改会触发重新评估。它们还需要获得那些只会在真实使用中、在受控评估之外出现的事件信息。
AIUC 超过 250 名安全与风险参与者,可能有助于建立实际要求。该公司表示,这些贡献者包括来自大型企业和前沿 AI 开发商的领导者。
广泛参与可以提升相关性,尤其是在标准必须适用于编程、法律、客户服务和金融应用时。但这也可能形成偏向共识、而非严格阈值的协商。
决定性证据将来自治理细节。AIUC 必须披露标准如何变更、利益冲突如何管理、审计机构如何取得资格,以及失败如何影响认证。
缺少这些机制,认证就可能沦为又一种采购徽章。有了这些机制,AIUC 则可能让独立审查成为采用前沿模型的常规要求。
AIUC 认证仍无法证明什么
认证可以证明在某一特定时间,既定证据符合既定标准,但无法保证在每一种部署中都能安全运行。
AIUC 的标准涵盖了隐私、安全、可靠性、问责制和有害输出等重要类别。其测试节奏也承认,一次性审查会逐渐失效。
这些优势并不能消除评估的局限。审计只能抽样检查行为和控制措施。它无法探索通用模型可能遇到的每一个提示词、工具、用户、数据源或运行环境。
约 5,000 种风险和攻击组合听起来覆盖广泛,但这一数字本身对覆盖范围说明不多。质量取决于案例如何被选择、更新、加权,以及如何根据系统能力进行调整。
模型可能在已知测试中表现良好,却在新型攻击下失效。开发者也可能在认证后有意或因常规产品更新而改变安全防护措施。
AIUC 通过季度技术测试和年度续期,解决了这一问题的一部分。其 AIUC-1 framework 表示,随着威胁和缓解技术变化,标准本身也会按季度更新。
频繁更新提高了响应能力,但也使可比性变得复杂。根据某一版本获得的证书,可能并不代表与数月后颁发的证书相同的要求。
买方需要清晰的版本标签、范围说明、日期和例外情况。他们还需要底层审计报告,而不只是公开标识。
AIUC 表示,买方可以获得一份详细的独立报告,涵盖防护措施、控制机制和红队测试结果。获取这些证据有助于作出更明智的采购决策。
保密要求将限制公开内容。前沿实验室会抵制发布可能暴露漏洞、知识产权或危险能力的细节。
这带来了艰难的平衡。如果公开报告包含的信息太少,外部人士无法判断其严谨性;如果报告包含的信息太多,审计过程本身就可能增加风险。
保险还带来了进一步的不确定性。承保并不意味着 AI 系统安全,保单条款决定哪些损失符合赔付条件。
一份保单可能涵盖某些错误,同时排除网络攻击、故意滥用、知识产权索赔或未经批准的部署。买方必须审视具体承保事件,而不是依赖泛泛的保护主张。
前沿 AI 的历史损失数据仍然有限。因此,保险公司在估算发生频率、损失严重程度和关联性故障方面,掌握的证据较少。
关联性尤为重要。一个被广泛使用的模型可以支撑数千个应用。一项单一弱点可能同时给许多投保客户带来损失。
传统承保通常假设风险可以分散。对少数模型的共同依赖挑战了这一假设,并可能造成集中敞口。
AIUC 的扩张可能有助于保险公司理解这种依赖关系,但无法消除它。承保方可能通过承保限额、模型限制或更严格的运营要求来应对。
另一个不确定性涉及前沿实验室的采用情况。智能体开发者有直接理由赢得企业信任,因为认证可以支持单个产品的销售。
领先的模型公司处于不同位置。它们的产品已经服务于大型市场,而外部审计可能带来成本、发布延迟和保密性担忧。
监管或大客户要求可能形成更强的激励。保险公司也可能在为基于特定模型的部署提供承保前,要求独立证据。
在这些压力变得实质性之前,实验室可以选择有限评估,或继续依赖内部评估。AIUC 已宣布其审计前沿模型的意图,但尚未公布已完成的模型级认证。
这一差异应当保持清晰。A 轮融资为进入一个要求严苛的领域提供了扩张资金,并不意味着主要实验室已经接受 AIUC 提出的访问模式。
市场也缺乏对充分前沿保证的统一定义。不同评估机构可能侧重危险能力、产品可靠性、组织控制或网络安全。
AIUC 可以提供有用的基础设施,而不必成为唯一权威。可能需要多种审计方法,前提是它们的范围和置信水平保持可比。
监管机构和标准组织将影响这一结果。NIST 的 AI 风险管理框架、ISO/IEC 42001、欧盟 AI 法案以及行业特定规则,已经在塑造治理计划。
AIUC-1 将其要求映射到多个既有框架。这类映射可以减少重复工作,但一致性并不意味着这些标准可以互换。
组织可能满足管理控制要求,同时仍保留未解决的技术弱点。它也可能通过技术评估,却缺乏可靠的事件响应和问责机制。
有效的保证必须结合这两种视角。模型行为、应用设计、组织实践和财务责任都会影响实际风险。
三个信号将检验 AIUC 的前沿审计押注
接下来的检验在于,AIUC 能否将资金充足的认证论点转化为前沿开发者所接受、可重复执行的审查。
第一个信号是具有明确范围的、已具名的前沿模型合作项目。AIUC 需要说明审查了什么、由哪家组织实施审计,以及哪些证据支持了结论。
仅有一个公开信任标识会削弱该公司的论点。范围报告、保证等级、模型版本和续期计划,将表明这种扩张带来的不只是营销语言。
首个参与实验室的身份同样重要。若获得一家成熟前沿开发商的合作,将强化 AIUC 的主张:独立审查正在成为商业上的必要条件。
仅对一个评估类别进行有限审查,其分量将低于涵盖技术测试、安全控制、治理和事件流程的访问。两者都可能有用,但不应使用含糊不清的相同标签。
第二个信号是,保险公司是否利用模型级发现来改变实际承保决策。这可能体现在与审计证据挂钩的承保资格、条件、除外责任或监测要求上。
保险旨在防止认证沦为低门槛的徽章。如果保险机构并不依赖认证结果,AIUC 的激励模式在很大程度上仍停留在理论层面。
建立可信关联并不要求保险机构披露保单中的保密条款。它们可以说明哪些控制措施会影响承保范围,以及重大模型变更会如何触发审查。
随着时间推移,理赔处理的证据尤其具有参考价值。这将表明:当模型、应用、配置和用户行为都对损失产生影响时,责任能否被明确归属。
第三个信号来自竞争性框架、审计机构和监管机构的反应。如果主要采购方或公共部门认可独立前沿审计是必要证据,采用速度将会加快。
这种认可并不意味着必须强制采用 AIUC-1。采购规则可以要求提供可比的保障,同时允许采用多项标准或不同的评估服务提供商。
竞争能够改进方法,但也可能促使要求被弱化。明确的认证机制和公开的范围说明,将决定采购方能否区分严肃审查与图方便的审查。
AIUC 的资金支持使其能够招募评估人员、开发测试、支持审计师,并与保险机构建立合作关系。其早期的智能体认证也让它积累了企业部署问题方面的实际经验。
但这两项优势都无法解决最棘手的问题。前沿审计依赖于被审查组织所授予的访问权限。
最理想的结果,是形成一个市场:模型开发商在部署高风险系统前,预期需要接受独立审查。审计报告可能仍会部分保密,但其范围和保障级别应当清晰易懂。
较弱的结果则可能带来边界不清的零散认证。采购方会多收集一份文件,却仍然面临有关模型行为和责任归属的同样不确定性。
因此,企业领导者应提出具体问题:测试的是哪个模型版本?包含了哪些部署条件?排除了哪些风险?由谁完成评估?哪些变更需要重新评估?
开发者和知识工作者在将智能体接入敏感信息之前,也应提出一个相关问题:系统是否仅拥有完成当前任务所必需的数据和权限?
支持受控信息采集的工具,可以帮助团队整理相关上下文,而无需向每个应用授予不受限制的访问权限。即使底层模型已接受独立审计,这种纪律依然重要。
AIUC 的前沿模型审计只有在其证据能够改变实际决策时才会成功。资金提供了发展空间,但采用情况、承保行为和透明的审计边界,将决定这一新层级能否赢得信任。
未来几个月,请关注是否会出现具名的前沿实验室、超越公开基准测试的审计范围,以及与经验证发现挂钩的保险条款。这些信号共同出现,将强化 AIUC 关于独立保障能够推动部署的主张。如果它们仍未出现,这项公告将代表一次雄心勃勃的扩张,而非一套成熟的监督体系。务实的应对方式不是等待一个通用的安全标签。采购方应要求范围明确的证据,将每份证书与预期部署进行比对,并保留对数据访问和智能体权限的限制。认证可以为这一判断提供参考,但无法取而代之。



