top of page

AIUC AI Agent Certification 获得 4000 万美元融资,但信任仍需证据

9月17日
讀畢需時 12 分鐘

AIUC 融资 4000 万美元,以扩大 AIUC AI agent certification,押注独立证据能够推动因安全顾虑而停滞的企业部署。这轮 A 轮融资使公司总融资额达到 5500 万美元,并将其工作范围从应用扩展至前沿模型。

这一扩展之所以重要,是因为具备能力的智能体正越来越多地获得访问代码、客户对话、公司数据和外部工具的权限。企业买家必须判断:当指令彼此冲突、攻击者操纵输入,或接入服务暴露敏感信息时,这些系统是否仍能保持可靠。

AIUC 希望借助其认证、定期测试和保险产品,让这项判断变得更容易。它的对手并非另一家认证初创公司,而是企业长期以来依赖供应商问卷、内部审查和一次性评估来审视持续变化系统的惯常做法。

这笔 4000 万美元押注将 AIUC 的范围延伸至智能体之外

AIUC 正在为一项尝试提供资金:将 AI 保障变为持续运行的基础设施,而非采购期间交换的另一份文件。

Artificial Intelligence Underwriting Company 于 2026 年 9 月 15 日宣布完成 A 轮融资。根据公司发布的融资公告,Ribbit Capital 领投,First Harmonic 和 Terrain 参投。

AIUC 此前完成由 NFDG 领投的 1500 万美元种子轮融资。这两轮融资使其披露的总融资额达到 5500 万美元。

公司由 Rune Kvist 和 Rajiv Dattani 创立。Kvist 是 Anthropic 的首位产品招聘员工,而 Dattani 此前负责模型评估机构 METR 的运营工作。

两人的背景使 AIUC 处于多个成熟领域的交汇点。该公司试图将技术评估、组织审计、保险承保和企业采购整合为一层保障机制。

公司现行标准 AIUC-1 聚焦 AI 智能体的安全性、可靠性与安全保障。这类系统能够规划任务、调用软件工具、检索数据,并以不同程度的自主性采取行动。

AIUC 表示,获得认证的智能体会面对约 5000 种根据其部署环境定制的风险与攻击组合。测试涵盖越狱、幻觉和数据泄露等问题。

越狱是指旨在让 AI 系统忽略既定限制的输入。对于拥有工具访问权限的智能体而言,这类失效可能影响对话本身之外的系统。

该公司还表示,独立审计机构会审查组织控制措施,技术评估则考察智能体行为。获得认证的系统需要每季度进行技术测试,而不只是每年审查一次。

这种定期安排反映了一个真实问题:模型会变化,提示词会演进,集成范围会扩大,而攻击者会在初始评估结束后发展出新技术。

AIUC 已列出 Cursor、ElevenLabs、Harvey、KPMG、Lovable、UiPath 以及 Intercom 的 Fin 等获得其信任标识的组织。这些案例涵盖编程、语音、法律工作、自动化、咨询和客户支持。

这笔新资金将支持一个更广泛的目标。AIUC 表示,计划将审计、标准和保险从智能体应用扩展至前沿模型。

这一举措改变了公司的雄心。应用测试关注特定智能体是否能在既定环境中以可接受的方式运行;前沿模型监管则必须应对范围广得多的能力、部署方式和下游适配。

这也让 AIUC 更接近评估最强大通用模型的机构。这类评估需要更深入的技术访问,以及对认证实际覆盖内容更清晰的定义。

因此,这轮融资支持的不只是客户数量增长,还包括一项检验:随着受审系统变得更强大、影响更深远,私营认证能否保持可信度。

AIUC AI Agent Certification 为何存在机会

企业 AI 已到达这样一个阶段:部署决策对证据和问责的依赖,已不亚于对模型性能的依赖。

许多早期 AI 试点都在狭窄的界面内运行,并且有大量人工监督。智能体带来了不同的风险特征,因为它们能够把推理能力与权限和行动结合起来。

客户支持智能体可能读取账户记录、解读政策并启动工作流程。编程智能体可能检查代码库、修改文件、运行命令,或提出生产环境变更建议。

法律智能体可能根据机密文件起草材料。自动化智能体则可能通过应用程序编程接口协调多个业务系统。

这些能力之所以能创造价值,是因为软件可以完成多步骤任务。它们也扩大了错误输出或被操纵指令可能造成的后果。

传统安全评估仍然重要。买家需要身份控制、加密、日志记录、事件响应,以及供应商恰当处理客户数据的证据。

但这些控制措施并不能完全回答行为层面的问题。智能体可以在管理良好的云环境中运行,却仍可能泄露信息、编造事实,或错误使用获授权的工具。

OWASP 的智能体风险分类反映了这一扩大的威胁面。它涉及 AI 系统在互联工作流程中进行规划、决策和行动时产生的风险。

这正是 AIUC 看到机会的地方。该公司希望同时评估运行智能体的组织,以及智能体本身的行为。

这种组合可以帮助安全团队提出更精确的问题。测试了哪些系统组件?测试环境包含哪些权限?覆盖了哪些攻击类别?

买家还需要知道获得认证的是哪个模型和智能体版本。当供应商更改基础模型、系统提示词、检索管道或可用工具时,评估就会失去相关性。

AIUC 表示,其流程会产出详细发现,而不只是一个徽章。根据智能体审计细节,自动化系统协助运行测试和分析结果,而人类负责核验最终审计。

这种混合方法可以增加测试覆盖范围。但它也会带来新的验证问题,因为 AI 生成的分析自身可能存在错误和盲点。

因此,人工审查仍然重要。审查人员必须了解测试用例如何生成、哪些失败情形被升级处理,以及评估是否接近生产环境。

更广泛的指导原则已经为企业作出这类决策提供了基础。NIST 的自愿性AI 风险框架围绕治理、映射、测量和管理来组织风险工作。

认证可以补充该框架,但无法替代组织自身的风险决策。每个买家仍然控制着部署周围的数据、权限、工作流程和后果。

AIUC 的机会在于,将宽泛的风险原则转化为采购团队能够使用的证据。其挑战则是证明:在部署条件发生变化后,这些证据仍有意义。

认证与问卷现状之争

核心竞争在于持续测试的保障机制,与围绕静态供应商声明构建的采购流程之间的较量。

企业审查通常始于冗长的问卷。供应商描述其控制措施、附上政策、提供审计报告,并说明其处理事件的方式。

对于边界稳定的成熟软件服务,这一流程相当有效。但当软件行为会随着提示词、上下文、模型和接入工具而变化时,其完整性就会下降。

一个智能体可能通过常规访问控制审查,因为每项集成都使用获批准的凭证。但同一个智能体仍可能在提示词注入攻击后滥用这些合法权限。

提示词注入是指不可信内容操纵 AI 系统指令的情况。浏览文档或网站的智能体可能在完成原本获授权的任务时遇到这类内容。

一次性问卷无法可靠地暴露这种行为。直接的对抗性评估能够测试已部署系统在受控攻击条件下的响应。

AIUC-1 试图增加这一行为层。其范围涵盖六大领域:数据与隐私、安全、安全保障、可靠性、问责和社会风险。

据称,该标准采用 50 项要求,并根据智能体的部署环境选择技术与政策控制措施。范围很重要,因为编程助手和语音智能体并不会产生完全相同的风险。

编程智能体需要围绕代码库访问、命令执行、依赖项变更和密钥暴露进行仔细评估。面向客户的语音智能体则需要涉及身份验证、披露、误导性声明和未授权操作的测试。

这种情境化方法比为每个产品套用相同清单更有用。但它也使比较更困难,因为两份认证可能覆盖不同的系统和要求。

因此,买家应要求了解审计边界,而不只是确认徽章是否存在。他们需要知道纳入范围的是哪些智能体、工作流程、集成和运行环境。

认证的有效期也值得关注。AIUC 表示,认证有效期为 12 个月,并要求至少每三个月进行一次技术测试。

季度评估比年度快照更具响应性。然而,重大产品变化可能发生在计划测试之间,尤其是在供应商频繁更新模型时。

一个可信的项目需要设定触发额外审查的规则。更换底层模型、授予新的高风险权限,或进入受监管工作流程,都可能显著改变风险。

当审计人员具备技术能力且不受商业压力影响时,独立审计能够强化这一流程。AIUC 与外部评估机构合作开展运营审查,同时自行进行技术测试和认证审核。

与 BSI 的合作为该框架带来了一家成熟的保障合作伙伴。BSI 表示,其角色是在 AIUC 完成技术审查前,评估治理、政策、流程和运营控制措施。

AIUC-1 还获得了进入 Cloud Security Alliance 注册库的渠道。STAR registry可以为符合条件的组织展示 AIUC-1 信任标识。

这些关系可以提高采购阶段的可见度。但它们并不能自动证明认证能够预测更安全的现实世界结果。

这一区别界定了 AIUC 必须建立的市场。它必须说服买家,其测试能提供比现有问卷更好的证据,同时避免让认证沦为又一个勾选项。

保险改变的是激励机制,而非技术本身

AIUC 的保险层增加了财务问责,但并不意味着获得认证的智能体不会失效。

认证与保险分别应对信任问题的不同部分。认证评估控制措施与行为,而保险则在发生承保范围内的故障时,分配特定的财务后果。

将两者结合可以形成有益的激励机制。保险公司在承保风险前,有直接动机要求有效的控制措施、准确的信息以及持续性的证据。

这种安排也可以鼓励改进。更完善的控制措施和更清晰的事件数据,能让承保决策随着时间推移变得更有依据。

AIUC 将这一模式与由保险公司支持的产品安全组织的发展历程进行比较。这一类比颇具吸引力,因为测试、标准和财务风险敞口曾帮助其他高风险技术走向常态化。

与许多实体产品相比,AI agents 更难界定边界。其行为取决于概率模型、不断变化的上下文、第三方服务,以及每位客户授予的权限。

实体组件通常可以根据明确的运行公差进行测试。企业级 agent 则可能面对语言、数据、工具和对抗性输入的无数种组合。

保险并不会消除这种不确定性。它是在保险公司评估风险后,为特定损失定义一种合同上的应对方式。

实际价值取决于保单条款。买方必须审查承保事件、除外责任、证据要求、赔偿限额,以及部署组织仍需承担的责任。

证书或许可以支持承保评估,但并不保证每一次幻觉、隐私失误或未经授权的操作都会获得保障。保险合同很少能将复杂的运营风险转化为普遍保护。

ElevenLabs 已将 AIUC-1 认证用于其语音 agents 的保险安排。这一案例为检验认证能否支持真实部署的保障提供了早期测试。

但它尚未就大规模保单组合中的理赔表现提供公开证据。市场仍缺乏关于 agent 事件、损失、有争议理赔和追偿结果的长期历史。

这段历史很重要,因为当保险公司能够将控制措施与已观察到的损失关联起来时,承保评估就会改善。AI agents 的变化速度快于传统精算数据集的积累速度。

AIUC 可通过技术评估在一定程度上弥补这一缺口。测试结果能够向承保人员提供比供应商笼统安全声明更细致的信号。

不过,评估结果需要根据生产环境中的事件进行校准。当高分能够持续预测部署后更少或更轻微的故障时,它才更具意义。

公司还必须管理一种激励冲突。它既参与定义标准、开展技术测试、颁发证书,也支持与该评估挂钩的保险。

这些活动可以相互强化,但这种集中化也带来了治理问题。买方应了解谁设计测试、谁执行审计、谁作出认证决定,以及谁承担承保损失。

清晰的职责分离可以增强信心。公开的方法论、审计员要求、申诉流程和基于事件的更新,将使该体系更易于独立评估。

对于企业团队而言,保险应置于技术与组织控制措施之后。它是一道财务后盾,而不是赋予 agent 不受限制访问权限的许可。

AIUC 证书不能证明什么

认证在特定时点提供结构化证据,而非永久保证某个 agent 安全、可靠或值得信赖。

AIUC 在其认证 FAQ中直接说明了这一限制。该公司表示,没有任何标准能消除所有风险,认证也并非对未来结果的担保。

这一保留尤为重要,因为信任标识会将复杂信息压缩为简单的视觉信号。这种压缩有助于采购,但也可能掩盖范围上的重要差异。

一份证书可能覆盖某一种产品配置,而客户部署的却是另一种。它可能评估了选定工具,而买方又接入了额外的数据库、浏览器或内部服务。

底层模型也可能发生变化。供应商经常调整路由、提示词、安全系统和检索组件,却不会将每一项修改都作为新产品发布。

Agent 风险在很大程度上取决于权限。同一个助手只能建议撰写电子邮件时,与它能够自动发送该邮件时,带来的后果截然不同。

部署环境会带来更多差异。回答一般问题的客户支持 agent,与能够发放退款、更改账户信息或访问医疗记录的 agent 并不相同。

认证无法替代最小权限访问原则,该原则将每个系统限制在完成当前任务所需的权限范围内。它也无法替代监控和事件响应。

企业应保留 agent 决策、工具调用、审批和输出的详细日志。当行为变得不安全时,团队需要能够中断工作流并撤销凭证。

当错误可能造成严重的财务、法律、安全或隐私后果时,高影响力操作仍应要求人工审批。自动化带来的收益并不会消除问责责任。

另一个不确定性涉及测试有效性。AIUC 表示其使用数千种攻击组合,但单凭数量无法证明质量。

五千项重复或不现实的测试,所提供的保障不如一套规模更小、但更贴近生产环境威胁的测试集。买方需要了解覆盖范围、严重程度、通过标准和未解决问题。

他们还需要区分评估与修复。测试计划可以发现弱点,但供应商仍必须修复这些问题并验证修复效果。

AIUC 的标准按季度演进,这应有助于其应对新威胁。频繁变化也可能使不同版本标准下颁发的证书难以比较。

因此,透明的版本管理至关重要。买方应能够识别与每项结果相关的确切标准、控制措施集、测试方法和产品版本。

向前沿模型扩展带来了更大的不确定性。应用层审计围绕明确的工作流进行,而通用模型支持许多评估者无法观察到的下游用途。

模型可能在受控测试中表现良好,却在微调、工具集成或接触陌生环境后呈现不同的行为。认证必须清晰说明这些边界。

目前也尚未形成共识,认为 AIUC-1 应成为主导性的保障标准。NIST、OWASP、与 ISO 对齐的管理体系、行业组织和内部计划,都在处理这一问题中相互重叠的部分。

这种重叠未必有害。企业通常会采用多个框架,因为治理、技术测试、网络安全和监管合规回答的是不同问题。

AIUC 的成功将取决于互操作性,而不是排他性。如果证书能清晰映射到既有框架,并减少重复收集证据的工作,买方将更重视它。

该公司还应证明认证能够带来可量化的运营收益。比起单独展示客户 logo,更快的审查、更少的严重事件和更好的修复效果能更有力地支持其主张。

在此类数据成熟之前,企业应将 AIUC AI agent 认证视为一种证据来源。它应为风险决策提供参考,而不应自动作出该决策。

三项信号将表明这一模式是否奏效

接下来的考验在于,AIUC 能否将融资、知名客户和可信的理论转化为可规模化衡量的保障。

第一个信号是 AIUC 如何定义面向前沿模型的认证。公司必须说明审计边界包含什么,以及结果支持哪些部署层面的主张。

一项有用的模型评估应识别已评估的能力、访问条件、威胁假设和已知限制。它还应说明下游修改会如何影响结果。

如果 AIUC 公开清晰的边界和可重复的方法,其向上游拓展将强化私营保障的论据。模糊的模型级信任标识则会削弱这一论据。

第二个信号是来自再认证和事件的证据。当攻击、产品或标准发生变化时,季度测试应产生可见的调整。

企业应关注证书持有者是否披露重大故障并完成纠正工作。他们还应寻找测试在生产部署前发现问题的案例。

成熟的认证市场必须偶尔延迟、限制、暂停或撤销批准。从不记录有意义失败的信任标识,将难以证明其独立性。

公开摘要无需暴露敏感漏洞。但它们仍应展示评估发现严重问题的频率,以及这些问题如何影响认证决定。

第三个信号是其在真实采购和保险流程中的采用情况。客户公告表明了兴趣,但并未揭示决策过程究竟发生了多大变化。

买方应寻找证据,证明安全团队会复用 AIUC 的发现、减少重复审查,或批准此前停滞的部署。保险公司则应说明测试结果如何影响承保要求。

这对每一家考虑部署 agent 的企业都很重要。核心问题并不是证书在供应商页面上看起来是否可信。

问题在于,它的证据是否与组织实际使用的 agent、数据、权限和工作流相匹配。团队需要将这些背景与自身的知识管理、访问控制和审查流程结合起来考虑。

AIUC 的融资为其追求这一艰巨目标提供了资源。如今,公司必须证明持续测试和保险能够带来更好的决策,而不只是制造更多合规材料。

在批准某个 agent 前,应索取证书范围、未解决问题、再认证日期,以及对重大产品变更的应对方式。然后,将这些回答与实际计划运行的部署进行比较。

AIUC AI agent 认证值得关注,因为企业信任已成为具体的部署约束。它的持久价值将取决于徽章背后的证据能否保持具体、及时且具有独立可信度。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)和M-Chip Mac 。

你的 AI 工作伙伴

和 remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page