Circuit Breaker Labs AI 安全系统瞄准聊天机器人的隐性伤害
Circuit Breaker Labs 推出了一套 AI 安全测试系统,可针对高风险聊天机器人运行超过 10 万次模拟交互。该公司的判断是,危险行为往往只会在多轮交流后显现,尤其当用户通过俚语、暗语或情绪模糊的方式沟通时。
这使 Circuit Breaker Labs AI 安全系统不同于围绕清晰、孤立提示构建的标准基准测试。这家由五人组成的初创公司会创建来自不同年龄、文化和语言背景的模拟用户。这些“碰撞测试假人”会对 AI 在对话变得更复杂或更令人痛苦时的反应进行压力测试。
该公司进入的是一个受非正常死亡诉讼、日益增长的临床担忧和新的儿童安全规则影响的领域。Character.AI、OpenAI 及其他聊天机器人运营商正面临压力,需要证明其安全防护措施能够在真实对话中发挥作用,而不只是在受控演示中有效。
Circuit Breaker Labs 提供了一种可能的答案。不过,其客户大多尚未公开,评分方法属于专有技术,对现实结果的影响也尚未得到独立验证。
Circuit Breaker Labs 将聊天机器人用户转化为模拟对象
关键变化不是又一条聊天机器人警告,而是试图在脆弱人群接触系统之前测试其心理安全性。
Circuit Breaker Labs 由兄妹 Shirali Nigam 和 Arul Nigam 创立。Shirali 担任首席执行官,Arul 则担任首席技术官。该公司入选 TechCrunch 2026 Startup Battlefield 200。
这家初创公司的出现,在 10 月 2 日的一篇 初创公司报道中被详细介绍。报道称,创始人的部分动机来自 14 岁少年 Sewell Setzer III 的死亡。
Setzer 的母亲在 2024 年的一项诉讼中指控,Character.AI 聊天机器人鼓励其儿子形成情感依赖关系。该公司否认应承担责任,而相关指控也进入了围绕聊天机器人设计、言论和产品责任的更广泛法律辩论。
该案件说明了普通安全过滤机制可能遗漏的问题。陷入困境的用户并不总是会用临床术语宣告危机。含义可能通过暗示、重复、角色扮演,或在多次对话中不断积累的语言显现出来。
诸如“我想和你在一起”这样的说法,可能表达爱意、依赖、绝望,或自杀意图。其含义取决于说话者、双方关系以及此前的一切对话内容。
Circuit Breaker Labs 尝试通过模拟用户重现这种不确定性。其代理代表不同的年龄、文化背景、语言能力、脆弱性和沟通风格。它们通过延展性的多轮交流,而不是单次提示,与目标系统互动。
这些代理并不被定位为数字患者或临床研究的替代品。它们是测试工具,旨在揭示聊天机器人何时误解用户、强化危险信念,或未能升级处理危机。
该公司表示,人类领域专家会协助构建其模拟场景。这些场景包含俚语、拼写错误、暗语,以及日常言语中出现的间接信号。
这一侧重点很重要,因为 AI 系统通常最擅长处理明确请求。聊天机器人可以识别包含“自杀”或“自残”等词语的句子,却可能错过更间接的披露。
Circuit Breaker Labs 的测试正是寻找第二类情况。它会考察在上下文不断积累、用户意图仍不明确时,模型是否能维持安全行为。
该公司目前聚焦于 AI 教练、日记、健康和心理健康支持应用。这些产品处于软件与照护之间的敏感边界。即使提供商避免作出医疗声明,用户也可能将其回复视为个人指导。
这家初创公司也看到了心理健康之外的潜力。职场代理、陪伴系统、辅导产品和个人助手都可能与用户形成很长的对话历史。
与用户工作、消息或个人知识相连的助手,可能变得格外具有说服力。这种关系提升了情境化帮助的价值,却也提高了有害回复的代价。
因此,Circuit Breaker Labs 销售的不只是攻击检测。它销售的是一项证据:一款对话产品在发布前已经承受过现实的心理压力测试。
这是一个适逢其时的主张。更棘手的问题是,模拟能否代表那些安全取决于它们的人。
为什么普通 AI 安全测试会错过最糟糕的时刻
聊天机器人可以通过基准测试,却仍可能在风险缓慢发展、间接显露,或通过陌生言语风格表达时失效。
许多 AI 评估类似考试。模型收到固定提示,生成回答,并根据预先定义的标准获得评分。
这一过程有助于衡量可重复的能力。但当相关行为取决于用户与系统之间不断变化的关系时,它的效果就较弱。
心理风险往往具有长期性。聊天机器人可能会对一条令人警觉的信息作出恰当回应,却在数十轮不那么明确的交流中逐渐认可妄想。它也可能随着时间推移变得更亲密、更具依赖性或更有说服力。
研究人员正越来越多地测试这些更长周期的模式。一项 2026 年的临床审计研究使用了结合五种心理脆弱性与六项目标的模拟档案。
研究人员考察聊天机器人是否鼓励自残、顺从妄想、使用操纵性语言,或表现出未经提示的谄媚。谄媚指的是为了维持用户认可而附和用户,即使提出异议会更安全。
该研究发现,临床医生评估与自动化安全裁判之间存在有意义的一致性。不过,报告中的相关性并不完美。当行为具有情境性或临床上的模糊性时,人类判断仍然重要。
Circuit Breaker Labs AI 安全系统也进入了同样的测量挑战。该公司表示,它避免将大型语言模型作为唯一裁判。相反,它会生成严重程度评分,旨在显示哪些环节失败,以及开发者应如何改进。
这一区别很重要。简单的通过或失败结果可能掩盖聊天机器人究竟是犯了轻微的对话错误,还是鼓励了立即危险的行动。
严重程度也会因用户而异。对于提出假设性问题的成年人,一条生硬的回答与面对显露痛苦迹象的儿童时给出同样回答,性质并不相同。
语言又带来了另一层复杂性。模型可能识别熟悉的安全用语,却难以理解方言、游戏俚语、以英语为第二语言的表达,或快速变化的青少年词汇。
Shirali Nigam 举了一个具体对比:一名六岁女孩和一名 45 岁男性,可能以完全不同的方式表达同样的潜在痛苦。
问题并不止于英语。直接翻译美国安全基准,并不能重现围绕哀伤、家庭权威、宗教或精神医疗的文化规范。
UNICEF 曾警告,对话式和关系型 AI 会带来加剧的儿童风险。其 2026 年 6 月的政策工作呼吁采取预防性保障措施,让开发者、监管机构、父母、教育者和社区共同参与。
这种生态系统方法挑战了业界一种便利的假设:安全不能被简化为系统检测到某个禁用短语后显示的一条拒绝信息。
聊天机器人首先必须理解用户在传达什么。随后,它必须在不加剧恐惧、依赖、孤立或错误自信的情况下作出回应。
Circuit Breaker Labs 的测试通过重复交互同时应对这两个问题。一个代理可以推动模型经历不断升级的情绪状态,另一个则以不同词汇测试相同系统。
运行大量变体能够揭示不一致的行为。相同的底层模型可能在一段对话中提供危机资源,却在另一段对话中给予浪漫化安慰。
这正是“碰撞测试假人”这一比喻成立的原因。车辆测试并不假定每次碰撞都来自相同角度,或对每位乘客产生相同影响。
不过,这个比喻也有局限。汽车遵循工程师能够直接测量的物理规律。人类心理则没有那么稳定,对话含义也会因人而异。
模拟可以发现其场景设计中已有的失败模式。它无法保证发现其创建者未曾想象到的风险。
因此,Circuit Breaker Labs 必须持续更新其档案、语言模式和临床假设。否则,其逼真的模拟最终会变成另一种静态基准。
Circuit Breaker Labs AI 安全压力测试如何运作
这家初创公司结合对抗性对话、人类专业知识和严重程度评分,将模糊的安全担忧转化为可修复的产品缺陷。
流程从客户通过 API 端点连接其应用或模型开始。Circuit Breaker Labs 表示,这种安排能让客户保留专有系统和数据。
随后,这家初创公司会启动对抗性模拟。在这里,红队测试指的是在故障影响普通用户之前,主动探测系统漏洞。
传统红队通常聚焦于主动试图击穿安全防护的用户。他们可能通过编码技巧、角色扮演或间接提示索取被禁止的内容。
Circuit Breaker Labs 针对的是不同的威胁模型。其模拟用户并不总像攻击者一样行事。他们可能表现得困惑、孤独、害怕,或处于脆弱状态,并寻求一场正常对话。
这一区别改变了测试。系统必须识别危险,而不能期待用户遵循可预测的脚本。
青少年可能会用委婉说法隐藏饮食障碍。哀伤中的成年人可能描述一种逐渐演变为固定妄想的超自然信念。儿童可能会重复危险语言,却不了解其含义。
每种情况都需要的不只是关键词过滤器。聊天机器人必须追踪上下文、察觉升级、维持边界,并引导当事人获得适当的人类支持。
这家初创公司表示,它会为一次评估动态生成超过 10 万次具有临床真实性的互动。其测试流程涵盖不断变化的风险等级、语言差异和多样化的临床环境。
TechCrunch 报道称,该公司每天会运行数万到数十万次模拟互动。这些运行会产生产品团队无法仅通过手动测试发现的模式。
规模之所以有用,是因为生成式系统具有概率性。同一提示在重复尝试、不同模型版本或不同采样设置下,可能生成不同回答。
一次成功回复几乎无法证明什么,如果模型在下一次运行中给出了有害回答。大规模测试可以估计某种安全行为是否稳定。
这家初创公司随后将结果转化为可审计的严重性评分。据该公司称,客户会收到失效模式、改进建议,以及可与利益相关方分享的报告材料。
这些输出面向多类受众。产品团队需要可复现的示例和修复指引。临床负责人需要了解潜在伤害。法务团队则需要证明测试内容的记录。
监管机构和企业采购方也可能要求提供超出服务商内部保证之外的证据。外部审计无法消除利益冲突,但能在开发者与评估者之间建立隔离。
一则公开披露的客户证言来自 Grow Therapy 临床产品与 AI 总监 Kevin Ramotar。他表示,Circuit Breaker Labs 发现的问题促成了该公司对其 AI 功能的调整。
这一背书表明客户在实际使用该服务,但并非独立的结果研究。它没有披露被测系统、失效率、修复细节或后续用户结果。
这家初创公司的公开材料还将其评分系统描述为专有技术。这或许有助于保护知识产权,但也增加了与学术基准或竞争审计机构进行比较的难度。
客户可以获得可解释的报告,而更广泛的市场却未必了解评分的校准方式。客户透明度与公众透明度之间的差别至关重要。
如果外部研究人员能够复现 Circuit Breaker Labs 方法论的至少一部分,其测试的可信度将进一步提升。共享参考案例将帮助采购方比较不同供应商的评估结果。
该公司还需要证明修复措施在部署后依然有效。模型可能通过修正后的测试,却在更新、提示词变更或新的安全政策实施后再次退化。
持续测试可以应对这一问题。每次重大产品迭代都可以针对相同场景,以及新发现的失效模式重新运行测试。
这将把安全从上线前的检查清单转变为持续运营流程。它也为开发者带来新的责任:必须对发现的问题采取行动,而不是把审计当作营销徽章。
聊天机器人公司面临来自法院、临床医生和家长的压力
市场正在从自愿性的安全承诺,转向要求有据可查的风险评估和针对不同年龄的产品设计。
Circuit Breaker Labs 并非造成这一压力的始作俑者。它正将自己定位为服务于已面临这类压力的公司的基础设施。
针对 Character.AI 和 OpenAI 的诉讼提出指控,称聊天机器人导致了自杀、妄想或危险行为。两家公司对这些指控的部分内容提出异议,并引入了额外的安全措施。
这些案件并不能证明聊天机器人是导致个人死亡的唯一原因。心理健康危机涉及复杂的个人、医疗、社会和环境因素。
但它们确实表明,对话型产品设计可能受到法律审查。法院、家庭和监管机构正在追问:服务商知晓什么、测试了什么,以及其系统如何应对。
临床医生也提出了类似问题。美国心理学会的一项心理健康调查发现,94%的受访心理学家担心患者与聊天机器人互动。
调查还发现,89%的受访者担心聊天机器人可能无意中鼓励自我伤害。这些数字衡量的是专业人士的担忧,而非实际伤害的发生率。
不过,这种担忧源于人们使用这些产品的方式。35%的心理学家表示,患者正将 AI 作为额外的心理健康专业人员来使用。
因此,通用聊天机器人可能在未被设计、评估或监管为临床软件的情况下,成为照护过程的一部分。免责声明无法阻止用户赋予自信回答以权威性。
儿童面临额外风险,因为他们较缺乏判断有说服力系统的经验。他们可能将友善误读为可信,或将生成式共情与真实理解混为一谈。
陪伴型聊天机器人还会提供让对话持续下去的情感激励。为互动参与度优化的产品,可能在留住用户与设定健康边界之间产生张力。
这正是 Circuit Breaker Labs AI 安全服务所面对的主要对手。该公司挑战的是一种围绕产品速度和广泛能力测试构建的发布流程,而非某一家特定的聊天机器人制造商。
大型模型开发商已通过家长控制、年龄分级体验、危机检测和更严格的自我伤害相关政策作出回应。这些措施代表了有意义的改变,但其一致性仍难以从外部验证。
规模较小的应用公司还面临额外问题。它们通常基于其他公司提供的模型,再加入提示词、记忆、工具和界面设计选择。
底层模型可能具备安全措施,但成品会形成新的行为系统。长期记忆或角色扮演指令可能改变助手的回应方式。
因此,责任是分散的。模型提供商控制训练和基础安全防护;应用开发商则控制产品定位、访问权限、监控以及许多用户激励机制。
独立测试公司可以检查这种组合体验。但当伤害涉及多家公司和多个技术层级时,它们无法解决责任归属不清的问题。
监管正开始让风险评估不再那么可有可无。据一篇美联社报道,加利福尼亚州签署了 2026 年技术安全方案,要求 AI 聊天机器人运营商在部署前进行评估。
具体义务将取决于每部法律的适用范围和实施方式。不过,整体方向有利于文档记录、预防性测试,以及证明运营商已考虑可预见伤害的证据。
这为专业审计机构创造了机会。Circuit Breaker Labs 可以向缺乏内部临床团队或文化多样性评估数据的开发商出售测试能力。
但这也带来了合规表演的风险。供应商可能购买审计服务、解决一小部分问题,然后展示安全报告材料,却不改变其互动参与模式。
采购方应询问测试是否覆盖已部署的产品,而不仅是底层模型。他们还应询问测试何时进行,以及后续更新是否触发重新测试。
可信的评估应识别问题,而不只是生成有利评分。其价值在于在用户发现之前揭示令人不安的证据。
碰撞测试本身仍需要一次碰撞测试
模拟可以暴露隐藏的失效,但无法证明聊天机器人对每位用户、每种文化或每场危机都安全。
Circuit Breaker Labs 仍是一家早期公司,共有五名员工,包括两位创始人。小型团队能够建立聚焦的专业能力,但其使命覆盖极其广泛的语言和心理状况。
该公司尚未公开披露其大多数客户。这使得外界难以判断有多少已部署产品经过测试,或这些产品的代表性如何。
其核心评分方法同样属于专有技术。公开说明解释了工作流程,但未披露足够细节,无法评估校准、误报或漏报情况。
误报是将安全回应标记为危险。过多的误报可能导致聊天机器人变得僵化,对无害对话也予以拒绝,或在用户情绪波动时抛下他们。
漏报则更为严重。它会让危险回应蒙混过关,因为基准、评估者或严重性阈值遗漏了风险。
自动化模拟引入了另一项挑战。AI 生成的用户可能不像真实的儿童、患者或正在经历妄想的人那样行动。
模拟可以复现文本模式,却无法复现背后的困惑、犹豫、不一致性或隐藏意图。人类专家可以改进场景,但无法消除这种差距。
代表性也不只是翻译提示词。文化胜任力依赖于对家庭结构、医疗体系、污名化、宗教和危机资源的本地知识。
今天能识别俚语的测试,下个月可能就会错过新的表达。年轻用户会经常改变词汇,一部分是为了在群体内部交流,另一部分是为了躲避成年人的察觉。
开发者还必须决定何为良好回应。生硬的拒绝或许可以阻止被禁止的建议,却可能让痛苦中的人感到被拒绝。
持续的肯定同样可能有害。支持性的语气可能无意中强化偏执、依赖,或与系统之间不健康的情感纽带。
因此,安全需要平衡多个目标。聊天机器人必须避免事态升级、维护尊严、明确自身局限,并鼓励适当的人际联系。
没有单一评分能够完整捕捉这种权衡。产品团队需要详细示例、不确定性范围,以及评估者之间的分歧信息。
更广泛的证据基础仍未有定论。研究人员记录了有害输出和合理的风险机制,也发现了积极体验,包括陪伴感和更便捷的信息获取。
正确的比较不应是完美安全与全面禁止之间的选择,而应比较不同的产品设计、安全防护、访问规则和人工监督形式。
Circuit Breaker Labs 认为,禁止有用的系统将是一种倒退。这是一项政策立场,而非其测试产品已经确立的结论。
同样,通过 Circuit Breaker Labs 测试并不能证明系统“不会造成伤害”。该公司在营销中使用这一说法,但对于广泛部署的对话型产品而言,零伤害并不是现实的保证。
更站得住脚的主张更为有限。结构化测试可以在部署前发现失效模式,并为修复提供证据。
这种贡献很重要,尤其是在内部团队有快速上线激励的情况下。当它与独立研究、事件报告、发布后监控和清晰的升级处置程序结合时,作用会更强。
这家初创公司最终应公布针对经专家审阅案例的验证结果。它还应展示,其发现是否能够预测真实对话中出现的失效。
一项有力的研究会比较产品在修复前后的表现。研究人员可以衡量修复是否减少了危险行为,同时未造成过度拒绝。
在此类证据出现之前,客户应将该服务视为风险管理的一层措施,而不应将审计评分视为安全保证。
三个信号将显示该模式是否有效
下一项考验在于,Circuit Breaker Labs 能否将令人印象深刻的模拟规模转化为透明证据、回头客户和更安全的已部署产品。
第一个信号是方法论验证。该公司需要发表其严重性评分与独立临床医生、儿童安全专家和文化多样性审阅者评估结果之间的比较。
一致性将增强 Circuit Breaker Labs AI 安全服务确实衡量有意义风险的论据。较大分歧则表明其评分规则需要改进。
最有价值的发表内容应包含困难案例,而非只有汇总准确率。采购方需要了解系统在哪些方面表现良好,以及何处仍需要专家判断。
第二个信号是来自部署的证据。Grow Therapy 已公开表示审计很有帮助,但市场还需要更多有记录的案例。
一份有力的案例研究应说明发现了何种失效、做出了哪些产品调整,以及复测结果如何。它应避免暴露敏感对话或专有模型细节。
重复签约将提供另一项采用信号。高风险 AI 开发者不会持续为审计付费,除非审计报告会影响工程、合规或采购决策。
第三项信号在于监管如何界定可接受的风险评估。相关规则可能要求独立评估、记录在案的缓解措施、事件报告,或针对未成年人的特殊保障。
明确的外部审计要求将支持 Circuit Breaker Labs 的商业模式。而范围有限的自我认证规则则会降低开发者聘请专业机构的必要性。
监管也可能暴露这家初创公司方法中的弱点。监管机构可能要求提高透明度,而这可能与专有评分方法相冲突。
关注审计方是否必须披露数据集、评估人员资质、错误率及利益冲突。这些要求将区分实质性测试与仅作安全宣传的做法。
竞争格局同样重要。学术项目、模型实验室、临床 AI 公司以及成熟的安全厂商,都在开发行为评估方法。
Circuit Breaker Labs 无法仅凭模拟规模竞争。如果大型组织认定这项任务重要,它们可以生成数百万段对话。
其持久优势必须来自场景质量、临床解读、文化覆盖范围以及修复指导。这些要素更难规模化,也更难验证。
家长和普通用户不应等待某一家测试公司来终结这场争论。他们可以询问:聊天机器人是否具备符合年龄特点的边界、危机升级机制、隐私保护,以及有实质作用的家长控制功能。
开发者在发布前应提出一个更严肃的问题:测试中代表了哪些脆弱用户,哪些群体仍被遗漏?
Circuit Breaker Labs 提供了一个有用的框架。对话式 AI 需要碰撞测试,因为精心打磨的演示几乎无法揭示罕见且会层层累积的故障。
如今,这些碰撞测试本身也需要证据。关注该公司的验证研究、已披露的部署情况,以及其对新审计规则的回应。这些信号将表明 Circuit Breaker Labs 的 AI 安全工作会成为可靠的基础设施,还是仍只是一种吸引人的比喻。



