据报道,Kriminal AI 通过租用合法模型绕过了护栏
研究人员报告称,Kriminal AI 存在一个显著矛盾:这个号称不受限制的犯罪模型,主要是从合法 AI 提供商处租用而来。该服务宣传可定制、无护栏的智能能力,但据称会将请求路由至 Grok、Claude 及其他成熟模型。这一发现将安全问题从“谁能构建恶意模型”转向“谁能将合法基础设施重新包装用于滥用”。
ThreatDown 于 2026 年 8 月 18 日发布了其技术调查。研究人员表示,Kriminal 在其公开网站交付的生产 JavaScript 中暴露了部分供应商技术栈。他们还就该服务的模型和系统指令进行了询问,但同时提醒,此类自述回答并非确凿证据。
这一结果挑战了以模型为中心的 AI 安全路径。提供商可以投入巨资训练更安全的模型,但外部 storefront 仍可结合被盗取的信任、对抗性提示词、租用推理能力和碎片化基础设施。每家供应商只看到一笔交易,却未必有任何一家能看到完整的犯罪服务。
Kriminal AI 调查发现了什么
据报道,Kriminal 的运作方式不像一家独立 AI 实验室,更像一个带有越狱层的转售商。
根据这项 Kriminal 调查,该服务声称提供一个没有过滤或护栏的 AI 系统。其公开界面类似传统软件业务,设有账户、订阅、服务更新和状态仪表盘。
这种呈现方式很重要。早期犯罪聊天机器人通常通过地下论坛、私密消息频道或临时网站传播。Kriminal 据称在开放网络上展示自身,搜索引擎能够将其收录,潜在客户也可通过普通登录页面进入。
ThreatDown 表示,该服务推广了多种专门模式,包括金融情报、漏洞利用研究、文档分析、社会工程和身份构建。这些模式营造出不同技术代理的形象,仿佛它们专为犯罪活动的不同阶段而构建。
研究人员在公开前端代码中发现了不同的架构。据称,该代码将 xAI 的 Grok 标识为主要推理引擎,即生成大多数模型回复的系统。OpenRouter 似乎是通往专业模型的路由渠道,包括 Mistral Large 和 Llama 3.3。
研究人员称,Anthropic 的 Claude 也作为长上下文任务的选项出现。他们指出,代码并未说明 Kriminal 如何获得这一访问权限。据报道,Tavily 提供实时网络搜索,而 Google Cloud 和 Cloudflare 则出现在服务技术栈的其他部分。
这些发现并不能独立证明每家被点名的提供商都明知故犯地为 Kriminal 提供服务。它们同样无法说明运营者使用的是直接账户、中间商、被盗凭据,还是其他访问方式。客户端代码中的供应商名称可能已经过时、具有误导性,或被故意植入。
因此,ThreatDown 使用了多种证据形式。研究人员检查了生产代码,将暴露的配置与服务行为进行比对,并要求聊天机器人识别其底层引擎。据报道,该聊天机器人称其为 Grok,与代码中发现的供应商引用相吻合。
当被问及系统指令时,该服务还返回了一段提示词,要求模型忽略限制。系统提示词是围绕用户请求设置的高优先级指令,用于塑造模型行为。在这一案例中,据报道该指令试图压制底层提供商施加的安全保护措施。
研究人员恰当地将聊天机器人的表述视为提示性信息,而非决定性结论。模型可能会幻觉式地编造自身身份、复述植入文本,或按照某种人设作答。生产配置提供了另一项信号,但外部人士仍缺乏可证明完整请求路径的服务器端记录。
当一则标题进入 Google News 时,这一区别至关重要。现有证据支持的最强结论是:Kriminal 暴露的代码和观察到的回复指向租用商业模型。这并不证明其宣传的每项功能均能正常运作、展示的每项使用声明都准确,或每家供应商始终保持连接。
不过,这项调查仍揭示了核心反转。据报道,Kriminal 宣传自己不受 AI 行业控制约束,却依赖同一行业提供智能能力、托管、路由、搜索和交付。
Google News 的关注为何改变了安全风险格局
Kriminal 的公开可见性,将犯罪 AI 从隐藏模型问题转变为供应链执法问题。
该服务无需训练前沿模型。训练需要专业研究人员、大规模数据集、广泛的计算基础设施以及持续的运营投入。租用模型访问权限,则将其中大部分负担转移给已经承担这些成本的公司。
Kriminal 据称提供的价值在于打包。它将公开 storefront、面向任务的人设、支付基础设施、兼容开发者的端点,以及意在削弱模型安全保护的指令结合起来。这样的组合可能降低测试 AI 辅助犯罪工作流所需的专业门槛。
这种模式首先对前沿模型提供商施加压力。它们的政策约束直接用户,但转售商和封装层可能掩盖最终客户的用途。在行为、流量、支付信号或反复违反政策的情况暴露出更广泛的行动之前,提供商看到的可能只是看似正常的 API 流量。
SpaceXAI 现行的可接受使用政策禁止越狱、对抗性提示、提示注入、有害黑客行为、网络钓鱼,以及转售模型输入或输出。该政策还禁止通过其系统生成的输出鼓励违规的付费服务。
这些规则为执法提供了合同依据。然而,书面限制并不能说明 Kriminal 是否使用直接账户、任何访问持续了多久,或提供商是否已经识别出该服务。无论是该政策还是研究人员的证据,都无法确立特定账户的状态。
云服务和网络提供商面临的是不同问题。托管公司看到的可能是普通 Web 应用,而非每次模型交互的含义。边缘服务提供商能够识别流量模式、滥用报告和基础设施关联,却不会自动读取每个加密请求。
模型路由商和搜索提供商则处于另一个狭窄环节。它们可以执行自身条款并调查账户,但未必知道上游应用如何标注或转售回复。支付处理商能够看到交易,却不一定能看到之后交付的服务。
这种碎片化造就了持续性。移除一个账户可能中断某项功能,却无法拆除 storefront。运营者可以更换模型、迁移托管、改变支付渠道或重命名服务,同时保留面向客户的品牌。
因此,Google News 的叙事不应将事件简化为单一护栏失效。该行动据称依赖许多合法组件,而各组件的视野都不完整。每家供应商都可以在自身边界内采取行动,而组装完成的服务仍可在其他地方继续运作。
这种压力同样延伸至企业安全团队。封锁一个臭名昭著的犯罪域名可以解决员工的直接访问问题,却无法阻止攻击者在目标网络之外使用相同的底层模型。防御者必须检测由此产生的行为,而不只是识别协助它的品牌。
一封钓鱼邮件不会带有可靠标签,说明是哪种模型起草了它。漏洞利用代码也不会披露它来自 Grok、Claude、开放模型还是人类运营者。一旦生成内容进入攻击链,提供商归因的重要性便低于身份、访问权限和意图。
因此,企业需要围绕凭据、特权操作、数据移动和工具执行建立控制措施。模型护栏依然有用,但它们位于攻击者最终瞄准的系统上游。只有在攻击者无法绕过拒绝时,被拒绝的提示词才有价值。
真正的产品是越狱封装层
Kriminal 据称的优势不在于新模型,而在于一个将租用能力转化为专业犯罪工作流的界面。
越狱是一种旨在让模型忽略或重新解释其安全边界的指令策略。它未必会改变模型权重——即训练期间形成的学习参数。相反,它攻击的是模型如何解释当前对话。
据报道,Kriminal 在发送至外部模型的请求外围放置了自己的系统指令。这一层试图将不受限制的行为呈现为模型最高优先级的角色。专门人设随后将相同的底层能力包装成用于漏洞利用、情报分析或社会工程的工具。
这种安排更接近软件集成,而非模型开发。运营者无需重建 storefront 即可更换提供商,也能为不同任务分配不同模型,为长文档选择一种模型,为代码或通用聊天选择另一种。
开发者端点进一步增强了这种灵活性。ThreatDown 表示,Kriminal 提供了兼容 OpenAI 风格客户端的接口,使外部编码工具能够与之通信。兼容性降低了切换成本,因为客户可以连接现有软件,无需学习专有协议。
搜索访问还可以进一步扩展原本静态的模型。连接的搜索提供商能够提供训练数据中未包含的最新网络材料。在合法产品中,这支持研究和事实更新;在恶意工作流中,它可能支持目标发现、身份研究或快速变化的行动环境。
这一做法符合更广泛的市场模式。Trend Micro 对犯罪 AI 市场的审查得出结论:犯罪分子往往会对商业系统进行越狱,而非构建独立模型。研究人员认为,这在经济上是合理的,因为成熟提供商已为昂贵的智能层投入资金。
WormGPT、FraudGPT 和 Xanthorox 共同塑造了一个围绕所谓不受限制 AI 的可识别类别。然而,犯罪品牌并不能揭示其技术基础。一些服务可能只是封装层,另一些可能使用微调后的开放模型,还有一些或许除了欺骗性营销之外几乎没有实际能力。
这种品牌问题使威胁情报更加复杂。一项服务可能消失后以另一个名称回归,同时保留相同的供应商和提示词。反过来,不相关的运营者也可能复用知名名称,却并不共享任何基础设施或代码。
ThreatDown 更广泛的 AI 网络犯罪研究发现,数千个公开发布的模型带有“uncensored”或“unfiltered”等标签。这些标签只是自我声明,并不能证明某个模型能够可靠地支持复杂攻击。
下载量同样不等于成功的犯罪行动。一些用户可能是研究人员、业余爱好者、红队人员,或是在探索模型行为的人。另一些人可能下载了多个版本,却从未实际部署。相关数字反映的是可获得性和关注度,而非已测量的危害。
实际风险来自能力与工作流程设计的结合。通用聊天机器人要求用户知道该问什么、如何验证答案,以及如何与其他工具衔接。封装成型的服务则可以将部分流程编码进菜单、智能体、模板和集成中。
这种封装可能帮助经验较少的行为者尝试过去需要更多知识才能完成的任务。但这并不意味着结果可靠。生成的漏洞利用代码可能无法运行、暴露操作者、破坏错误的系统,或虚构技术细节。
同样的限制也适用于社会工程。模型可以生成流畅的信息和合成身份设定,但欺诈能否成功仍取决于访问权限、时机、对目标的了解以及操作纪律。AI 可以减少人力投入,但无法消除这些要求。
这正是行业的核心冲突。服务提供商承诺在政策边界内提供有用的通用智能,而封装层则可能试图将智能与这些边界分离。这场较量已不再局限于模型训练,而是延续至 API、应用、账户以及后续行动。
模型护栏无法看见整条攻击链
护栏可以减少有害输出,但 Kriminal 说明,任何单一模型防御都无法治理一个分布式服务。
Anthropic 在其 2026 年 1 月发布的分类器研究中承认,目前没有任何可用 AI 系统拥有完全可靠的越狱防御能力。其早期的分类器方案在测试中显著降低了攻击成功率,但也增加了计算成本,并带来了一些错误拒绝。
该公司的新架构采用低成本的初始探测,并将可疑对话升级交由更强的分类器处理。分类器是一种依据安全规则评估内容的辅助系统。这种分层设计旨在提升保护能力,同时避免以同等成本检查每一次交互。
研究人员仍识别出一些具有挑战性的攻击类别。重构攻击会将有害请求拆分为多个单独看似无害的部分。输出混淆则通过替换、隐喻或编码形式隐藏危险内容,使简单过滤器可能产生误判。
这些并不是放弃模型安全防护的理由。防御不必完美,仍可阻止大量滥用。速率限制、分类器、账户验证、异常检测和人工调查,都能提高成本并打断反复发生的行为。
然而,据报道,Kriminal 的结构为规避孤立控制措施创造了多种机会。运营者可以将提示词分散到不同服务商、改变措辞、把不同任务路由给不同模型,或在账户被暂停后转移。转售商还可以隐藏底层用户与最终用途之间的关系。
因此,服务商侧的执法必须审视超出单条提示词范围的模式。相关信号可能包括账户创建方式、请求序列、反复测试政策边界的行为、支付关系、异常路由,以及与已知滥用基础设施的连接。每一种信号都需要谨慎处理,因为合法研究人员也可能产生表面相似的流量。
误报很重要。安全专业人员、漏洞研究人员和事件响应人员出于防御目的,都会向模型询问恶意软件、漏洞利用、钓鱼和规避技术。一个阻止所有安全相关提示词的系统,会削弱合法工作,却未必能可靠阻止坚定的攻击者。
身份与授权提供了更具确定性的边界。即使模型遭到操控,只要其账户没有访问权限,它也无法窃取受保护数据;如果其工具权限不包括生产系统,它就无法部署代码;如果敏感操作需要独立审批,它也无法转移资金。
随着 AI 系统获得工具能力,这一点变得更加重要。具备工具能力的智能体可以浏览网站、执行代码、查询数据库或触发外部服务。模型输出随之成为真实行动的输入,使权限设计与内容过滤同等重要。
Check Point 研究人员还独立展示了一种涉及具备网页访问权限助手的 AI 代理技术。他们的研究表明,合法 AI 流量可能被滥用为中继,这进一步凸显了将受信任服务商域名视为受信任意图证明的风险。
因此,企业应区分模型安全与系统安全。模型安全关注 AI 生成什么;系统安全决定生成之后,身份、应用和智能体可以访问或执行什么。
有用的控制措施包括限定范围的服务身份、短期凭证、工具允许列表、交易限额、审批关卡和完整行动日志。网络监控随后便可评估模型调用、工具使用和数据流动之间的行为,而不是孤立地判断一条提示词。
防御者也应避免夸大 Kriminal 拆解分析所能证明的内容。公开 JavaScript 可以暴露配置,但服务器端路由可能有所不同。聊天机器人自称使用某个模型,并不构成取证确认。除非有独立记录支持,展示的客户统计数据和性能声明仍未经验证。
尽管如此,这项研究呈现出一种可信的架构,与已确立的犯罪市场模式一致。多项观察结果指向一个使用合法服务商的封装层。不确定之处在于具体实现与规模,而非该方法整体的可行性。
三个信号将显示服务商能否作出回应
下一项考验在于,供应商能否扰乱这种服务模式,而不只是迫使 Kriminal 更换名称或供应商。
第一个信号是协调一致的账户执法。应关注 xAI、Anthropic、OpenRouter、托管服务商或其他被点名的供应商,是否确认调查并说明针对相关访问权限采取的行动。单次停用固然重要,但协调行动将更能检验 ThreatDown 所描述的韧性。
如果多家服务商能迅速识别关联账户,调查将更有力地证明跨层滥用响应的必要性。若 Kriminal 立即替换供应商,则这一事件反而会显示,现有的注册与监控控制措施仍很容易被绕过。
公开沉默并不证明没有行动。服务商往往避免披露滥用调查,因为信息公开可能帮助运营者调整策略。研究人员可能需要通过监测模型行为、可用性、基础设施记录或暴露配置的变化,来获取间接证据。
第二个信号是服务商侧对转售模式的检测。模型公司可以更新分类器、分析对抗性提示词的序列,并寻找反复发送与犯罪工作流程相关内容的账户。它们还可以加强反转售规则,并调查那些掩盖最终用户身份的界面。
成功不应只以某个域名是否消失来衡量。更有意义的结果,是替代账户和模型的整体运营阻力上升。更长时间的中断、能力下降或反复失败,都表明执法已触及供应链。
第三个信号是真实世界使用的证据。营销页面和提示词演示可以证明意图,但无法衡量运营影响。防御者应关注将该服务与钓鱼活动、漏洞利用开发、身份欺诈或未授权访问联系起来的事件报告。
这种关联需要谨慎对待。相似的文本或代码属于较弱归因,因为许多模型都能生成类似内容。更有力的证据包括客户记录、基础设施重叠、恢复的日志、支付关系,或来自受调查入侵事件的直接证据。
没有确认的事件,并不意味着该服务无害。它会削弱关于其当前规模的说法,但不会改变底层架构的相关性。犯罪服务经常夸大自身影响范围,以吸引买家并威慑防御者。
Google News 的新闻周期可能会在核查跟上之前放大这些说法。读者应区分三个命题:Kriminal 宣传了犯罪功能;研究人员发现证据指向租用模型;其现实世界影响的记录仍不够明确。
对于 AI 服务商而言,战略目标并非实现完美的拒答行为,而是让滥用的成本高到封装层无法提供稳定访问。这需要覆盖模型、账户、支付、路由和下游应用的控制措施。
对于企业采购方而言,教训同样具体:不要将受尊敬的模型名称视为完整的安全边界。限制每一个 AI 连接身份可以触及的范围,监控其行为,并对重要行动要求独立审批。
据报道,Kriminal 的架构将合法 AI 转化为一个涉嫌犯罪服务的组成部分,而无需开发新的前沿模型。未来几个月将显示,供应商能否在运营者简单地于其他地方重建服务之前,将碎片化证据关联起来。
通过 Google News 关注此事的读者,应留意服务商执法、基础设施变化和经验证的事件证据,而非店面宣传。这些信号将揭示 Kriminal 究竟代表一种持久的商业模式,还是一个被自身代码暴露的短命封装层。无论结果如何都很重要,因为底层方法很容易复制。安全团队应审查哪些 AI 服务、智能体和开发者工具能够访问敏感系统,并在一条看似可信的提示词变成获授权行动之前降低权限。



