top of page

OpenMythos:有人逆向工程了 Anthropic 最危险的 AI。它在两周内获得了 10,000 个 GitHub 星标。

Anthropic 决定不公开发布其最强大的模型 Claude Mythos,因为内部测试发现该模型能够自主发现所有主流操作系统和浏览器中的零日漏洞。该决定于 4 月公布,模型被锁定在 Project Glasswing 内——这是一个由包括 Apple、Google 和 Microsoft 在内的十二家组织组成的严格审查联盟。两周后,一位名叫 Kye Gomez 的 22 岁开发者在 GitHub 上发布了 OpenMythos:一个完全基于公开研究论文从零开始重建的 Mythos 架构推测版本。该仓库没有训练权重、无法访问 Anthropic 的专有系统,也与该公司无任何官方关联。但它已获得超过 10,000 个 GitHub stars。

这些 stars 并非衡量项目准确性的指标,而是衡量当你告诉 AI 社区某个模型因过于危险而无法发布时会发生什么。

OpenMythos 究竟是什么

Gomez 花了数周时间阅读所有能找到的关于循环 Transformer 架构、推理时扩展以及研究人员从 Claude Mythos Preview 中报告的行为模式的公开论文。他的核心假设是 Mythos 是一个 Recurrent-Depth Transformer (RDT)——有时也称为 Looped Transformer——而非传统的堆叠层架构。

这一区别很重要。标准 Transformer 模型通过添加更多按顺序堆叠的独特层来增加深度。每层处理输入一次,然后传递给下一层。Recurrent-Depth Transformer 则使用较小的层集合,对同一输入运行多次。深度来自重复而非累积。类比来说,这相当于依次咨询二十位不同专家,还是反复咨询同一位专家二十次直到答案收敛。对于受益于迭代优化的推理任务,循环方法可以用更小的参数量达到或超越更深的固定架构。

OpenMythos 将其实现为三个功能块:Prelude(标准 Transformer 层,运行一次)、Recurrent Block(一组层运行 N 次,N 可按位置变化)和 Coda(标准 Transformer 层,运行一次)。Parcae,一篇由 UCSD 和 Together AI 于 2026 年 4 月发表的论文,为 RDT 假设提供了主要技术支持:一个 7.7 亿参数的 Parcae 模型在标准基准测试中达到了 13 亿参数标准 Transformer 的质量。

OpenMythos 附带方程、引用和礼貌声明,说明其与 Anthropic 无关。代码可运行。没有权重。它是一座有平面图而无材料的建筑,基于建筑检查员从外部推断的内容。

Anthropic 锁定原版的原因

理解 OpenMythos 的重要性,需要了解 Anthropic 选择不发布 Mythos 的原因。

Claude Mythos 的 system card 记录了内部测试期间发生的情况。该模型在被指示查找安全漏洞时,识别出数千个零日缺陷——所有主流操作系统和主流网络浏览器中此前未知的软件弱点。该模型能够构建多步骤攻击链:不仅能发现漏洞,还能设计利用该漏洞的一系列操作。system card 引用了一个 32 步网络攻击序列作为记录的例子。

Anthropic 的结论是,无法在不从根本上降低模型推理能力的情况下选择性地禁用其网络安全能力。让 Mythos 发现软件缺陷的特性,与让它跨领域良好推理的特性是相同的。你无法关闭其中一项而不影响另一项。发现零日漏洞的模型与帮助研究人员综合复杂文献的模型是同一个模型。

Project Glasswing 是折中方案。十二家组织——均具备成熟的安全基础设施和问责机制——获得对 Mythos 的受控访问,用于防御目的。Anthropic 承诺提供高达 1 亿美元的使用额度,并向开源安全组织直接捐赠 400 万美元。逻辑是:在此能力水平下,攻击性网络安全工具的唯一负责任用途是先于他人发现漏洞并修复它们。

这就是 OpenMythos 出现的背景。Anthropic 决定这些能力对于无限制发布而言过于危险。一位开发者决定从公开信息中重建架构,以了解这些能力可能基于什么。

10,000 个 stars 的含义

Gomez 在 X 上发布关于 OpenMythos 的线程,解释了其架构。他后来写道,他“从未料到这篇帖子会如此爆火”,该项目原本只是一个研究产物,而非公开声明。该仓库的 stars 积累速度超过了 AI 领域大多数蓄意病毒式发布。

这一速度反映了特定需求。当一个前沿模型因安全原因被锁定,AI 社区通常不会接受锁定作为对话的终结。Meta 的开源 Llama 模型部分正是因为社区想要被 API 限制的内容而构建。Stable Diffusion之所以成为主导,部分原因在于它向图像生成社区提供了 DALL-E 曾使其无法获取的内容。OpenMythos 是架构上的等价物:不是能力,而是蓝图。

关键区别在于,即使 Gomez 的架构假设正确,OpenMythos 也不会转移 Mythos 的能力。权重——编码模型所学一切的训练参数——并不在此。一个没有权重的正确架构重建是一张无人能进入的领土地图。你可以精确复现 Recurrent-Depth Transformer,用足够的算力和数据从头训练,并可能构建具有类似架构属性的东西。但那是一个多年、数十亿美元的研究项目,而非 GitHub 克隆。

因此,安全担忧并非 OpenMythos 会立即启用危险能力。而是该项目展示了有动机的开发者能多快将公开信息综合为结构化的架构假设。如果 Gomez 的重建基本正确,Anthropic 不发布技术论文的决定并未阻止架构至少部分公开。它只是提高了达到这一点的门槛。

OpenMythos 提出的更广泛问题

AI 安全研究长期以来一直在辩论模型能力和架构知识之间的关系。担忧通常不在于架构本身——知道一座建筑使用钢筋混凝土并不意味着你能在没有资源的情况下建造它。担忧在于架构知识会加速什么。

Cloud Security Alliance 对 Mythos 情况的分析指出,“当有动机的开发者和可及的算力结合时,能力扩散可能超越集中控制。” OpenMythos 的时间线与这一框架一致。Anthropic 决定扣留 Mythos 是在 4 月。架构重建在数周内出现在 GitHub 上,积累了 10,000 个 stars,衍生出多个 fork,并产生了学术研究人员的同行分析——这一切都发生在 Anthropic 任何官方评论之前。

问题不在于 Anthropic 锁定 Mythos 是否正确。大多数审阅 system card 的安全研究人员似乎都同意,一个能够自主构建多步骤网络攻击序列的模型不应广泛可用。问题在于,当社区的回应是通过公开文献重建架构时,锁定是否实现了其设计目的。

一个相关考虑:OpenMythos 对自身是什么完全透明。README 明确说明这是一个理论重建,没有实际权重,与 Anthropic 无关,且未经验证准确性。社区知道他们得到的是什么。担忧不在于 OpenMythos 本身——而在于被扣留的内容可以通过有动机的推断部分恢复的先例。

这是大多数重大 AI 安全决策的模式。安全社区辩论决策。开源社区开始绕过它。两种对话都产生有用信息。两者都未解决能力扩散与访问控制之间的根本张力。Anthropic 通过 Project Glasswing 做出的 1 亿美元承诺,是试图在扩散达到无法管理水平之前,防御性地使用 Mythos 的能力。

OpenMythos 在 AI 架构上的正确之处

撇开架构是否准确的问题不谈,支撑 OpenMythos 的 Recurrent-Depth Transformer 假设作为一个研究方向确实有趣。

标准 Transformer 架构主要通过参数量和上下文长度实现能力。更多参数,更好的模型——具有可预测的缩放定律。RDT 方法通过询问迭代深度是否能替代累积深度来挑战这一点。Parcae 论文的结果——一个 7.7 亿参数模型匹配 13 亿参数基线——表明这种替代至少在这些规模上是真实的。

对整个领域而言,这很重要,因为它表明模型大小与能力之间的关系可能比缩放定律所暗示的更具可塑性。一种能高效迭代的循环架构可能以更少的参数量实现前沿级推理,这对推理成本和延迟有重大影响。Anthropic 是否在 Mythos 中实际使用这种方法尚不清楚。社区因 Mythos 而现在探索它则是事实。

Gomez 的项目,无论准确与否,已将 RDT 假设介绍给比启发它的学术论文大得多的受众。10,000 个 GitHub stars 代表阅读了 README、运行了代码并开始思考循环深度可能实现什么的人。其中一些人会基于它构建。一些人会发现它错误并发布修正。被锁定模型与开放重建之间的反馈循环已经产生了比 Mythos 公告本身更多的关于推理时架构选择的公开讨论。

无论你是将 AI 工具用于研究、写作还是知识综合,OpenMythos 的情况都突显了值得追踪的一点:前沿 AI 能做什么与公开可获取的内容之间的差距正在缩小,但方向并非大多数人所期望。能力不是通过模型扩散,而是通过它们产生的架构理解扩散。帮助 capture and connect AI research insights 的工具——跨越论文、讨论和仓库文档——对于跟进这一领域日益必要。Mythos 的故事正同时在 system card、GitHub readmes 和学术预印本中书写。问题是谁在阅读这三者。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page