top of page

OpenMythos: 誰かがAnthropicの最も危険なAIをリバースエンジニアリングした。それが2週間で10,000のGitHubスターを獲得した。

Anthropicは、内部テストで主要なすべてのオペレーティングシステムとブラウザのゼロデイ脆弱性を自律的に発見できることが判明したため、最も高性能なモデルであるClaude Mythosを公開リリースしないことを決定した。この決定は4月に発表され、モデルはProject Glasswing(Apple、Google、Microsoftを含む12の組織からなる審査済みコンソーシアム)内にロックされた。2週間後、22歳の開発者Kye GomezがGitHub上でOpenMythosを公開した。これはMythosのアーキテクチャを公開研究論文のみからゼロから再構築したものである。このリポジトリには訓練済み重みはなく、Anthropicの独自システムへのアクセスもなく、同社との公式なつながりもない。ただし、GitHubのスター数は10,000を超えている。

スター数はプロジェクトの正確さを測るものではない。AIコミュニティに対して、あるモデルが危険すぎてリリースできないと伝えたときに何が起こるかを測るものである。

OpenMythosの実際の内容

Gomezは、再帰型トランスフォーマーアーキテクチャ、推論時スケーリング、Claude Mythos Previewの研究者による行動パターンに関する公開論文をすべて読み込むのに数週間を費やした。彼の中心的な仮説は、Mythosが従来の積層レイヤーアーキテクチャではなく、Recurrent-Depth Transformer(RDT)—— Looped Transformerとも呼ばれる——であるというものだ。

この区別は重要である。標準的なトランスフォーマーモデルは、一意のレイヤーをシーケンスに積み重ねることで深さを増す。各レイヤーは入力を一度処理し、次のレイヤーに渡す。一方、Recurrent-Depth Transformerはより少ないレイヤーセットを取り、同じ入力を複数回実行する。深さは蓄積ではなく反復から生まれる。アナロジーは、20人の異なる専門家に順番に相談する場合と、同じ専門家に20回相談して回答が収束するまで続ける場合の違いである。反復的な洗練が有効な推論タスクでは、再帰的アプローチはより少ないパラメータ数で固定アーキテクチャと同等かそれ以上の性能を発揮できる。

OpenMythosはこれを3つの機能ブロックとして実装している:Prelude(標準的なトランスフォーマーレイヤーを1回実行)、Recurrent Block(N回実行されるレイヤーセットで、Nは位置ごとに変化可能)、Coda(標準的なトランスフォーマーレイヤーを1回実行)。Parcaeは、2026年4月にUCSDとTogether AIから発表された論文で、RDT仮説の主な技術的裏付けを提供した。770百万パラメータのParcaeモデルが、標準ベンチマークで13億パラメータの標準トランスフォーマーと同等の品質を達成した。

OpenMythosには方程式、引用、およびAnthropicとは一切関係がないことを示す丁寧な免責事項が付属している。コードは動作する。重みはない。これは、建物の外側から検査官が推測できた情報に基づく、設計図はあるが資材のない建物である。

Anthropicがオリジナルをロックした理由

OpenMythosが重要である理由を理解するには、AnthropicがMythosをリリースしなかった理由を理解する必要がある。

Claude Mythosのsystem cardには、内部テスト中に何が起こったかが記録されている。このモデルは、セキュリティ脆弱性の発見を指示されると、主要なすべてのオペレーティングシステムと主要なすべてのウェブブラウザにわたって数千のゼロデイ欠陥——これまで知られていなかったソフトウェアの弱点——を特定した。このモデルは多段階の攻撃チェーンを構築することが可能だった。脆弱性を見つけるだけでなく、それを悪用する一連のアクションを設計する。system cardは、32ステップのネットワーク攻撃シーケンスを文書化された例として挙げている。

Anthropicの結論は、サイバーセキュリティ機能をモデルの推論能力を根本的に低下させずに選択的に無効化することはできないというものだった。Mythosがソフトウェアの欠陥を発見できるようにする機能は、さまざまなドメインでうまく推論できるようにする機能と同じである。一方をオフにすると他方にも影響する。ゼロデイ脆弱性を発見するモデルと、研究者が複雑な文献を統合するのを助けるモデルは、同じモデルである。

Project Glasswingは妥協案だった。12の組織——いずれも実証済みのセキュリティインフラと説明責任を有する——が防衛目的でMythosへの管理されたアクセスを得る。Anthropicは最大1億ドルの利用クレジットと400万ドルのオープンソースセキュリティ組織への直接寄付を約束した。論理:この能力レベルの攻撃的サイバーセキュリティツールの責任ある使用法は、他の誰かが発見する前に脆弱性を修正するために使用することだけである。

これがOpenMythosが登場した背景である。Anthropicは能力が無制限のリリースには危険すぎると判断した。ある開発者は、それらの能力が何に基づいて構築されているかを理解するために、公開情報からアーキテクチャを再構築することを決めた。

10,000のスターが意味すること

GomezはX上でOpenMythosについてアーキテクチャを説明するスレッドを投稿した。彼は後に「この投稿がここまでバズるとは全く予想していなかった」と書き、プロジェクトは研究成果物として意図されたものであり、公の声明ではなかったと述べた。このリポジトリのスター数は、AI分野の意図的なバイラルローンチの多くよりも速く蓄積した。

この速度は特定の需要を反映している。フロンティアモデルが安全上の理由でロックされたとき、AIコミュニティは一般的にそのロックを会話の終わりとして受け入れない。MetaのオープンソースLlamaモデルは、APIゲートの背後に置かれていたものをコミュニティが欲したために部分的に構築された。Stable Diffusionは、DALL-Eがアクセス不能にしたものを画像生成コミュニティに提供したために支配的になった。OpenMythosはアーキテクチャ版である。能力ではなく設計図だ。

重要な違いは、Gomezのアーキテクチャ仮説が正しいとしても、OpenMythosはMythosの能力を移転しないことである。重み——モデルが学習したすべてをエンコードする訓練済みパラメータ——はここにない。重みなしの正しいアーキテクチャ再構築は、誰も入れない領域の地図である。再帰深度トランスフォーマーを正確に再現し、十分な計算量とデータでゼロから訓練すれば、同様のアーキテクチャ特性を持つものを構築できる可能性がある。しかしそれは数年規模で数十億ドルの研究プログラムであり、GitHubクローンではない。

したがってセキュリティ上の懸念は、OpenMythosが即座に危険な能力を可能にするということではない。動機づけられた開発者が公開情報をどれだけ迅速に構造化されたアーキテクチャ仮説に合成できるかを示すプロジェクトであるということだ。Gomezの再構築が実質的に正しい場合、Anthropicが技術論文を公開しなかった決定は、アーキテクチャが少なくとも部分的に公開されることを防げなかった。そこに至る努力を増やしただけである。

OpenMythosが提起するより広い問い

AI安全研究は長年、モデル能力とアーキテクチャ知識の関係について議論してきた。懸念は通常、アーキテクチャ自体についてではない——建物が鉄筋コンクリートを使用していることを知っていても、資源なしで建てることはできない。懸念は、アーキテクチャ知識が何を加速させるかについてである。

Cloud Security AllianceのMythos状況の分析では、「能力の拡散は、動機づけられた開発者とアクセス可能な計算が結びついたときに集中管理を上回る可能性がある」と指摘された。OpenMythosのタイムラインはこの枠組みと一致している。AnthropicがMythosを保留する決定が4月に行われた。アーキテクチャ再構築は数週間以内にGitHubに登場し、10,000のスターを集め、複数のフォークを生み、公式なAnthropicコメントが出る前に学術研究者からのピア分析を生成した。

問われているのは、AnthropicがMythosをロックした判断が正しかったかどうかではない。system cardをレビューしたセキュリティ研究者のほとんどは、自律的に多段階ネットワーク攻撃シーケンスを構築できるモデルが一般に利用可能であるべきではないことに同意しているようだ。問われているのは、コミュニティの反応が公開文献からアーキテクチャを再構築することである場合、そのロックが意図したことを達成するかどうかである。

関連する考慮事項:OpenMythosはそれが何であるかについて完全に透明である。READMEは、実際の重みはなく、Anthropicとのつながりはなく、検証された正確性もない理論的再構築であることを明確にしている。コミュニティは自分が得ているものを知っている。懸念はOpenMythos自体ではなく、保留されたものが動機づけられた推論を通じて部分的に回収可能であるという前例である。

これはほとんどの主要なAI安全決定に共通するパターンである。安全コミュニティは決定を議論する。オープンソースコミュニティはそれを回避する作業を始める。どちらの会話も有用な情報を生み出す。どちらも能力拡散とアクセス制御の根本的な緊張を解決しない。AnthropicのProject Glasswingを通じた1億ドルのコミットメントは、その拡散が管理不能なレベルに達する前に、Mythosの能力を防衛的に使用する試みである。

OpenMythosがAIアーキテクチャについて正しく捉えていること

アーキテクチャが正確かどうかという問いを脇に置くと、OpenMythosの基盤となるRecurrent-Depth Transformer仮説は研究方向として genuinely 興味深いものである。

標準的なトランスフォーマーアーキテクチャは、主にパラメータ数とコンテキスト長を通じて能力を達成する。より多くのパラメータ、より良いモデル——予測可能なスケーリング則とともに。RDTアプローチは、反復を通じた深さが蓄積を通じた深さに取って代われるかどうかを問うことでこれに挑戦する。Parcae論文の結果——770Mパラメータモデルが13億パラメータのベースラインと一致——は、少なくともこれらのスケールでは置換が現実であることを示唆している。

この分野全体にとって重要なのは、モデルサイズと能力の関係がスケーリング則が示唆するよりも柔軟である可能性を示唆している点である。効率的に反復する再帰アーキテクチャは、パラメータ数のわずかな割合でフロンティアレベルの推論を達成する可能性があり、これは推論コストとレイテンシに大きな意味を持つ。Anthropicが実際にMythosでこのアプローチを使用しているかどうかは不明である。Mythosのためにコミュニティが今これを探求していることは事実である。

Gomezのプロジェクトは、正確性とは独立して、インスピレーションを得た学術論文よりもはるかに大きなオーディエンスにRDT仮説を紹介した。10,000のGitHubスターは、READMEを読み、コードを実行し、再帰的深さが何を可能にするかについて考え始めた人々を表している。その中にはそれを基に構築する人もいれば、誤りを見つけて修正を公開する人もいる。ロックされたモデルとオープンな再構築の間のフィードバックループは、Mythos発表自体よりも、推論時アーキテクチャ選択に関する公の議論をすでに多く生み出している。

研究、執筆、知識統合のためにAIツールを使用するかどうかにかかわらず、OpenMythosの状況は追跡する価値のあることを強調している。フロンティアAIができることと公開アクセス可能なことのギャップは縮まっているが、ほとんどの人が予想する方向ではない。能力はモデルを通じてではなく、それらが生成するアーキテクチャ理解を通じて拡散する。論文、議論、リポジトリドキュメントにわたってAI研究の洞察をキャプチャしてつなぐのを助けるツールは、この分野を追うためにますます必要になっている。Mythosの物語は、system card、GitHubのREADME、学術プレプリントで同時に書かれている。問われているのは、誰がこの3つすべてを読んでいるかである。

 
 

無料で始めましょう

ローカルファーストのパーソナル知識管理付きAIアシスタント

より良いAI体験のために、

remio は現在、 Windows 10+ (x64)M-Chip Mac のみをサポートしています。

脳内に検索バーを追加

ただremioに尋ねるだけ

すべてを思い出す

何も整理しない

bottom of page