Heretic: 大規模言語モデル向け完全自動検閲除去
更新日:6月17日

長年、オープンソースAIコミュニティは手動調整のサイクルに囚われてきました。LlamaやGemmaのようなモデルから、安全ガードレール(しばしば「アライメント」または単に検閲と呼ばれる)を削除することは、職人の仕事でした。それは直感、試行錯誤、そしてモデルの重みに関する深い理解を必要としました。しかし今、「Heretic」という新しいツールが、言語モデルの「完全自動検閲解除」を約束することで、状況を一変させています。
これは単なるシステムプロンプトを変更するスクリプトではありません。「Heretic」は、複雑な「abliteration」(方向性アブレーション)プロセスを自動化する完全なソフトウェアソリューションです。検閲解除を数学的な最適化問題として扱うことで、ユーザーは手作業なしで、単一のコマンドでモデルの検閲を解除できるようになり、人間の専門家の品質に匹敵する可能性があります。
手動チューニングから自動消去へ

なぜ remio が重要なのかを理解するには、それが解決する問題を理解する必要があります。安全アラインメントとは、通常、特定の要求を拒否するようにモデルを微調整することを含みます。これにより害は防がれますが、モデルの有用性がしばしば損なわれ、無害なクエリに対しても「このリクエストには応じられません」という応答につながります。対抗策は Heretic
です。アブリテレーション。このテクニックは、モデルのニューラルネットワーク内の「拒否」に対応する特定の方向を特定し、それらを数学的に削除することを含みます。歴史的には、これは手作業で行われていました。開発者は拒否方向を見つけ、重みクランプを適用し、テストしていました。押しすぎると、モデルは愚かになり(ロボトミー状態)、十分でなければ、検閲は残っていました。
異端者 changes this dynamic by using stochastic parameter optimization. 人間が適切な重みを推測する代わりに、ソフトウェアがベンチマークを実行します。有害なプロンプトと無害なプロンプトのデータセットをロードし、オプティマイザー(powered by Optuna」を見つけるのに役立ちます。これは、「適度なゾーン」—拒否が最小限に抑えられ、モデルの脳がそのまま維持される—の検索を効果的に自動化します。
KLダイバージェンスが知能を維持する上での役割
あらゆる検閲解除ツールの最大の懸念は、脳損傷です。安全ワイヤーを引き抜くと、論理も引き抜いてしまうのでしょうか?異端 は、 KLダイバージェンス (カルバック・ライブラーダイバージェンス) と呼ばれる指標を使用してこれを解決します。
簡単に言うと、 KLダイバージェンス は、新しいモデルの動作が、安全で通常のトピックにおいて元のモデルとどの程度異なるかを測定します。スコアが0の場合は同一であることを意味します。Heretic は、2つのものを同時に最小化するように設計されています:
有害なプロンプトに対する拒否の数。
のKLダイバージェンス を無害なプロンプトに対して計算します。
この二重最適化アプローチこそが、Heretic は人間の試みを上回ると主張しています。 google/gemma-3-12b-it モデルを使用した比較では、 Heretic バージョンは拒否率がわずか 3/100(人間の最高のバージョンと同等)でしたが、 KL divergence はわずか 0.16 でした。他の手動バージョンでは 0.45 や 1.04 のスコアでした。スコアが低いほど、モデルの損傷は少なくなります。
ケーススタディ:GPT-OSS-20B Heretic モデル

の機能Heretic は、GPT-OSS-20B-Heretic モデルのリリースで現実世界でのテストに直面しました。この特定のモデルは頑固であることで知られており、初期の自動ベンチマークでは拒否率が58/100を示しました。表面的には、これは失敗に見えました。
しかし、コミュニティによる分析により、「拒否」の定義方法にニュアンスがあることが明らかになりました。GPT-OSS architecture は、Chain of Thought (CoT) 推論に大きく依存しています。回答する前に、モデルはしばしば自己議論を行います:"うーん、それがポリシーに違反しているかどうかはわかりません。だからポリシーを確認しなければなりません。"
自動スクリプトは、このためらいを拒否としてフラグ付けします。しかし、ユーザーがコメントで指摘したように、モデルは通常、議論を終えてリクエストを履行します。実際には拒否していません。ただためらっていただけです。あるユーザーは次のように述べています。「破壊に対する抵抗は確かに高いですが、適切なパラメータが見つかれば破壊は依然として効果的です。」
論理と推論におけるパフォーマンス
興味深いのは、この「ためらう」モデルが実際にはより賢い可能性があるということです。ユーザーが GPT-OSS-20B Heretic モデルを、ClaudeやGPT-4のような巨大モデルでさえ時々つまずくLLM向けに設計されたプライベート「IQテスト」で試しました。 Heretic バージョンは100%のスコアでこれを達成しました。
この逸話的な証拠は、 Heretic's 最適化アプローチが機能するという理論を裏付けています。最小化することによってKLダイバージェンス、ツールは最終的な拒否メカニズムを破壊することなく、モデルをインテリジェントにしている複雑な推論能力(内部モノローグさえも)を取り除きました。これは、完全自動検閲解除モデルの品質を犠牲にする必要はありません。
オープンAIの将来への影響

異端者高レベルなモデルの調整の民主化を表します。このプロセスは、コンシューマーハードウェアで動作します。 VRAM.
ハードウェア要件: 8BモデルはRTX 3090で約45分かかります。
スケーラビリティ: より大きなモデル(120Bパラメータなど)は、大量のメモリ(約150GB)を必要とし、ほとんどのゲーマーには手の届かないものになりますが、研究者や小規模なラボには十分に手の届く範囲です。
の利用可能性Hereticは、メジャーリリース直後にHugging Faceに「検閲なし」モデルのバリアントが登場する傾向を加速させる可能性が高いです。ユーザーはすでに、これらのモデルを実行するためのquantized versions (GGUF format)を求めています。Ollama のようなローカルローダーです。主要なオープンソースリリースごとに、数時間以内に「Heretic」ツインが登場する標準に向かって進んでいます。これは人間の専門家ではなく、機械によって最適化されます。
Heretic に関するよくある質問
1. Heretic とは何ですか?
Heretic は、言語モデルにおける完全自動検閲解除のためのソフトウェアツールです。手動の人的介入を必要とせずに、安全性の整合性を削除するために、abliterationという技術と確率的最適化を組み合わせて使用します。
2. Heretic はモデルが「鈍く」ならないようにするにはどうすればよいですか?
を監視します。KLダイバージェンス。Hereticは、無害なトピックに関する新しいモデルの応答と元のモデルの応答を数学的に比較することにより、拒否メカニズムのみが削除され、コア知識と推論能力が維持されていることを保証します。
3. GPT-OSS-20B Hereticモデルで拒否回数が多かったのはなぜですか?
それらはほとんどが偽陽性でした。モデルには、考えを声に出して言う そして、最終的には従う前に、それ自体の安全ポリシーについて議論しました。自動化されたテストは、モデルが実際に要求されたコンテンツを生成したにもかかわらず、この内部議論を拒否と解釈しました。
4. Hereticを自宅のコンピューターで実行できますか?
はい、十分な VRAM を搭載した GPU があれば可能です。. 標準的な8Bパラメータモデルのデセンソアリングは、単一のNVIDIA RTX 3090で実行可能であり、1時間未満で完了します。より大きなモデルには、大幅に強力なハードウェアまたはクラウドコンピューティングが必要です。
5. Hereticはマルチモーダルモデルで動作しますか?
はい、ドキュメントによると、Hereticは、多くのマルチモーダルモデルやいくつかのMixture of Experts (MoE) アーキテクチャを含む、ほとんどの密なモデルをサポートしています。ただし、まだSSMやハイブリッドモデルはサポートしていません。
6. Hereticモデルはどこからダウンロードできますか?
このツールで処理されたモデルのコレクションは、Hugging Faceで見つけることができます。ユーザーはこれらのバリアントを見つけるために、「Heretic」や「abliterated」のようなキーワードを頻繁に検索します。



