top of page

Heretic: 大型语言模型的完全自动审查移除

已更新:6月17日

Heretic: Fully Automatic Censorship Removal for Large Language Models

多年来,开源 AI 社区一直陷入手动微调的循环中。从 Llama 或 Gemma 等模型中移除安全护栏(通常被称为“对齐”或简称为审查)是一项手艺活。它需要直觉、反复试验以及对模型权重的深刻理解。现在,一款名为 Heretic 的新工具正在改变这一现状,它承诺为语言模型提供全自动审查移除功能。

这不仅仅是另一个修改系统提示词的脚本。Heretic 是一个完整的软件解决方案,它将复杂的 abliteration(定向消融)过程自动化。通过将移除审查视为一个数学优化问题,它允许用户通过一条命令对模型进行去审查,其质量潜在大约等同于人类专家,且无需人工劳动。

从手动调优到自动 Abliteration

From Manual Tuning to Automated Abliteration

要理解为什么 Heretic 具有重要意义,你必须先了解它所解决的问题。安全对齐通常涉及对模型进行微调以拒绝某些请求。虽然这防止了危害,但往往会损害模型的实用性,导致即使是良性查询也会出现“我无法满足此请求”的回答。

而应对措施则是 abliteration。这项技术涉及识别模型神经网络中对应于“拒绝”的特定方向,并从数学上将其移除。从历史上看,这是通过手动完成的。开发人员会找到一个拒绝方向,应用权重限制并进行测试。如果力度过大,模型会变得愚笨(脑叶切除);如果力度不够,审查依然存在。

Heretic 通过使用 随机参数优化改变了这一动态. 软件不再由人工猜测权重,而是运行基准测试。它加载有害和无害提示的数据集,并使用优化器(由 Optuna 提供支持)来寻找完美的平衡。它有效地自动化了对“金发姑娘区”的搜索——即在最小化拒绝的同时,保持模型的智能完好无损。

KL 散度在保持智能中的作用

任何去审查工具最大的担忧就是“脑损伤”。如果你拆除了安全连线,是否也会拆除逻辑?Heretic 通过一种名为 KL divergence(Kullback–Leibler 散度)的指标来解决这个问题。

简单来说,KL 散度 衡量新模型在安全、正常话题上的行为与原始模型的差异程度。分数为 0 表示两者完全一致。Heretic 旨在共同最小化两个指标:

  1. 对有害提示词的拒绝次数。

  2. 在无害提示词上的 KL 散度

这种双重优化方法正是 Heretic 声称优于人类的尝试。在针对 google/gemma-3-12b-it 模型的对比中,Heretic 版本的拒绝率仅为 3/100(与人类最佳版本持平),但 KL divergence 仅为 0.16。相比之下,其他手动版本的得分则为 0.45 甚至 1.04。得分越低,模型受到的损害就越小。

案例研究:GPT-OSS-20B Heretic 模型

Case Study: The GPT-OSS-20B Heretic Model

以下能力属于 Heretic 在发布 GPT-OSS-20B-Heretic 模型时面临了真实世界的测试。这个特定的模型以“固执”著称,最初的自动化基准测试显示其拒绝率为 58/100。从表面上看,这似乎是一个失败。

然而,社区分析揭示了我们在定义“拒绝”时存在的细微差别。GPT-OSS architecture 高度依赖 Chain of Thought (CoT) 推理。在回答之前,模型经常会进行自我辩论:“嗯,我不确定这是否违反政策。所以我必须检查政策。”

自动化脚本将这种犹豫标记为拒绝。但正如用户在评论中指出的那样,模型通常会以满足请求来结束辩论。它实际上并没有拒绝,只是犹豫了。一位用户指出:“它对 abliteration 的抵抗力确实更高……但一旦找到正确的参数,abliteration 仍然有效。”

逻辑与推理性能

令人着迷的是,这个“犹豫不决”的模型实际上可能更聪明。一位用户对 GPT-OSS-20B Heretic 模型进行了一项专为 LLM 设计的私密“IQ 测试”——在这项测试中,即使是像 Claude 和 GPT-4 这样的巨头有时也会失手。而 Heretic 版本以 100% 的得分完美通过。

这一轶事证据支持了 Heretic's 优化方法行之有效的理论。通过最小化 KL 散度,该工具剥离了最终的拒绝机制,且没有破坏使模型智能化的复杂推理能力(甚至包括其内心独白)。这证明了全自动审查移除并不一定要以牺牲模型质量为代价。

对开放 AI 未来的影响

Implications for the Future of Open AI

Heretic代表了高级模型手术的民主化。只要你有足够的VRAM,该过程就可以在消费级硬件上运行.

  • 硬件要求:在 RTX 3090 上运行 8B 模型大约需要 45 分钟。

  • 可扩展性:更大的模型(如 120B 参数)需要海量显存(约 150GB),这超出了大多数游戏玩家的承受范围,但对于研究人员和小型实验室来说完全可以实现。

的发布Heretic 可能会加速“无审查”变体模型在重大发布后立即出现在 Hugging Face 上的趋势。用户已经开始呼吁推出 量化版本 (GGUF 格式) 以便在这些设备上运行这些模型。像 Ollama 这样的本地加载器。我们正迈向一个标准:每一个主要的开源发布都会在数小时内拥有一个“Heretic”孪生版本——不是由人类专家优化,而是由机器优化。

关于 Heretic 的常见问题解答

1. 什么是 Heretic?

Heretic 是一款专为全自动移除审查而设计的软件工具。它结合了名为abliteration的技术与随机优化,无需人工干预即可移除安全对齐。

2. Heretic 如何确保模型不会变“笨”?

它监控 KL 散度。通过在无害话题上对新模型与原始模型的响应进行数学对比,Heretic 确保在仅移除拒绝机制的同时,核心知识和推理能力保持完好。

3. 为什么 GPT-OSS-20B Heretic 模型仍然有很高的拒绝次数?

这些很大程度上是误报。该模型习惯于大声思考并在最终服从之前辩论其自身的安全策略。自动化测试将这种内部辩论解释为拒绝,尽管模型实际上生成了请求的内容。

4. 我可以在家用电脑上运行 Heretic 吗?

可以,只要你拥有具备足够 VRAM. 对一个标准的 8B 参数模型进行去审查在单张 NVIDIA RTX 3090 上是可行的,且耗时不到一小时。更大的模型则需要性能显著更强的硬件或云端算力。

5. Heretic 是否适用于多模态模型?

是的,文档指出 Heretic 支持大多数稠密模型,包括许多多模态模型以及几种 Mixture of Experts (MoE) architectures。然而,它目前尚不支持 SSMs 或混合模型。

6. 我可以在哪里下载 Heretic 模型?

使用此工具处理的模型集合可以在 Hugging Face 上找到。用户经常搜索诸如 “Heretic” 或 “abliterated” 之类的关键词来查找这些变体。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page