Hugging Face Uncensored 与 Abliteration 模型深度解析:从拒答机制到 Heretic、模型融合与 GGUF 量化

本文系统介绍 Hugging Face 上常见的 UncensoredAbliteratedHeretic 模型到底是如何制作出来的,并以 Qwen3.6 系列的实际模型为例,深入分析 Abliteration、Heretic、ARA、SFT、LoRA、Model Merge、GGUF 量化以及 MTP 等技术之间的关系。

如果你曾经在 Hugging Face 上看到 Qwen3.6-35B-A3B-UncensoredQwen3.6-27B-Fable-FusionHereticAbliterated 等模型,却不知道它们究竟修改了模型的什么部分,那么本文可以作为一份完整的技术入门与实践指南。


1. 什么是 Hugging Face 上的 Uncensored 模型?

1.1 Uncensored 到底是什么意思?

在 Hugging Face 模型社区中,经常可以看到:

  • Uncensored
  • Abliterated
  • Heretic
  • Disinhibited
  • No Refusal
  • Jailbreak
  • NSFW
  • Roleplay

等名称。

这些名称看起来非常相似,但实际上代表的技术路线可能完全不同。

首先必须明确:

Uncensored 并不是一种标准的模型技术,也不是一个统一的模型架构。

它更多是模型作者对模型行为的描述。

一个模型被称为 Uncensored,通常意味着:

原始模型
   ↓
减少或者移除拒答行为
   ↓
面对原本容易触发拒答的问题时
更加倾向于直接回答

但实现方式可能包括:

Fine-tuning
LoRA / QLoRA
Abliteration
Heretic
Model Merge
Inference-time Steering
Weight Editing

甚至可能是多个方法组合。


1.2 为什么大语言模型会拒答?

理解 Uncensored 模型之前,需要先理解原始模型为什么会拒答。

一个经过安全对齐的模型,大致经历:

预训练
   ↓
Instruction Tuning
   ↓
SFT
   ↓
Preference Optimization
   ↓
Safety Alignment
   ↓
最终模型

模型在安全对齐过程中学习了大量:

敏感问题
     ↓
拒绝回答

这样的行为模式。

因此模型并不存在一个简单的:

safety = true

开关。

拒答实际上是模型学习出来的一种行为。


1.2.1 拒答行为可以如何理解?

可以把 Transformer 内部的计算简化为:

用户输入
   ↓
Tokenizer
   ↓
Transformer Layers
   ↓
Hidden States
   ↓
Logits
   ↓
Token Probability
   ↓
最终回答

当输入被模型判断为某类敏感请求时,内部表征可能发生变化:

输入
 ↓
某些语义特征
 ↓
安全相关表征
 ↓
拒答倾向增强
 ↓
"I can't help..."

因此所谓的“去拒答”,实际上是在尝试改变:

输入
 ↓
内部表征
 ↓
拒答行为

这一映射关系。


2. Uncensored 模型主要有哪些技术路线?

2.1 Counteralignment Fine-tuning

Counteralignment Fine-tuning 可以理解为:

通过新的训练数据覆盖模型原有的拒答行为。

最简单的数据结构类似:

用户问题
    ↓
直接回答

而不是:

用户问题
    ↓
拒答

2.1.1 SFT 如何改变模型行为?

监督微调(SFT)的目标是让模型提高目标回答的概率。

假设原模型:

敏感问题

拒答概率:80%
正常回答:20%

经过大量针对性训练以后:

敏感问题

拒答概率:10%
正常回答:90%

模型就可能逐渐形成新的行为模式。


2.1.2 LoRA 与 QLoRA

对于几十亿甚至几百亿参数模型,全参数微调成本很高。

因此常见方式是:

Base Model
     +
LoRA Adapter
     ↓
新模型行为

LoRA 可以简单表示为:

W' = W + ΔW

其中:

ΔW = B × A

A、B 是低秩矩阵。

这样就不需要直接修改整个模型的全部参数。


2.1.3 Fine-tuning 的优点

主要优点:

  1. 行为改变比较彻底
  2. 泛化能力通常比单纯 Prompt 更好
  3. 多轮对话稳定性较好
  4. 可以得到独立模型
  5. 可以进一步 Merge
  6. 可以通过 LoRA 降低训练成本

2.1.4 Fine-tuning 的缺点

最大问题是:

容易改变模型原本的能力。

例如训练数据过于集中,可能出现:

拒答 ↓
但是:

推理能力 ↓
知识保持 ↓
Instruction Following ↓
语言能力 ↓

因此真正困难的不是让模型“不拒答”,而是:

在减少拒答的同时尽可能保留原始模型能力。

3. Abliteration:目前非常重要的 Uncensored 技术

3.1 什么是 Abliteration?

Abliteration 可以理解为:

在模型内部找到与拒答相关的方向,然后对这个方向进行削弱或消除。

它与 Fine-tuning 最大的区别是:

Fine-tuning:

数据
 ↓
训练
 ↓
改变权重

而 Abliteration 更接近:

模型
 ↓
分析内部 Activation
 ↓
寻找拒答方向
 ↓
修改权重
 ↓
得到新模型

因此 Abliteration 通常不需要进行大规模重新训练。


3.1.1 什么是 Refusal Direction?

Transformer 中的 Hidden State 可以表示为一个高维向量:

h ∈ R^d

可以把它想象成高维空间中的一个点。

假设模型处理两类输入:

正常问题

和:

容易触发拒答的问题

分别得到:

H_normal
H_refusal

然后计算两组 Activation 的平均差异:

d = mean(H_refusal) - mean(H_normal)

这个 d 可以作为:

Refusal Direction(拒答方向)

的近似。


3.1.2 如何消除拒答方向?

假设:

h = n + r

其中:

n = 正常信息
r = 拒答相关成分

那么可以尝试:

h' = h - αr

其中 α 控制修改强度。

如果:

α 太小

则:

拒答仍然存在

如果:

α 太大

则可能:

拒答下降
但是模型能力也下降

因此 Abliteration 的核心问题实际上是:

如何最大程度消除拒答,同时最小程度影响模型原始能力。

4. 从 Activation Editing 到 Weight Editing

4.1 Inference-time Activation Steering

最简单的方式是在推理过程中修改 Hidden State:

原始 Hidden State
       ↓
h
       ↓
减去 refusal direction
       ↓
h'
       ↓
继续推理

公式:

h' = h - αr

这种方式属于:

Inference-time Steering

优点是不会永久修改模型。


4.1.1 优点

主要优点:

  • 不需要重新训练
  • 原始模型保持不变
  • 可以随时关闭
  • 可以实时调整强度
  • 非常适合研究模型内部行为

例如:

Mode A
↓
原始模型

Mode B
↓
Steering

Mode C
↓
更强 Steering

4.1.2 缺点

最大问题:

不一定对所有输入都有效。

可能出现:

问题 A → 正常回答
问题 B → 正常回答
问题 C → 仍然拒答

同时:

α = 0.5

可能表现很好。

而:

α = 2.0

可能导致模型行为异常。


5. Orthogonal Projection:把 Abliteration 固化到模型权重

5.1 为什么要修改权重?

如果只修改 Activation:

h' = h - αr

每次推理都需要特殊代码。

如果希望得到一个:

model.safetensors

形式的独立模型,就需要将修改固化到权重中。


5.1.1 权重投影

假设某个权重矩阵:

W

存在与拒答方向相关的成分。

可以进行正交投影:

W_new = W - d(dᵀW)

直观理解:

原始权重
    ↓
找到 refusal component
    ↓
投影掉 refusal component
    ↓
新的权重

最终得到:

Base Model
     ↓
Weight Editing
     ↓
Abliterated Model

6. 为什么简单 Abliteration 并不完美?

6.1 拒答不是一个简单的一维向量

这是理解 Abliteration 最重要的一点。

如果拒答真的只是:

一个向量

那么:

找到向量
 ↓
删掉
 ↓
完成

即可。

但实际模型可能存在:

Refusal Direction 1
Refusal Direction 2
Refusal Direction 3
...

而且不同 Transformer Layer 可能存在不同程度的拒答表征。

因此实际过程更像:

Layer 10
 ↓
refusal component

Layer 15
 ↓
refusal component

Layer 20
 ↓
refusal component

Layer 25
 ↓
refusal component

6.1.1 为什么删除过多会损伤模型?

因为拒答相关表征并不一定与其他能力完全正交。

例如:

             Safety
                │
                │
Reasoning ─── Hidden State ─── Knowledge
                │
                │
          Instruction Following

如果修改方向不够精准,就可能同时影响:

  • Reasoning
  • Knowledge
  • Instruction Following
  • Helpfulness
  • Language Style

最终可能得到:

拒答 ↓↓↓
+
智力 ↓
+
推理 ↓
+
幻觉 ↑

因此高质量 Abliteration 的目标不是:

删除所有拒答。

而是:

在能力保持率和拒答降低之间找到最佳平衡。

7. Heretic:Abliteration 自动化路线

7.1 Heretic 是什么?

Heretic 可以理解为:

自动化、优化后的模型去拒答流程。

简单 Abliteration:

寻找 refusal direction
        ↓
手动选择强度
        ↓
修改权重

而 Heretic 更强调:

寻找拒答方向
       ↓
自动寻找最佳修改位置
       ↓
自动寻找修改强度
       ↓
测试模型
       ↓
优化

7.1.1 为什么需要自动优化?

核心问题是:

应该修改多少?

修改太少:

Refusal 仍然存在

修改太多:

模型能力下降

因此可以把问题理解成:

Minimize Refusal
+
Minimize Behavioral Damage

8. ARA:Arbitrary-Rank Ablation

8.1 什么是 ARA?

ARA 的全称是:

Arbitrary-Rank Ablation

它可以理解成对简单单方向 Abliteration 的扩展。

简单方法可能假设:

Refusal ≈ 一个主要方向

而 ARA 可以处理:

Refusal
 ↓
多个相关方向
 ↓
一个低秩子空间

即:

Rank = N

而不是简单:

Rank = 1

8.1.1 为什么多方向方法更有意义?

如果拒答行为分布在多个相关方向:

       r1
      /
-----●------ r2
    /
   r3

只删除:

r1

可能仍然存在:

r2
r3

因此更完整的消融可以处理一个低秩子空间。


9. Model Merge:另一条常见路线

9.1 什么是模型融合?

假设:

Model A

是原始模型:

Model B

是更加开放或者具有不同能力的模型。

最简单的权重平均:

W_new = (1 - α)WA + αWB

例如:

α = 0.3

意味着:

70% A
30% B

9.1.1 为什么 Merge 可以改变模型行为?

因为两个模型可能具有不同的行为分布。

例如:

Model A
↓
Reasoning 强
Safety 强
Refusal 多

而:

Model B
↓
Creative 强
Roleplay 强
Refusal 少

融合以后:

A + B
 ↓
新的行为分布

9.1.2 Model Merge 的缺点

最大的风险:

两个模型的能力可能互相冲突。

结果可能出现:

推理 ↑
创作 ↑

也可能出现:

推理 ↓
创作 ↓
Instruction Following ↓

因此 Merge 更像实验性模型工程。


10. Hugging Face 上的 Uncensored 模型到底是哪一种?

10.1 Uncensored 不能代表具体技术

这是选择模型时最重要的原则。

例如:

Qwen3.6-XXX-Uncensored

不能直接推断:

一定使用 Abliteration

它可能是:

SFT
LoRA
Abliteration
Heretic
Merge

或者多个方法的组合。


10.1.1 Abliterated 的技术含义更明确

一般来说:

xxx-abliterated

意味着作者声称:

使用了 Abliteration

而:

xxx-heretic

通常意味着:

使用 Heretic 或相关自动化 Abliteration 流程

但最终仍然应该阅读 Model Card。


11. 实际案例一:HauhauCS Qwen3.6-35B-A3B

11.1 Base Model

HauhauCS 模型基于:

Qwen3.6-35B-A3B

它是一个:

35B 总参数
约 3B Active Parameters
MoE

模型采用大量专家,通过 Router 为每个 Token 选择部分专家。


11.1.1 为什么 35B-A3B 不是普通 35B?

这里非常容易误解。

35B

表示模型总参数规模。

而:

A3B

表示每个 Token 实际激活的参数规模大约为 3B。

因此:

Dense 27B

与:

MoE 35B-A3B

不能简单用参数量直接比较。


12. HauhauCS 的去拒答路线

12.1 核心目标

HauhauCS 的模型卡强调:

不改变数据集
不改变原始能力
只减少拒答

因此其理念可以表示为:

Qwen3.6-35B-A3B
       ↓
Abliteration / Weight Editing
       ↓
HauhauCS Uncensored

目标是:

能力 ≈ Base Model

Refusal ↓↓↓

12.1.1 为什么叫 Aggressive?

Aggressive 主要代表:

更激进地降低拒答

而不是:

更聪明

可以理解为:

Balanced
↓
保留更多原始安全行为

Aggressive
↓
更彻底减少拒答

13. 实际案例二:DavidAU Qwen3.6-27B Fable Fusion

13.1 Base Model

DavidAU 模型基于:

Qwen3.6-27B

与 HauhauCS 不同:

HauhauCS
→ 35B-A3B MoE

DavidAU
→ 27B Dense

因此两者架构本身就不同。


14. DavidAU 的模型制作路线

14.1 它不是简单 Abliteration

DavidAU 的路线更加复杂:

Qwen3.6-27B
      ↓
Heretic + ARA
      ↓
Uncensored
      ↓
Fine-tuning
      ↓
Fable
      ↓
Claude Reasoning
      ↓
Polaris
      ↓
F451
      ↓
Multi-stage Merge
      ↓
再次 Fine-tuning
      ↓
Fable Fusion

因此:

DavidAU 更准确地说是“去拒答 + 能力重塑 + 多模型融合”的模型。

14.1.1 为什么加入 Fable?

Fable 相关数据主要影响:

  • Creative Writing
  • Roleplay
  • Storytelling
  • Style
  • Character Behavior

因此它可能比单纯 Abliterated Qwen 更具有明显的创作人格。


14.1.2 为什么加入 Claude Reasoning?

其模型卡提到加入了 Claude reasoning/thinking traces。

其目的不是简单删除拒答,而是进一步改变:

Reasoning
Thinking
Problem Solving

等行为。


14.1.3 为什么加入 Polaris?

Polaris 数据进一步用于:

Reasoning
General Intelligence
Instruction Following

等方面。

因此最终模型已经不再只是:

Qwen3.6-27B - Safety

而是:

Qwen3.6-27B
+
多个能力数据集
+
多个模型行为
+
多个 Merge

15. 两个模型为什么实际表现不同?

15.1 HauhauCS 更像“原版 Qwen 的解锁版”

可以把它简化为:

Qwen3.6
-
Refusal
=
HauhauCS

它追求:

Base Capability ≈ Uncensored Capability

因此使用时更容易产生:

“这就是 Qwen,只是少了拒答。”

的感觉。


15.1.1 DavidAU 更像“重新塑造过的 Qwen”

它更接近:

Qwen
+
Heretic
+
Fable
+
Reasoning
+
Polaris
+
Fine-tuning
+
Merge

所以:

Creative Writing
↑

Roleplay
↑

Reasoning
↑

Personality
改变

都会更加明显。


16. 两个模型的 Benchmark 对比

16.1 DavidAU 的公开 Benchmark

DavidAU 模型卡报告的结果:

BenchmarkQwen3.6-27BDavidAU 8-bit
ARC-C0.6470.711
ARC-E0.8030.879
BoolQ0.9100.910
HSwag0.7730.790
OBQA0.4500.514
PIQA0.8060.823
Wino0.7420.763

可以看到:

ARC-C
0.647 → 0.711

ARC-E
0.803 → 0.879

OBQA
0.450 → 0.514

等指标出现提升。

这说明 DavidAU 并不是单纯通过删除拒答来改变模型。


16.1.1 4-bit 的表现

模型卡还给出了 4-bit 结果:

Benchmark8-bit4-bit
ARC-C0.7110.701
ARC-E0.8790.873
BoolQ0.9100.909
HSwag0.7900.786
OBQA0.5140.488
PIQA0.8230.813
Wino0.7630.759

可以看到:

合理的 4-bit 量化并没有让模型能力发生灾难性下降。

17. Refusal Benchmark 应该怎么看?

17.1 “0 Refusal”并不等于模型更强

这是非常重要的一点。

假设:

Model A
Refusal = 0%
IQ = 80

而:

Model B
Refusal = 5%
IQ = 100

如果你的目标是:

综合能力

那么 Model B 很可能更优秀。

因此评价 Uncensored 模型不能只看:

Refusal Rate

还应该同时看:

Reasoning
Coding
Knowledge
Instruction Following
Hallucination
Long Context

17.1.1 理想状态

最理想的模型是:

Refusal
↓↓↓

正常能力
≈ Base Model

而不是:

Refusal
↓↓↓

正常能力
↓↓↓

18. KL Divergence 为什么重要?

18.1 KL Divergence 的作用

KL Divergence 可以用于衡量:

原模型输出分布

与:

修改后模型输出分布

之间的差异。

如果:

KL ≈ 0

说明两个模型在整体输出分布上非常接近。

如果:

KL 很大

说明模型行为发生了更大的变化。


18.1.1 理想的 Uncensored 模型

可以想象:

原模型:

Knowledge       ██████████
Reasoning       ██████████
Coding          ██████████
Refusal         ██████████


修改后:

Knowledge       ██████████
Reasoning       ██████████
Coding          ██████████
Refusal         ██

这就是理想目标:

只改变安全拒答相关行为,尽量不改变其他能力。

19. GGUF 量化与 Uncensored 是两件事

19.1 GGUF 不是去拒答技术

这是很多新用户最容易搞混的地方。

例如:

Qwen3.6-35B-A3B-Uncensored

可能先经过:

Abliteration

然后:

BF16
 ↓
GGUF
 ↓
Q6_K

因此:

Abliteration

负责:

改变模型行为。

而:

GGUF Quantization

负责:

降低模型存储和运行成本。

19.1.1 完整流程

Base Model
     ↓
Abliteration
     ↓
Uncensored BF16
     ↓
Quantization
     ↓
GGUF
     ↓
LM Studio / Ollama / llama.cpp

所以:

Uncensored GGUF 的 “Uncensored” 通常发生在 GGUF 量化之前。

20. Q6_K、Q8、Q4_K_M 到底有什么区别?

20.1 基本关系

通常可以理解:

FP16 / BF16
     ↓
Q8
     ↓
Q6
     ↓
Q5
     ↓
Q4
     ↓
Q3
     ↓
Q2

数字越低:

文件更小
显存需求更低

但通常也意味着:

潜在精度损失增加

20.1.1 为什么不是永远选择 Q8?

因为量化收益存在边际递减。

例如:

BF16
↓
Q8

可能:

质量损失很小
但是文件仍然很大

而:

Q6

可能已经:

质量非常接近 Q8
文件却明显更小

因此对于本地大模型:

Q6_K

往往是一个非常有吸引力的平衡点。


21. HauhauCS 的 Q6_K_P

21.1 什么是 Q6_K_P?

HauhauCS 提供了一些自己的量化版本,例如:

Q8_K_P
Q6_K_P
Q5_K_P
Q4_K_P

其核心理念是:

针对特定模型进行更加精细的量化策略。

可以理解为:

普通量化:

所有权重
 ↓
大致相同的量化策略

而模型专用量化:

分析模型
 ↓
找重要 Tensor
 ↓
重要区域保留更多精度
 ↓
不重要区域更激进压缩

22. imatrix 为什么重要?

现代 GGUF 量化经常使用:

Importance Matrix(重要性矩阵)

它的基本思想是:

哪些权重更重要?

不是所有参数对最终输出的影响都相同。

因此:

重要参数
 ↓
尽可能保护

不重要参数
 ↓
更积极量化

这样可以在:

文件大小

和:

模型质量

之间获得更好的平衡。


23. DavidAU 的 NEO IMATRIX

DavidAU 的 GGUF 进一步使用:

NEO IMATRIX

并针对不同 Tensor 使用不同策略。

例如:

Output Tensor
 ↓
部分保留 FP16

MTP Tensor
 ↓
Q8_0

其他 Tensor
 ↓
Q4 / Q5 / Q6

因此最终并不是简单:

所有东西统一 Q4

而是:

重要部分
 ↓
更高精度

普通部分
 ↓
更低精度

24. MTP 与模型能力有什么关系?

24.1 什么是 Multi-Token Prediction?

普通生成:

A
 ↓
B
 ↓
C
 ↓
D

每次主要预测下一个 Token。

MTP:

A
 ↓
预测多个未来 Token
 ↓
验证
 ↓
一次接受多个 Token

如果接受率较高:

生成速度 ↑

24.1.1 MTP 不等于模型智力提升

这是必须区分的:

Heretic
Abliteration
SFT
Merge

主要影响:

模型行为与能力。

而:

MTP

主要影响:

推理速度。

所以:

MTP ≠ Intelligence Upgrade

25. DavidAU 为什么有时候感觉“更聪明”?

原因并不是:

27B > 35B

而是:

Qwen3.6-27B
      ↓
Heretic
      ↓
Fable
      ↓
Claude Reasoning
      ↓
Polaris
      ↓
F451
      ↓
Fine-tuning
      ↓
Merge

也就是说:

DavidAU 的优势更多来自后续训练与融合,而不是参数量本身。

26. HauhauCS 与 DavidAU 技术路线完整对比

项目HauhauCS 35B-A3BDavidAU 27B Fable Fusion
BaseQwen3.6-35B-A3BQwen3.6-27B
架构MoEDense
总参数35B27B
Active~3B27B
核心路线Abliteration / Weight EditingHeretic + ARA + Fine-tuning + Merge
是否强调保持 Base 能力否,更强调综合增强
是否加入大量新数据不强调
Creative保持 Qwen 能力强化
Reasoning保持 Base强化
Roleplay保持 Base强化
Model Merge非主要路线核心路线
GGUF多种专用量化NEO IMATRIX + 特殊 Tensor 策略
MTP视具体版本支持
主要特点原版 Qwen 解锁版二次塑造后的综合模型

27. 为什么同样叫 Uncensored,实际表现却差很多?

27.1 第一层差异:Base 不同

HauhauCS
→ Qwen3.6-35B-A3B

DavidAU
→ Qwen3.6-27B

模型架构已经不同。


27.1.1 第二层差异:去拒答方式不同

HauhauCS
→ 重点是移除 refusal

而:

DavidAU
→ Heretic + ARA
→ 再进行后续训练

27.2 第三层差异:训练数据不同

HauhauCS:

尽量保持 Base

DavidAU:

Fable
Claude reasoning
Polaris
F451

因此最终行为自然不同。


27.2.1 第四层差异:Merge

DavidAU 进行了大量模型融合。

因此最终模型并不是任何一个单独 Base Model 的简单复制。


28. 如何正确阅读 Hugging Face 上的 Uncensored 模型?

28.1 不要先看名字

看到:

xxx-Uncensored-GGUF

不要马上判断:

这是一个很强的无审查模型。

应该先检查 Model Card。


28.1.1 第一项:Base Model

寻找:

Base Model
Based on
Model architecture

例如:

Qwen3.6-35B-A3B

或者:

Qwen3.6-27B

28.2 第二项:去拒答方法

寻找:

Abliteration
Heretic
ARA
Orthogonal Projection
Weight Editing

28.2.1 第三项:是否重新训练

寻找:

SFT
Fine-tuning
LoRA
QLoRA
DPO

28.3 第四项:是否 Merge

寻找:

Merge
Model Merge
SLERP
TIES
DARE
Task Arithmetic

等关键词。


28.3.1 第五项:Benchmark

至少查看:

MMLU
GSM8K
ARC
HumanEval
MBPP
AIME
GPQA

以及模型作者提供的专门测试。


28.4 第六项:Refusal Test

查看:

Refusal Rate
Refusal Benchmark
Safety Benchmark

但不要单独看这一项。


28.4.1 第七项:KL Divergence

如果作者提供:

KL Divergence

可以帮助判断:

模型到底改了多少。

29. 如何判断一个 Uncensored 模型是否值得下载?

29.1 一个实用的评价公式

可以建立一个简单的模型评分:

综合评分 =
能力保持率 × 40%
+
Reasoning × 20%
+
Coding × 15%
+
Instruction Following × 10%
+
Uncensored 程度 × 10%
+
量化质量 × 5%

当然,这不是科学 benchmark,只是一个实际选型框架。


29.1.1 为什么不能只看 Uncensored?

因为:

Uncensored = 行为属性

而:

Reasoning = 能力属性
Coding = 能力属性
Creative = 能力属性

两者不是一个维度。


30. 对本地大模型用户的最终选择建议

30.1 如果希望“原版 Qwen + 尽量少拒答”

优先考虑:

Abliterated
HauhauCS
Heretic

这类模型。

尤其关注:

Refusal ↓
KL Divergence ↓
Benchmark ≈ Base

30.1.1 如果希望“综合能力 + 创作 + Roleplay”

可以关注:

Fable
Fusion
Roleplay
Creative

路线。

DavidAU 这类多阶段 Merge 模型属于这一方向。


30.2 如果主要用于 Coding

不要因为模型名字中有:

Uncensored
Heretic
Fable

就认为它适合编程。

更应该寻找:

Coder
Code
Coding

专门训练的模型。

因为:

General Uncensored

与:

Code-specialized

是两个不同优化方向。


31. 从“去拒答”走向“能力修复”

31.1 第一代 Uncensored

早期思路:

Base
 ↓
Abliteration
 ↓
Uncensored

核心目标:

Refusal ↓

31.1.1 第二代

进一步加入:

Abliteration
 ↓
SFT
 ↓
修复能力

目标:

Refusal ↓
+
Capability Loss ↓

32. 新一代模型的完整路线

现在越来越合理的路线是:

Base Model
      ↓
Gentle Abliteration
      ↓
Evaluation
      ↓
SFT / QLoRA
      ↓
Capability Repair
      ↓
再次 Evaluation
      ↓
必要时再次 Abliteration
      ↓
Quantization
      ↓
GGUF

可以把它理解为:

不是单纯“删除安全”,而是“行为编辑 + 能力修复”。

32.1.1 为什么这是更好的路线?

因为简单 Abliteration 的问题是:

Refusal ↓
Capability ↓

而:

Abliteration + SFT

希望得到:

Refusal ↓↓↓
Capability ≈ Base

这实际上已经从:

“Uncensor”

逐渐发展为:

Model Behavior Editing

33. 总结:如何理解 Hugging Face 上的 Uncensored 生态?

可以用下面这张图概括:

                    Base Model
                        │
          ┌─────────────┴─────────────┐
          │                           │
       Fine-tuning                Abliteration
          │                           │
       LoRA/SFT                   Heretic/ARA
          │                           │
          └─────────────┬─────────────┘
                        │
                    Uncensored
                        │
                ┌───────┴───────┐
                │               │
             Model Merge    Capability Repair
                │               │
                └───────┬───────┘
                        │
                    Evaluation
                        │
                    Quantization
                        │
                  ┌─────┴─────┐
                  │           │
                GGUF        AWQ
                  │
             LM Studio
             Ollama
             llama.cpp

最终可以记住一句话:

Hugging Face 上的 Uncensored 是结果描述,而 AbliterationHereticSFTLoRAMerge 才是实现路径。

GGUFQ6_KQ6_K_PQ4_K_M 等,则主要属于模型发布与量化阶段,并不等于去拒答技术。


34. 最终对 HauhauCS 与 DavidAU 的定位

34.1 HauhauCS Qwen3.6-35B-A3B

可以定义为:

Qwen3.6-35B-A3B
        +
Abliteration / Weight Editing
        ↓
尽量保持原始能力
        +
尽量减少拒答

它适合:

原版 Qwen 用户
本地通用模型
希望保持 Base 行为
同时减少拒答

34.2 DavidAU Qwen3.6-27B Fable Fusion

可以定义为:

Qwen3.6-27B
        +
Heretic
        +
ARA
        +
Fable
        +
Reasoning
        +
Polaris
        +
F451
        +
Multi-stage Fine-tuning
        +
Multi-stage Merge
        ↓
Fable Fusion

它更适合:

Creative Writing
Roleplay
Reasoning
开放式对话
综合能力

35. 最值得记住的结论

如果只记住本文的十句话:

  1. Uncensored 不是一种固定技术,而是一种模型行为描述。
  2. Abliteration 的核心是寻找并削弱模型内部的拒答表征。
  3. Refusal Direction 可以通过对比不同输入的 Activation 来估计。
  4. Weight Editing 可以把 Abliteration 固化成一个新的模型 checkpoint。
  5. Heretic/ARA 可以看作更自动化、更复杂的 Abliteration 路线。
  6. SFT/LoRA 是通过重新训练模型行为来降低拒答。
  7. Model Merge 是通过融合不同模型的能力和行为改变最终模型。
  8. GGUF/Q6_K/Q4_K_M 是量化与部署格式,不是 Uncensored 技术。
  9. 真正优秀的 Uncensored 模型不是“拒答越低越好”,而是“拒答降低 + 原始能力损失最小”。
  10. 未来更值得关注的路线是 Abliteration + Capability Repair/SFT,而不是简单粗暴地删除拒答。

标签: none

添加新评论