Hugging Face Uncensored 与 Abliteration 模型深度解析:从拒答机制到 Heretic、模型融合与 GGUF 量化
Hugging Face Uncensored 与 Abliteration 模型深度解析:从拒答机制到 Heretic、模型融合与 GGUF 量化
本文系统介绍 Hugging Face 上常见的
Uncensored、Abliterated、Heretic模型到底是如何制作出来的,并以 Qwen3.6 系列的实际模型为例,深入分析 Abliteration、Heretic、ARA、SFT、LoRA、Model Merge、GGUF 量化以及 MTP 等技术之间的关系。如果你曾经在 Hugging Face 上看到
Qwen3.6-35B-A3B-Uncensored、Qwen3.6-27B-Fable-Fusion、Heretic、Abliterated等模型,却不知道它们究竟修改了模型的什么部分,那么本文可以作为一份完整的技术入门与实践指南。
1. 什么是 Hugging Face 上的 Uncensored 模型?
1.1 Uncensored 到底是什么意思?
在 Hugging Face 模型社区中,经常可以看到:
UncensoredAbliteratedHereticDisinhibitedNo RefusalJailbreakNSFWRoleplay
等名称。
这些名称看起来非常相似,但实际上代表的技术路线可能完全不同。
首先必须明确:
Uncensored 并不是一种标准的模型技术,也不是一个统一的模型架构。
它更多是模型作者对模型行为的描述。
一个模型被称为 Uncensored,通常意味着:
原始模型
↓
减少或者移除拒答行为
↓
面对原本容易触发拒答的问题时
更加倾向于直接回答但实现方式可能包括:
Fine-tuning
LoRA / QLoRA
Abliteration
Heretic
Model Merge
Inference-time Steering
Weight Editing甚至可能是多个方法组合。
1.2 为什么大语言模型会拒答?
理解 Uncensored 模型之前,需要先理解原始模型为什么会拒答。
一个经过安全对齐的模型,大致经历:
预训练
↓
Instruction Tuning
↓
SFT
↓
Preference Optimization
↓
Safety Alignment
↓
最终模型模型在安全对齐过程中学习了大量:
敏感问题
↓
拒绝回答这样的行为模式。
因此模型并不存在一个简单的:
safety = true开关。
拒答实际上是模型学习出来的一种行为。
1.2.1 拒答行为可以如何理解?
可以把 Transformer 内部的计算简化为:
用户输入
↓
Tokenizer
↓
Transformer Layers
↓
Hidden States
↓
Logits
↓
Token Probability
↓
最终回答当输入被模型判断为某类敏感请求时,内部表征可能发生变化:
输入
↓
某些语义特征
↓
安全相关表征
↓
拒答倾向增强
↓
"I can't help..."因此所谓的“去拒答”,实际上是在尝试改变:
输入
↓
内部表征
↓
拒答行为这一映射关系。
2. Uncensored 模型主要有哪些技术路线?
2.1 Counteralignment Fine-tuning
Counteralignment Fine-tuning 可以理解为:
通过新的训练数据覆盖模型原有的拒答行为。
最简单的数据结构类似:
用户问题
↓
直接回答而不是:
用户问题
↓
拒答2.1.1 SFT 如何改变模型行为?
监督微调(SFT)的目标是让模型提高目标回答的概率。
假设原模型:
敏感问题
拒答概率:80%
正常回答:20%经过大量针对性训练以后:
敏感问题
拒答概率:10%
正常回答:90%模型就可能逐渐形成新的行为模式。
2.1.2 LoRA 与 QLoRA
对于几十亿甚至几百亿参数模型,全参数微调成本很高。
因此常见方式是:
Base Model
+
LoRA Adapter
↓
新模型行为LoRA 可以简单表示为:
W' = W + ΔW其中:
ΔW = B × AA、B 是低秩矩阵。
这样就不需要直接修改整个模型的全部参数。
2.1.3 Fine-tuning 的优点
主要优点:
- 行为改变比较彻底
- 泛化能力通常比单纯 Prompt 更好
- 多轮对话稳定性较好
- 可以得到独立模型
- 可以进一步 Merge
- 可以通过 LoRA 降低训练成本
2.1.4 Fine-tuning 的缺点
最大问题是:
容易改变模型原本的能力。
例如训练数据过于集中,可能出现:
拒答 ↓
但是:
推理能力 ↓
知识保持 ↓
Instruction Following ↓
语言能力 ↓因此真正困难的不是让模型“不拒答”,而是:
在减少拒答的同时尽可能保留原始模型能力。
3. Abliteration:目前非常重要的 Uncensored 技术
3.1 什么是 Abliteration?
Abliteration 可以理解为:
在模型内部找到与拒答相关的方向,然后对这个方向进行削弱或消除。
它与 Fine-tuning 最大的区别是:
Fine-tuning:
数据
↓
训练
↓
改变权重而 Abliteration 更接近:
模型
↓
分析内部 Activation
↓
寻找拒答方向
↓
修改权重
↓
得到新模型因此 Abliteration 通常不需要进行大规模重新训练。
3.1.1 什么是 Refusal Direction?
Transformer 中的 Hidden State 可以表示为一个高维向量:
h ∈ R^d可以把它想象成高维空间中的一个点。
假设模型处理两类输入:
正常问题和:
容易触发拒答的问题分别得到:
H_normal
H_refusal然后计算两组 Activation 的平均差异:
d = mean(H_refusal) - mean(H_normal)这个 d 可以作为:
Refusal Direction(拒答方向)
的近似。
3.1.2 如何消除拒答方向?
假设:
h = n + r其中:
n = 正常信息
r = 拒答相关成分那么可以尝试:
h' = h - αr其中 α 控制修改强度。
如果:
α 太小则:
拒答仍然存在如果:
α 太大则可能:
拒答下降
但是模型能力也下降因此 Abliteration 的核心问题实际上是:
如何最大程度消除拒答,同时最小程度影响模型原始能力。
4. 从 Activation Editing 到 Weight Editing
4.1 Inference-time Activation Steering
最简单的方式是在推理过程中修改 Hidden State:
原始 Hidden State
↓
h
↓
减去 refusal direction
↓
h'
↓
继续推理公式:
h' = h - αr这种方式属于:
Inference-time Steering
优点是不会永久修改模型。
4.1.1 优点
主要优点:
- 不需要重新训练
- 原始模型保持不变
- 可以随时关闭
- 可以实时调整强度
- 非常适合研究模型内部行为
例如:
Mode A
↓
原始模型
Mode B
↓
Steering
Mode C
↓
更强 Steering4.1.2 缺点
最大问题:
不一定对所有输入都有效。
可能出现:
问题 A → 正常回答
问题 B → 正常回答
问题 C → 仍然拒答同时:
α = 0.5可能表现很好。
而:
α = 2.0可能导致模型行为异常。
5. Orthogonal Projection:把 Abliteration 固化到模型权重
5.1 为什么要修改权重?
如果只修改 Activation:
h' = h - αr每次推理都需要特殊代码。
如果希望得到一个:
model.safetensors形式的独立模型,就需要将修改固化到权重中。
5.1.1 权重投影
假设某个权重矩阵:
W存在与拒答方向相关的成分。
可以进行正交投影:
W_new = W - d(dᵀW)直观理解:
原始权重
↓
找到 refusal component
↓
投影掉 refusal component
↓
新的权重最终得到:
Base Model
↓
Weight Editing
↓
Abliterated Model6. 为什么简单 Abliteration 并不完美?
6.1 拒答不是一个简单的一维向量
这是理解 Abliteration 最重要的一点。
如果拒答真的只是:
一个向量那么:
找到向量
↓
删掉
↓
完成即可。
但实际模型可能存在:
Refusal Direction 1
Refusal Direction 2
Refusal Direction 3
...而且不同 Transformer Layer 可能存在不同程度的拒答表征。
因此实际过程更像:
Layer 10
↓
refusal component
Layer 15
↓
refusal component
Layer 20
↓
refusal component
Layer 25
↓
refusal component6.1.1 为什么删除过多会损伤模型?
因为拒答相关表征并不一定与其他能力完全正交。
例如:
Safety
│
│
Reasoning ─── Hidden State ─── Knowledge
│
│
Instruction Following如果修改方向不够精准,就可能同时影响:
- Reasoning
- Knowledge
- Instruction Following
- Helpfulness
- Language Style
最终可能得到:
拒答 ↓↓↓
+
智力 ↓
+
推理 ↓
+
幻觉 ↑因此高质量 Abliteration 的目标不是:
删除所有拒答。
而是:
在能力保持率和拒答降低之间找到最佳平衡。
7. Heretic:Abliteration 自动化路线
7.1 Heretic 是什么?
Heretic 可以理解为:
自动化、优化后的模型去拒答流程。
简单 Abliteration:
寻找 refusal direction
↓
手动选择强度
↓
修改权重而 Heretic 更强调:
寻找拒答方向
↓
自动寻找最佳修改位置
↓
自动寻找修改强度
↓
测试模型
↓
优化7.1.1 为什么需要自动优化?
核心问题是:
应该修改多少?修改太少:
Refusal 仍然存在修改太多:
模型能力下降因此可以把问题理解成:
Minimize Refusal
+
Minimize Behavioral Damage8. ARA:Arbitrary-Rank Ablation
8.1 什么是 ARA?
ARA 的全称是:
Arbitrary-Rank Ablation
它可以理解成对简单单方向 Abliteration 的扩展。
简单方法可能假设:
Refusal ≈ 一个主要方向而 ARA 可以处理:
Refusal
↓
多个相关方向
↓
一个低秩子空间即:
Rank = N而不是简单:
Rank = 18.1.1 为什么多方向方法更有意义?
如果拒答行为分布在多个相关方向:
r1
/
-----●------ r2
/
r3只删除:
r1可能仍然存在:
r2
r3因此更完整的消融可以处理一个低秩子空间。
9. Model Merge:另一条常见路线
9.1 什么是模型融合?
假设:
Model A是原始模型:
Model B是更加开放或者具有不同能力的模型。
最简单的权重平均:
W_new = (1 - α)WA + αWB例如:
α = 0.3意味着:
70% A
30% B9.1.1 为什么 Merge 可以改变模型行为?
因为两个模型可能具有不同的行为分布。
例如:
Model A
↓
Reasoning 强
Safety 强
Refusal 多而:
Model B
↓
Creative 强
Roleplay 强
Refusal 少融合以后:
A + B
↓
新的行为分布9.1.2 Model Merge 的缺点
最大的风险:
两个模型的能力可能互相冲突。
结果可能出现:
推理 ↑
创作 ↑也可能出现:
推理 ↓
创作 ↓
Instruction Following ↓因此 Merge 更像实验性模型工程。
10. Hugging Face 上的 Uncensored 模型到底是哪一种?
10.1 Uncensored 不能代表具体技术
这是选择模型时最重要的原则。
例如:
Qwen3.6-XXX-Uncensored不能直接推断:
一定使用 Abliteration它可能是:
SFT
LoRA
Abliteration
Heretic
Merge或者多个方法的组合。
10.1.1 Abliterated 的技术含义更明确
一般来说:
xxx-abliterated意味着作者声称:
使用了 Abliteration而:
xxx-heretic通常意味着:
使用 Heretic 或相关自动化 Abliteration 流程但最终仍然应该阅读 Model Card。
11. 实际案例一:HauhauCS Qwen3.6-35B-A3B
11.1 Base Model
HauhauCS 模型基于:
Qwen3.6-35B-A3B它是一个:
35B 总参数
约 3B Active Parameters
MoE模型采用大量专家,通过 Router 为每个 Token 选择部分专家。
11.1.1 为什么 35B-A3B 不是普通 35B?
这里非常容易误解。
35B表示模型总参数规模。
而:
A3B表示每个 Token 实际激活的参数规模大约为 3B。
因此:
Dense 27B与:
MoE 35B-A3B不能简单用参数量直接比较。
12. HauhauCS 的去拒答路线
12.1 核心目标
HauhauCS 的模型卡强调:
不改变数据集
不改变原始能力
只减少拒答因此其理念可以表示为:
Qwen3.6-35B-A3B
↓
Abliteration / Weight Editing
↓
HauhauCS Uncensored目标是:
能力 ≈ Base Model
Refusal ↓↓↓12.1.1 为什么叫 Aggressive?
Aggressive 主要代表:
更激进地降低拒答而不是:
更聪明可以理解为:
Balanced
↓
保留更多原始安全行为
Aggressive
↓
更彻底减少拒答13. 实际案例二:DavidAU Qwen3.6-27B Fable Fusion
13.1 Base Model
DavidAU 模型基于:
Qwen3.6-27B与 HauhauCS 不同:
HauhauCS
→ 35B-A3B MoE
DavidAU
→ 27B Dense因此两者架构本身就不同。
14. DavidAU 的模型制作路线
14.1 它不是简单 Abliteration
DavidAU 的路线更加复杂:
Qwen3.6-27B
↓
Heretic + ARA
↓
Uncensored
↓
Fine-tuning
↓
Fable
↓
Claude Reasoning
↓
Polaris
↓
F451
↓
Multi-stage Merge
↓
再次 Fine-tuning
↓
Fable Fusion因此:
DavidAU 更准确地说是“去拒答 + 能力重塑 + 多模型融合”的模型。
14.1.1 为什么加入 Fable?
Fable 相关数据主要影响:
- Creative Writing
- Roleplay
- Storytelling
- Style
- Character Behavior
因此它可能比单纯 Abliterated Qwen 更具有明显的创作人格。
14.1.2 为什么加入 Claude Reasoning?
其模型卡提到加入了 Claude reasoning/thinking traces。
其目的不是简单删除拒答,而是进一步改变:
Reasoning
Thinking
Problem Solving等行为。
14.1.3 为什么加入 Polaris?
Polaris 数据进一步用于:
Reasoning
General Intelligence
Instruction Following等方面。
因此最终模型已经不再只是:
Qwen3.6-27B - Safety而是:
Qwen3.6-27B
+
多个能力数据集
+
多个模型行为
+
多个 Merge15. 两个模型为什么实际表现不同?
15.1 HauhauCS 更像“原版 Qwen 的解锁版”
可以把它简化为:
Qwen3.6
-
Refusal
=
HauhauCS它追求:
Base Capability ≈ Uncensored Capability因此使用时更容易产生:
“这就是 Qwen,只是少了拒答。”
的感觉。
15.1.1 DavidAU 更像“重新塑造过的 Qwen”
它更接近:
Qwen
+
Heretic
+
Fable
+
Reasoning
+
Polaris
+
Fine-tuning
+
Merge所以:
Creative Writing
↑
Roleplay
↑
Reasoning
↑
Personality
改变都会更加明显。
16. 两个模型的 Benchmark 对比
16.1 DavidAU 的公开 Benchmark
DavidAU 模型卡报告的结果:
| Benchmark | Qwen3.6-27B | DavidAU 8-bit |
|---|---|---|
| ARC-C | 0.647 | 0.711 |
| ARC-E | 0.803 | 0.879 |
| BoolQ | 0.910 | 0.910 |
| HSwag | 0.773 | 0.790 |
| OBQA | 0.450 | 0.514 |
| PIQA | 0.806 | 0.823 |
| Wino | 0.742 | 0.763 |
可以看到:
ARC-C
0.647 → 0.711
ARC-E
0.803 → 0.879
OBQA
0.450 → 0.514等指标出现提升。
这说明 DavidAU 并不是单纯通过删除拒答来改变模型。
16.1.1 4-bit 的表现
模型卡还给出了 4-bit 结果:
| Benchmark | 8-bit | 4-bit |
|---|---|---|
| ARC-C | 0.711 | 0.701 |
| ARC-E | 0.879 | 0.873 |
| BoolQ | 0.910 | 0.909 |
| HSwag | 0.790 | 0.786 |
| OBQA | 0.514 | 0.488 |
| PIQA | 0.823 | 0.813 |
| Wino | 0.763 | 0.759 |
可以看到:
合理的 4-bit 量化并没有让模型能力发生灾难性下降。
17. Refusal Benchmark 应该怎么看?
17.1 “0 Refusal”并不等于模型更强
这是非常重要的一点。
假设:
Model A
Refusal = 0%
IQ = 80而:
Model B
Refusal = 5%
IQ = 100如果你的目标是:
综合能力那么 Model B 很可能更优秀。
因此评价 Uncensored 模型不能只看:
Refusal Rate还应该同时看:
Reasoning
Coding
Knowledge
Instruction Following
Hallucination
Long Context17.1.1 理想状态
最理想的模型是:
Refusal
↓↓↓
正常能力
≈ Base Model而不是:
Refusal
↓↓↓
正常能力
↓↓↓18. KL Divergence 为什么重要?
18.1 KL Divergence 的作用
KL Divergence 可以用于衡量:
原模型输出分布与:
修改后模型输出分布之间的差异。
如果:
KL ≈ 0说明两个模型在整体输出分布上非常接近。
如果:
KL 很大说明模型行为发生了更大的变化。
18.1.1 理想的 Uncensored 模型
可以想象:
原模型:
Knowledge ██████████
Reasoning ██████████
Coding ██████████
Refusal ██████████
修改后:
Knowledge ██████████
Reasoning ██████████
Coding ██████████
Refusal ██这就是理想目标:
只改变安全拒答相关行为,尽量不改变其他能力。
19. GGUF 量化与 Uncensored 是两件事
19.1 GGUF 不是去拒答技术
这是很多新用户最容易搞混的地方。
例如:
Qwen3.6-35B-A3B-Uncensored可能先经过:
Abliteration然后:
BF16
↓
GGUF
↓
Q6_K因此:
Abliteration负责:
改变模型行为。
而:
GGUF Quantization负责:
降低模型存储和运行成本。
19.1.1 完整流程
Base Model
↓
Abliteration
↓
Uncensored BF16
↓
Quantization
↓
GGUF
↓
LM Studio / Ollama / llama.cpp所以:
Uncensored GGUF 的 “Uncensored” 通常发生在 GGUF 量化之前。20. Q6_K、Q8、Q4_K_M 到底有什么区别?
20.1 基本关系
通常可以理解:
FP16 / BF16
↓
Q8
↓
Q6
↓
Q5
↓
Q4
↓
Q3
↓
Q2数字越低:
文件更小
显存需求更低但通常也意味着:
潜在精度损失增加20.1.1 为什么不是永远选择 Q8?
因为量化收益存在边际递减。
例如:
BF16
↓
Q8可能:
质量损失很小
但是文件仍然很大而:
Q6可能已经:
质量非常接近 Q8
文件却明显更小因此对于本地大模型:
Q6_K往往是一个非常有吸引力的平衡点。
21. HauhauCS 的 Q6_K_P
21.1 什么是 Q6_K_P?
HauhauCS 提供了一些自己的量化版本,例如:
Q8_K_P
Q6_K_P
Q5_K_P
Q4_K_P其核心理念是:
针对特定模型进行更加精细的量化策略。
可以理解为:
普通量化:
所有权重
↓
大致相同的量化策略而模型专用量化:
分析模型
↓
找重要 Tensor
↓
重要区域保留更多精度
↓
不重要区域更激进压缩22. imatrix 为什么重要?
现代 GGUF 量化经常使用:
Importance Matrix(重要性矩阵)
它的基本思想是:
哪些权重更重要?不是所有参数对最终输出的影响都相同。
因此:
重要参数
↓
尽可能保护
不重要参数
↓
更积极量化这样可以在:
文件大小和:
模型质量之间获得更好的平衡。
23. DavidAU 的 NEO IMATRIX
DavidAU 的 GGUF 进一步使用:
NEO IMATRIX并针对不同 Tensor 使用不同策略。
例如:
Output Tensor
↓
部分保留 FP16
MTP Tensor
↓
Q8_0
其他 Tensor
↓
Q4 / Q5 / Q6因此最终并不是简单:
所有东西统一 Q4而是:
重要部分
↓
更高精度
普通部分
↓
更低精度24. MTP 与模型能力有什么关系?
24.1 什么是 Multi-Token Prediction?
普通生成:
A
↓
B
↓
C
↓
D每次主要预测下一个 Token。
MTP:
A
↓
预测多个未来 Token
↓
验证
↓
一次接受多个 Token如果接受率较高:
生成速度 ↑24.1.1 MTP 不等于模型智力提升
这是必须区分的:
Heretic
Abliteration
SFT
Merge主要影响:
模型行为与能力。
而:
MTP主要影响:
推理速度。
所以:
MTP ≠ Intelligence Upgrade25. DavidAU 为什么有时候感觉“更聪明”?
原因并不是:
27B > 35B而是:
Qwen3.6-27B
↓
Heretic
↓
Fable
↓
Claude Reasoning
↓
Polaris
↓
F451
↓
Fine-tuning
↓
Merge也就是说:
DavidAU 的优势更多来自后续训练与融合,而不是参数量本身。
26. HauhauCS 与 DavidAU 技术路线完整对比
| 项目 | HauhauCS 35B-A3B | DavidAU 27B Fable Fusion |
|---|---|---|
| Base | Qwen3.6-35B-A3B | Qwen3.6-27B |
| 架构 | MoE | Dense |
| 总参数 | 35B | 27B |
| Active | ~3B | 27B |
| 核心路线 | Abliteration / Weight Editing | Heretic + ARA + Fine-tuning + Merge |
| 是否强调保持 Base 能力 | 是 | 否,更强调综合增强 |
| 是否加入大量新数据 | 不强调 | 是 |
| Creative | 保持 Qwen 能力 | 强化 |
| Reasoning | 保持 Base | 强化 |
| Roleplay | 保持 Base | 强化 |
| Model Merge | 非主要路线 | 核心路线 |
| GGUF | 多种专用量化 | NEO IMATRIX + 特殊 Tensor 策略 |
| MTP | 视具体版本 | 支持 |
| 主要特点 | 原版 Qwen 解锁版 | 二次塑造后的综合模型 |
27. 为什么同样叫 Uncensored,实际表现却差很多?
27.1 第一层差异:Base 不同
HauhauCS
→ Qwen3.6-35B-A3B
DavidAU
→ Qwen3.6-27B模型架构已经不同。
27.1.1 第二层差异:去拒答方式不同
HauhauCS
→ 重点是移除 refusal而:
DavidAU
→ Heretic + ARA
→ 再进行后续训练27.2 第三层差异:训练数据不同
HauhauCS:
尽量保持 BaseDavidAU:
Fable
Claude reasoning
Polaris
F451因此最终行为自然不同。
27.2.1 第四层差异:Merge
DavidAU 进行了大量模型融合。
因此最终模型并不是任何一个单独 Base Model 的简单复制。
28. 如何正确阅读 Hugging Face 上的 Uncensored 模型?
28.1 不要先看名字
看到:
xxx-Uncensored-GGUF不要马上判断:
这是一个很强的无审查模型。
应该先检查 Model Card。
28.1.1 第一项:Base Model
寻找:
Base Model
Based on
Model architecture例如:
Qwen3.6-35B-A3B或者:
Qwen3.6-27B28.2 第二项:去拒答方法
寻找:
Abliteration
Heretic
ARA
Orthogonal Projection
Weight Editing28.2.1 第三项:是否重新训练
寻找:
SFT
Fine-tuning
LoRA
QLoRA
DPO28.3 第四项:是否 Merge
寻找:
Merge
Model Merge
SLERP
TIES
DARE
Task Arithmetic等关键词。
28.3.1 第五项:Benchmark
至少查看:
MMLU
GSM8K
ARC
HumanEval
MBPP
AIME
GPQA以及模型作者提供的专门测试。
28.4 第六项:Refusal Test
查看:
Refusal Rate
Refusal Benchmark
Safety Benchmark但不要单独看这一项。
28.4.1 第七项:KL Divergence
如果作者提供:
KL Divergence可以帮助判断:
模型到底改了多少。
29. 如何判断一个 Uncensored 模型是否值得下载?
29.1 一个实用的评价公式
可以建立一个简单的模型评分:
综合评分 =
能力保持率 × 40%
+
Reasoning × 20%
+
Coding × 15%
+
Instruction Following × 10%
+
Uncensored 程度 × 10%
+
量化质量 × 5%当然,这不是科学 benchmark,只是一个实际选型框架。
29.1.1 为什么不能只看 Uncensored?
因为:
Uncensored = 行为属性而:
Reasoning = 能力属性
Coding = 能力属性
Creative = 能力属性两者不是一个维度。
30. 对本地大模型用户的最终选择建议
30.1 如果希望“原版 Qwen + 尽量少拒答”
优先考虑:
Abliterated
HauhauCS
Heretic这类模型。
尤其关注:
Refusal ↓
KL Divergence ↓
Benchmark ≈ Base30.1.1 如果希望“综合能力 + 创作 + Roleplay”
可以关注:
Fable
Fusion
Roleplay
Creative路线。
DavidAU 这类多阶段 Merge 模型属于这一方向。
30.2 如果主要用于 Coding
不要因为模型名字中有:
Uncensored
Heretic
Fable就认为它适合编程。
更应该寻找:
Coder
Code
Coding专门训练的模型。
因为:
General Uncensored与:
Code-specialized是两个不同优化方向。
31. 从“去拒答”走向“能力修复”
31.1 第一代 Uncensored
早期思路:
Base
↓
Abliteration
↓
Uncensored核心目标:
Refusal ↓31.1.1 第二代
进一步加入:
Abliteration
↓
SFT
↓
修复能力目标:
Refusal ↓
+
Capability Loss ↓32. 新一代模型的完整路线
现在越来越合理的路线是:
Base Model
↓
Gentle Abliteration
↓
Evaluation
↓
SFT / QLoRA
↓
Capability Repair
↓
再次 Evaluation
↓
必要时再次 Abliteration
↓
Quantization
↓
GGUF可以把它理解为:
不是单纯“删除安全”,而是“行为编辑 + 能力修复”。
32.1.1 为什么这是更好的路线?
因为简单 Abliteration 的问题是:
Refusal ↓
Capability ↓而:
Abliteration + SFT希望得到:
Refusal ↓↓↓
Capability ≈ Base这实际上已经从:
“Uncensor”
逐渐发展为:
Model Behavior Editing
33. 总结:如何理解 Hugging Face 上的 Uncensored 生态?
可以用下面这张图概括:
Base Model
│
┌─────────────┴─────────────┐
│ │
Fine-tuning Abliteration
│ │
LoRA/SFT Heretic/ARA
│ │
└─────────────┬─────────────┘
│
Uncensored
│
┌───────┴───────┐
│ │
Model Merge Capability Repair
│ │
└───────┬───────┘
│
Evaluation
│
Quantization
│
┌─────┴─────┐
│ │
GGUF AWQ
│
LM Studio
Ollama
llama.cpp最终可以记住一句话:
Hugging Face 上的Uncensored是结果描述,而Abliteration、Heretic、SFT、LoRA、Merge才是实现路径。
而 GGUF、Q6_K、Q6_K_P、Q4_K_M 等,则主要属于模型发布与量化阶段,并不等于去拒答技术。
34. 最终对 HauhauCS 与 DavidAU 的定位
34.1 HauhauCS Qwen3.6-35B-A3B
可以定义为:
Qwen3.6-35B-A3B
+
Abliteration / Weight Editing
↓
尽量保持原始能力
+
尽量减少拒答它适合:
原版 Qwen 用户
本地通用模型
希望保持 Base 行为
同时减少拒答34.2 DavidAU Qwen3.6-27B Fable Fusion
可以定义为:
Qwen3.6-27B
+
Heretic
+
ARA
+
Fable
+
Reasoning
+
Polaris
+
F451
+
Multi-stage Fine-tuning
+
Multi-stage Merge
↓
Fable Fusion它更适合:
Creative Writing
Roleplay
Reasoning
开放式对话
综合能力35. 最值得记住的结论
如果只记住本文的十句话:
- Uncensored 不是一种固定技术,而是一种模型行为描述。
- Abliteration 的核心是寻找并削弱模型内部的拒答表征。
- Refusal Direction 可以通过对比不同输入的 Activation 来估计。
- Weight Editing 可以把 Abliteration 固化成一个新的模型 checkpoint。
- Heretic/ARA 可以看作更自动化、更复杂的 Abliteration 路线。
- SFT/LoRA 是通过重新训练模型行为来降低拒答。
- Model Merge 是通过融合不同模型的能力和行为改变最终模型。
- GGUF/Q6_K/Q4_K_M 是量化与部署格式,不是 Uncensored 技术。
- 真正优秀的 Uncensored 模型不是“拒答越低越好”,而是“拒答降低 + 原始能力损失最小”。
- 未来更值得关注的路线是
Abliteration + Capability Repair/SFT,而不是简单粗暴地删除拒答。