abliteration
1 resources across 1 kinds
Tools
- Open ↗Hereticdual-usehigh-risklicence
Heretic automatically removes safety alignment ("abliteration") from transformer language models by orthogonalizing components against identified refusal directions, using an optimizer that minimizes KL divergence on benign prompts to preserve general capability.