Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!

2024-01-16 · ICLR 2024 oral · anchor

Findings