Probe before You Talk: Towards Black-box Defense against Backdoor Unalignment for Large Language Models

2025-01-22 · ICLR 2025 Poster · anchor

Findings