SORRY-Bench: Systematically Evaluating Large Language Model Safety Refusal

2025-01-22 · ICLR 2025 Poster · anchor

Findings