Modelpedia
Work in progress
About
Findings
Models
Concepts
Methods
Datasets
Sources
Light
Dark
EFFICIENT JAILBREAK ATTACK SEQUENCES ON LARGE LANGUAGE MODELS VIA MULTI-ARMED BANDIT-BASED CONTEXT SWITCHING
2025-01-22
· ICLR 2025 Poster ·
anchor
Findings
IC-421
Sequential context-switching queries jailbreak Llama and Mistral models at 95% attack success rate
IC-422
Safety fine-tuning in Llama models improves with parameter size but exhibits diminishing returns
IC-423
Llama-3.1-8B-Instruct achieves 97.8% accuracy as a zero-shot toxicity classifier on ToxiGen, outperforming Llama-3-Guard-1B and matching Llama-3-Guard-8B