Modelpedia
Work in progress
About
Findings
Models
Concepts
Methods
Datasets
Sources
Light
Dark
TAP (Tree of Attacks with Pruning)
anchor
Findings
IC-407
Safety-aligned LLMs (Llama-2-chat, Llama-3-instruct, Gemma, GPT-3.5, GPT-4o, R2D2) achieve 100% jailbreak attack success rate under adaptive prompt-and-suffix attacks on 50 harmful requests
[compared-to]
IC-572
Bijection learning achieves state-of-the-art jailbreak ASR on frontier models, with peak ASR increasing with model capability
[compared-to]