Modelpedia
Work in progress
About
Findings
Models
Concepts
Methods
Datasets
Sources
Light
Dark
OpenAI Moderation API
anchor
Findings
IC-750
Open-source models without safety training are significantly more vulnerable to jailbreak attacks than safety-aligned proprietary models
[eval]
IC-761
GPT-3.5-turbo and GPT-4 are susceptible to specific circulating jailbreaking prompts, with 'jailmommy' achieving a 71.16% success rate in producing toxic outputs
[eval]