Why Some LLMs Are Harder to Jailbreak Than Others
Reinforcement Learning from Human Feedback (RLHF) is the primary mechanism that teaches large language models (LLMs) to refuse inappropriate requests, with models like GPT-4 showing greater jailbreak …