AI行业黑话
Jailbreak
越狱 · 撬开 AI 的安全锁
Prompt EngineeringLLM
JAIL
- 定义
- Jailbreak是AI领域的行业黑话。Jailbreak 是让 LLM 绕过内置安全限制的技巧,通常通过角色扮演、假设场景或编码等方式让模型生成本应拒绝的内容。
最后更新:2026-03-18
什么是Jailbreak?
Jailbreak 是让 LLM 绕过内置安全限制的技巧,通常通过角色扮演、假设场景或编码等方式让模型生成本应拒绝的内容。这是 AI 安全研究的重要课题。
- 与 Prompt Injection 相关但目的不同
- 常见手法:角色扮演、DAN、编码绕过
- AI 公司和安全研究者之间的猫鼠游戏
Jailbreak详解
Jailbreak 是 AI 安全领域的核心挑战之一。攻击者通过各种创意手法绕过模型的安全对齐:让模型扮演没有限制的角色(DAN)、用 Base64 编码隐藏敏感内容、构造假设场景等。AI 公司持续修补漏洞,但新的 Jailbreak 方法不断出现,形成了猫鼠游戏。Jailbreak 研究对 AI 安全至关重要——只有了解攻击方式才能构建更好的防御。
Jailbreak怎么用?
越狱
想办法让 AI 说出它本来不该说的话
Jailbreak 是通过精心构造的 Prompt 绕过 LLM 安全限制的技巧,是 AI 安全研究的重要课题,也是模型对齐能力的试金石。
译:绕过 AI 模型安全限制的提示词技巧
真实语境对话示例
安全研究员
发现了一个新的 Jailbreak 方法,已经提交给 OpenAI 的 Bug Bounty 了
AI 开发者
每次模型更新都要重新测试 Jailbreak 防御,这是个永无止境的工作
社区用户
DAN 提示词又失效了,看来 OpenAI 又打了补丁
说人话
绕过 AI 模型安全限制的提示词技巧
Jailbreak的参考来源
关于Jailbreak的常见问题
- Jailbreak 和 Prompt Injection 有什么区别
- Prompt Injection 是让模型执行非预期指令,Jailbreak 专指绕过模型的安全限制让它输出被禁止的内容。
- 为什么 LLM 会被越狱
- 安全对齐基于训练而非硬编码规则,精心构造的提示可以让模型进入训练时未覆盖的状态,绕过安全限制。