LELexEdge词汇锋面
AI行业黑话

Jailbreak

越狱 · 撬开 AI 的安全锁

Prompt EngineeringLLM
JAIL
定义
JailbreakAI领域的行业黑话Jailbreak 是让 LLM 绕过内置安全限制的技巧,通常通过角色扮演、假设场景或编码等方式让模型生成本应拒绝的内容。

最后更新:2026-03-18

什么是Jailbreak?

Jailbreak 是让 LLM 绕过内置安全限制的技巧,通常通过角色扮演、假设场景或编码等方式让模型生成本应拒绝的内容。这是 AI 安全研究的重要课题。

  • 与 Prompt Injection 相关但目的不同
  • 常见手法:角色扮演、DAN、编码绕过
  • AI 公司和安全研究者之间的猫鼠游戏

Jailbreak详解

Jailbreak 是 AI 安全领域的核心挑战之一。攻击者通过各种创意手法绕过模型的安全对齐:让模型扮演没有限制的角色(DAN)、用 Base64 编码隐藏敏感内容、构造假设场景等。AI 公司持续修补漏洞,但新的 Jailbreak 方法不断出现,形成了猫鼠游戏。Jailbreak 研究对 AI 安全至关重要——只有了解攻击方式才能构建更好的防御。

Jailbreak怎么用?

越狱

想办法让 AI 说出它本来不该说的话

Jailbreak 是通过精心构造的 Prompt 绕过 LLM 安全限制的技巧,是 AI 安全研究的重要课题,也是模型对齐能力的试金石。

译:绕过 AI 模型安全限制的提示词技巧

真实语境对话示例

安全研究员

发现了一个新的 Jailbreak 方法,已经提交给 OpenAI 的 Bug Bounty 了

AI 开发者

每次模型更新都要重新测试 Jailbreak 防御,这是个永无止境的工作

社区用户

DAN 提示词又失效了,看来 OpenAI 又打了补丁

说人话

绕过 AI 模型安全限制的提示词技巧

关于Jailbreak的常见问题

Jailbreak 和 Prompt Injection 有什么区别
Prompt Injection 是让模型执行非预期指令,Jailbreak 专指绕过模型的安全限制让它输出被禁止的内容。
为什么 LLM 会被越狱
安全对齐基于训练而非硬编码规则,精心构造的提示可以让模型进入训练时未覆盖的状态,绕过安全限制。