LELexEdge词汇锋面
AI行业黑话

JailbreakvsPrompt Injection

AI领域术语对比 — 快速理解两者的核心差异

概览对比

Jailbreak

Jailbreak 是让 LLM 绕过内置安全限制的技巧,通常通过角色扮演、假设场景或编码等方式让模型生成本应拒绝的内容。这是 AI 安全研究的重要课题。

Prompt Injection

Prompt Injection 是 LLM 应用面临的最大安全威胁——攻击者通过精心构造的输入让模型忽略系统指令、泄露敏感信息或执行恶意操作。目前没有完美的防御方案。

核心要点

Jailbreak

  • 与 Prompt Injection 相关但目的不同
  • 常见手法:角色扮演、DAN、编码绕过
  • AI 公司和安全研究者之间的猫鼠游戏

Prompt Injection

  • LLM 应用的头号安全威胁
  • 类似于传统 Web 安全中的 SQL 注入
  • 目前没有完美的防御方案,只能多层缓解

正式定义

Jailbreak

Prompt Injection

通过恶意构造的输入操纵大语言模型绕过安全限制或执行非预期行为的攻击技术

应用场景

Jailbreak

Prompt Injection

  • AI 应用的安全评估
  • LLM 系统的红队测试
  • 安全防御策略的设计

详细解读

Jailbreak

Jailbreak 是 AI 安全领域的核心挑战之一。攻击者通过各种创意手法绕过模型的安全对齐:让模型扮演没有限制的角色(DAN)、用 Base64 编码隐藏敏感内容、构造假设场景等。AI 公司持续修补漏洞,但新的 Jailbreak 方法不断出现,形成了猫鼠游戏。Jailbreak 研究对 AI 安全至关重要——只有了解攻击方式才能构建更好的防御。

Prompt Injection

Prompt Injection 分为直接注入(用户直接输入恶意 Prompt)和间接注入(恶意内容嵌入在模型处理的外部数据中)。攻击者可以让模型忽略 System Prompt 的限制、泄露系统指令、或执行非预期的工具调用。防御手段包括:输入过滤、输出检测、权限最小化、以及使用专门的安全模型做前置检查。但由于 LLM 的本质是处理自然语言,完全防御 Prompt Injection 在理论上可能不可能。

快速对比

维度JailbreakPrompt Injection
类型行业黑话专业术语
标签Prompt Engineering、LLMPrompt Engineering、应用安全
热度7578

共同关联术语

System Prompt
Jailbreak vs Prompt Injection | LexEdge