LELexEdge词汇锋面
AI行业黑话

JailbreakvsRLHF

AI领域术语对比 — 快速理解两者的核心差异

概览对比

Jailbreak

Jailbreak 是让 LLM 绕过内置安全限制的技巧,通常通过角色扮演、假设场景或编码等方式让模型生成本应拒绝的内容。这是 AI 安全研究的重要课题。

RLHF

RLHF 是让 LLM 从「能说话」变成「说好话」的关键技术。ChatGPT 之所以比 GPT-3 好用得多,核心原因就是经过了 RLHF 训练,学会了遵循指令和拒绝有害请求。

核心要点

Jailbreak

  • 与 Prompt Injection 相关但目的不同
  • 常见手法:角色扮演、DAN、编码绕过
  • AI 公司和安全研究者之间的猫鼠游戏

RLHF

  • ChatGPT 成功的核心秘密之一
  • 流程:SFT → 训练奖励模型 → PPO 强化学习
  • 正在被 DPO 等更简单的方法逐步替代

正式定义

Jailbreak

RLHF

通过人类偏好反馈数据训练强化学习奖励模型来优化语言模型行为的技术

应用场景

Jailbreak

RLHF

  • 让 LLM 输出更符合人类期望
  • 减少有害和偏见内容生成
  • 提升模型的指令遵循能力

详细解读

Jailbreak

Jailbreak 是 AI 安全领域的核心挑战之一。攻击者通过各种创意手法绕过模型的安全对齐:让模型扮演没有限制的角色(DAN)、用 Base64 编码隐藏敏感内容、构造假设场景等。AI 公司持续修补漏洞,但新的 Jailbreak 方法不断出现,形成了猫鼠游戏。Jailbreak 研究对 AI 安全至关重要——只有了解攻击方式才能构建更好的防御。

RLHF

RLHF 由 OpenAI 在 InstructGPT 论文中系统化提出,包含三个阶段:首先用人工标注数据做监督微调(SFT),然后训练一个奖励模型(Reward Model)来模拟人类偏好,最后用 PPO 算法优化 LLM 使其输出最大化奖励。RLHF 的挑战在于人工标注成本高、奖励模型可能被 hack、以及训练不稳定。DPO 和 GRPO 等方法正在简化这一流程。

快速对比

维度JailbreakRLHF
类型行业黑话专业术语
标签Prompt Engineering、LLM模型训练、LLM
热度7585