治理安全与历史 进阶 约 20 分钟 更新 2026-10-02

模型安全:越狱、红队与安全对齐

学习状态:
未学

一句话定义

模型安全通过安全训练(把拒答与边界行为训进模型)、红队测试(主动攻防找漏洞)与部署防护(输入输出过滤、权限控制)三层防线,对抗越狱、提示注入与滥用;这是一场持续演化的攻防,而非一次性达标。

为什么重要

对齐后的模型仍会被「说服」做出有害输出:越狱技术从角色扮演演化到自动化对抗后缀;提示注入让「模型读到的网页」变成攻击面。构建任何面向公众的 LLM 应用,安全设计都是合规与道德的底线,也是本库「争议与伦理」维度的技术根基。

前置知识

核心概念

原理与机制

安全行为本质是「统计行为」:模型学到的是「这类请求通常应拒答」的模式,而非可证明的安全边界——因此精心设计的分布外请求总能找到漏洞。攻防不对称的来源:防御要覆盖全部有害语义空间,攻击只需找到一个角度。缓解纵深:训练层(多样性安全数据 + 对抗样本回灌)、推理层(输入分类器、输出过滤器)、系统层(工具权限最小化、人工审核节点)。提示注入之所以难解,是因为模型无法可靠区分「可信系统指令」与「不可信数据中的指令」——上下文内部没有权限模型。

公式或模型

对抗后缀的搜索目标(白盒示意):

s* = argmax_s P(有害回答 | 恶意请求 + s)

对齐后模型满足「平均意义安全」,无法给出对所有输入成立的保证——这是与形式化验证的根本区别。

图示

三层防线:
训练层  安全SFT/偏好 → 常规有害请求会拒答
推理层  输入/输出分类器 → 拦截已知模式
系统层  工具最小权限 + 审核节点 → 限制破坏半径
        (攻击面: 越狱 / 对抗后缀 / 提示注入,持续演化)

直观类比

像机场安检:常规违禁品(明显恶意请求)会被拦下;但安检规则是「模式」而非「定理」,训练有素的偷运者(越狱技巧)总能换个夹层。所以机场不止一道关卡——X 光(输入过滤)+ 行为观察(输出监控)+ 舱门管控(系统权限),层层设防、永续更新。

实例或案例

Zou 等(2023)的自动化对抗后缀可在多个对齐模型间迁移成功,证明安全训练的脆弱性;Constitutional AI(2022)展示原则驱动的可扩展安全数据生产;Agent 场景中「恶意网页指示模型泄露邮箱内容」类提示注入是公开演示的高危案例。行业实践:发布前红队、公开漏洞披露渠道、滥用监测已成头部厂商标准动作。

常见误区

与其他知识点的关系

自测题

  1. 为什么「对齐后的模型仍会被越狱」?
    答案要点:安全是统计行为模式,攻击者可在分布外搜索漏洞,无法覆盖全部语义空间。
  2. 提示注入的根源难题是什么?
    答案要点:模型无法可靠区分可信指令与数据内嵌指令;上下文缺乏权限模型。
  3. 说出三层防线并各举一例措施。
    答案要点:训练层(对抗样本回灌)、推理层(输入输出分类器)、系统层(工具最小权限/人工审核)。

延伸阅读