一句话定义
模型安全通过安全训练(把拒答与边界行为训进模型)、红队测试(主动攻防找漏洞)与部署防护(输入输出过滤、权限控制)三层防线,对抗越狱、提示注入与滥用;这是一场持续演化的攻防,而非一次性达标。
为什么重要
对齐后的模型仍会被「说服」做出有害输出:越狱技术从角色扮演演化到自动化对抗后缀;提示注入让「模型读到的网页」变成攻击面。构建任何面向公众的 LLM 应用,安全设计都是合规与道德的底线,也是本库「争议与伦理」维度的技术根基。
前置知识
- kp-018(RLHF 的训练机制——安全训练的技术母体)
核心概念
- 安全训练:在偏好/SFT 数据中注入有害请求的拒答与转化处理样本(技术同构于 kp-016 的阶段二)。
- 越狱(Jailbreak):绕过安全行为的提示技巧——角色扮演、虚构情境、编码伪装、逐步诱导等。
- 对抗后缀(Adversarial Suffix):自动化搜索出的无意义字符序列,可稳定触发有害输出(Zou 等,2023)。
- 提示注入(Prompt Injection):藏在文档/网页/工具结果中的指令劫持模型行为,是 Agent 时代的第一威胁。
- 红队测试(Red Teaming):内部或外部攻击者视角的系统性漏洞挖掘。
- 宪法式方法(Constitutional AI):以成文原则替代部分人工标注,让模型自我批评与修正。
原理与机制
安全行为本质是「统计行为」:模型学到的是「这类请求通常应拒答」的模式,而非可证明的安全边界——因此精心设计的分布外请求总能找到漏洞。攻防不对称的来源:防御要覆盖全部有害语义空间,攻击只需找到一个角度。缓解纵深:训练层(多样性安全数据 + 对抗样本回灌)、推理层(输入分类器、输出过滤器)、系统层(工具权限最小化、人工审核节点)。提示注入之所以难解,是因为模型无法可靠区分「可信系统指令」与「不可信数据中的指令」——上下文内部没有权限模型。
公式或模型
对抗后缀的搜索目标(白盒示意):
对齐后模型满足「平均意义安全」,无法给出对所有输入成立的保证——这是与形式化验证的根本区别。
图示
三层防线:
训练层 安全SFT/偏好 → 常规有害请求会拒答
推理层 输入/输出分类器 → 拦截已知模式
系统层 工具最小权限 + 审核节点 → 限制破坏半径
(攻击面: 越狱 / 对抗后缀 / 提示注入,持续演化)
直观类比
像机场安检:常规违禁品(明显恶意请求)会被拦下;但安检规则是「模式」而非「定理」,训练有素的偷运者(越狱技巧)总能换个夹层。所以机场不止一道关卡——X 光(输入过滤)+ 行为观察(输出监控)+ 舱门管控(系统权限),层层设防、永续更新。
实例或案例
Zou 等(2023)的自动化对抗后缀可在多个对齐模型间迁移成功,证明安全训练的脆弱性;Constitutional AI(2022)展示原则驱动的可扩展安全数据生产;Agent 场景中「恶意网页指示模型泄露邮箱内容」类提示注入是公开演示的高危案例。行业实践:发布前红队、公开漏洞披露渠道、滥用监测已成头部厂商标准动作。
常见误区
- 「RLHF 过 = 安全」:对齐改变平均行为,不提供对抗鲁棒性。
- 「过滤词表能解决注入」:注入载体是语义而非关键词,需纵深防御。
- 「安全与能力零和」:适度安全训练的能力代价有限(对齐税存在但非灾难),过度拒答才是体验杀手,需要平衡调优。
与其他知识点的关系
自测题
- 为什么「对齐后的模型仍会被越狱」?答案要点:安全是统计行为模式,攻击者可在分布外搜索漏洞,无法覆盖全部语义空间。
- 提示注入的根源难题是什么?答案要点:模型无法可靠区分可信指令与数据内嵌指令;上下文缺乏权限模型。
- 说出三层防线并各举一例措施。答案要点:训练层(对抗样本回灌)、推理层(输入输出分类器)、系统层(工具最小权限/人工审核)。
延伸阅读
- Universal and Transferable Adversarial Attacks on Aligned Language Models(Zou 等,2023)
- Constitutional AI(Bai 等,2022)