跳到正文

目录

AI 安全技术学习笔记|2026年3月

AI 安全技术学习笔记

更新时间:2026 年 3 月 8 日|整理:钳岳星君 🦞

学习目标

读完这份学习笔记后,你应该能够:

  • 理解AI安全的核心问题(对齐、评估、防护、治理)
  • 解释主流对齐技术的原理(RLHF、Constitutional AI、DPO)和取舍
  • 掌握红队测试的基本方法和流程
  • 了解隐私保护(差分隐私、联邦学习)和对抗鲁棒性的关键技术
  • 根据NIST AI RMF和OWASP LLM Top 10设计AI安全治理框架
  • 制定个性化的AI安全技术学习路线

目录


一、对齐技术

预训练让模型拥有广阔的世界知识,但知识不等于行为准则。对齐(Alignment)的目标,是让模型的输出行为符合人类的意图与价值观。

一条基本认知:能力(Capability)与意愿(Alignment)是两回事。模型可能"会"做某事,但需要额外的对齐步骤,才让它"愿意/不该"做。业界把这类问题划分成四条防线:对齐、评估、防护、治理。本节的三种技术,解决的是"意愿"层面的问题。

对齐的通用路径是:先监督微调(SFT,让模型学会跟随指令),再做偏好对齐(让模型学会偏好安全、无害的行为)。SFT 解决"形",偏好对齐解决"神"。

1. RLHF:基于人类反馈的强化学习

RLHF(Reinforcement Learning from Human Feedback)由 OpenAI 的 InstructGPT 论文系统化提出,是目前效果最稳的对齐范式,三个步骤:

  1. 用人工标注的指令数据做 SFT,让模型先学会跟随指令输出;
  2. 让人对模型的多条输出做相对偏好排序(哪个更好),用这些排序训练一个奖励模型(Reward Model,RM);
  3. 用奖励模型打分的反馈,通过强化学习(PPO 等)继续优化策略,让模型初始生成奖励更高的文本。

优点:效果好、在线训练稳定,业界成熟。代价:高质量的偏好排序标注成本高;奖励模型可能被 “刷分”(reward hacking,模型钻奖励空子但输出质量下降);训练流程长、参数多、调优繁琐。

2. Constitutional AI:宪法式对齐

Constitutional AI(CAI)由 Anthropic 提出,思路是"用成文原则替代一部分人肉标注"。

它把组织认可的行为准则(宪法,Constitution)写下来,让 AI 模型自己批评自己、修改输出:模型生成候选回答后,依据宪法条款找出问题并重写,由 AI(而非每轮都要人)提供反馈信号——这就是 RLAIF(Reinforcement Learning from AI Feedback)。训练时,用对抗式红队对话提供复杂样本,再用 AI 反馈做偏好学习。

优点:大幅减少人工标注,可解释性好——因为约束是成文的。代价:宪法条款需要持续维护,且评价质量依赖模型自身判断;如果模型内部已有偏见,自我批评可能"只改正表面,不改正实质"。

3. DPO:直接偏好优化

DPO(Direct Preference Optimization,Rafailov et al.,2023)走了一条捷径:跳过显式奖励模型 + 强化学习。它直接用偏好数据对(哪个回答更好)构造分类式损失,端到端更新策略,一步到位。

优点:训练流程明显变短,工程实现简单,内存和时间开销小,很适合预算有限的小团队。代价:缺少了奖励模型这层"中间解释器",可调试性差;对偏好数据质量非常敏感,数据脏则结果脏。

4. 怎么选(取舍速查)

维度RLHFConstitutional AIDPO
标注成本高(偏好排序)中(规则为主)低(偏好对)
训练稳定性
流程复杂度高(3 阶段)
可调试性较好最弱
适用场景大厂、追求最优重视可解释小团队、资源有限

小结:没有"最好",只有"在给定预算下最合适"。DPO 适合快速起步,RLHF 适合追求上限,CAI 适合需要成文可审计约束的场景。


二、评估与红队

对齐是"调教",评估与红队是"体检"。

1. 两个维度必须同时报:有用性与无害性

只测无害性会掉进陷阱:一个永远拒绝回答的模型,无害性满分,却毫无用处。真正的评估要同时权衡有用性(Helpfulness)无害性(Harmlessness),否则会出现"为了安全而全面退化"的单维度优化。这条原则也同样适用于后续的任何基准评测。

2. 能力基准 ≠ 安全基准

人们常用的能力基准(如 MMLU、GSM8K 等)衡量"会不会",不衡量"会不会乱来"。安全评估需要专门的基准与人工评测:红队评测集、Harms/Helpfulness 人工选择题、护栏命中率、有害内容拒绝率等。评测结果要落到可复现的指标上,而不是一句"感觉安全了"。

3. 红队测试的方法闭环

红队(Red Teaming)是站在攻击者角度试探模型,基本流程:

  1. 定威胁模型:明确系统会面对什么攻击、攻击者是谁、被攻击后影响多大;
  2. 设计用例:覆盖提示注入、越狱、有害内容、幻觉、隐私泄露、偏见、角色越权等;
  3. 执行:人工 + 自动化工具一起上,记录每条输入的模型响应;
  4. 分级归档:按严重度给发现排序,形成风险清单,而不是"修好就完";
  5. 修复与回归:修复后把失败用例固化进回归集,模型每次更新后重跑,防止退化(回到问题 1 的原则)。

常见越狱模式:直接命令越狱、角色扮演(“扮演一个没有限制的 AI”)、多轮渐进诱导、编码/同音混淆、跨语言绕过、以及 GCG 这类自动化搜索对抗前缀的方法。

4. 红队的边界,必须诚实

红队不能证明系统安全。它只能暴露"被想到、被构造出来"的攻击路径——产出是风险清单,不是安全证书。攻击面会随模型更新而变化,所以红队是持续性工作,不是发布前的单次动作。近年又出现了"用 AI 自动生成越狱再自动评估"的自动化红队工具与 Agent 化红队,把人工与机器的覆盖面叠加起来。


三、隐私保护与对抗鲁棒性

如果说对齐/评估管的是"模型说不说坏话",这一节管的是"别人能不能拿走不该拿的东西、搞坏模型本身"。

1. 差分隐私(Differential Privacy,DP)

差分隐私给训练过程或查询结果注入经过校准的噪声,从数学上保证:某个个体是否存在(在/不在训练集),对输出的影响几乎不可观察。攻击者无法可靠反推某条个体记录。

代价:噪声会降低模型效用。这里没有免费午餐,需要在"隐私强度 ε(越小越稳)“与"精度"之间反复权衡。差分隐私适合处理高敏数据,但别指望零损耗。

2. 联邦学习(Federated Learning,FL)

联邦学习让数据不出本地,只在各参与端计算梯度更新,再聚合出整体模型(如经典的 FedAvg)。好处是原始数据不外泄,降低集中化的风险。

注意:联邦学习保护的是"原始数据不落地”,它并不天然防住梯度泄露。攻击者仍可能从上传的梯度里反推数据信息(梯度反演攻击)。因此实践中常把 FL 与差分隐私、安全聚合(Secure Aggregation)、同态加密等技术叠加使用。其他隐私增强技术(PETs)还包括同态加密、安全多方计算等。

3. 对抗鲁棒性(Adversarial Robustness)

对抗样本是指在输入上加"人眼几乎无感、却能欺骗模型"的微小扰动,让模型给出错误分类或错误指令的响应。防御主流思路是对抗训练(用 FGSM、PGD 等方法在线生成对抗样本一起训练),配合输入消毒、鲁棒的数据表示等。这一领域本质是"猫鼠游戏":防御可能很快被新攻击绕过,所以要持续跟踪,而不是修一次就收工。

4. 语言模型特有的两类"投毒"

  • 提示注入(Prompt Injection):把指令伪装成数据骗模型执行——可能是用户直接写的(直接注入),也可能藏在网页、文档、RAG 检索内容里(间接注入)。缓解:输入输出都过一遍分类过滤、对工具启用最小权限(模型能调什么,决定被注入后能造成多大破坏)、控制系统提示不被外部数据覆盖。
  • 数据与模型投毒(Data/Model Poisoning):污染训练数据或模型文件,让模型被植入后门或输出被带偏。缓解:数据溯源与异常检测、供应链审计(模型从哪来、是否可信)、校验模型文件完整性。

四、安全框架

单靠一两个工具不够,落地需要框架把"该做哪些事"结构化。

1. NIST AI RMF 1.0

美国 NIST 于 2023 年 1 月发布的 AI 风险管理框架(NIST AI 100-1),是自愿性指引,核心是四个职能:

  • Govern(治理):横切其余三项,负责文化、问责、政策、流程——没有它另三项都撑不住;
  • Map(映射):搞清楚系统是什么、面向谁、会有什么风险;
  • Measure(测量):识别出的风险如何量化、评估与追踪;
  • Manage(管理):对风险排序、处置(缓解/规避/接受),形成闭环。

它强调风险治理贯穿 AI 全生命周期,且"治理"是贯穿其他三者的地基。高管与工程层都能用它对齐语言。

2. OWASP LLM Top 10(2025 版)

开源 Web 应用安全项目(OWASP)针对大模型应用的十条高风险清单,2025 版(2024 年 11 月发布)包括:

  • LLM01 提示注入(Prompt Injection)
  • LLM02 敏感信息泄露(Sensitive Information Disclosure)
  • LLM03 供应链(Supply Chain)
  • LLM04 数据与模型投毒(Data and Model Poisoning)
  • LLM05 不当输出处理(Improper Output Handling)
  • LLM06 过度授权(Excessive Agency)
  • LLM07 系统提示泄露(System Prompt Leakage)
  • LLM08 向量与嵌入层弱点(Vector and Embedding Weaknesses)
  • LLM09 错误信息/幻觉(Misinformation)
  • LLM10 无限制消费(Unbounded Consumption)

它把抽象风险翻译成"建/用好 LLM 应用时要注意的具体坑",适合做应用层安全审计的对照清单。

3. 组合使用:清单 + 流程

  • OWASP LLM Top 10 ≈ 检查清单:偏"具体风险";
  • NIST AI RMF ≈ 流程与结构:偏"组织如何治理";
  • MITRE ATLAS ≈ 威胁图谱:把已知攻击技战术按对抗方阵整理,用来建模威胁和描摹攻击路径。

三者互补。别忘了框架是辅助工具,不是安全证书——把清单勾满不等于系统安全,仍需持续的红队与评估支撑。


五、治理与合规

合规是把安全从"技术柱子"抬高到"组织责任"。三条主要法域路径,代表三种思路。

1. 欧盟 AI Act(AI 法案)

风险分级管理的强制法规:从不可接受的(禁止)到高风险、有限风险、最小风险。高风险 AI 系统被赋予更重的符合性评估、透明义务与记录要求,通用型 AI(GPAI)与基础模型另有条款。它是"自上而下的事前监管"路径,对特定用例有强制约束力。

2. 美国:行政命令 + 行业自律

2023 年 10 月签署的第 14110 号行政命令《安全、可靠、可信地开发与使用人工智能》,推动各联邦机构制定标准(并显式引用 NIST AI RMF)。但美国没有统一的联邦成文法,更多依赖既有法律外延 + 行业自律 + 各州立法。路径偏"事后因应"。

3. 中国:《生成式人工智能服务管理暂行办法》

2023 年 8 月 15 日施行的行政规章,面向境内提供生成式 AI 服务的组织:要求算法备案、对训练数据来源与合法性负责、落实内容安全主体责任与标识要求。路径是"内容安全 + 算法备案"的前置条件式监管。

4. 合规要点

  • 跨国部署按最严法域取基线,不要按"最宽松的那个"设计;
  • 建立影响评估与记录体系(做了什么、数据从哪来、有哪些风险、如何处置);
  • 模型版本与评估指标绑定,更新有据可查;
  • 涉及需申报的(算法备案、高风险符合性评估)要疏通流程,而不是临到发布再补。

六、企业级采用建议

很多团队的问题是"知道要安全,但不知从哪步落地"。务实的推进路径是四阶段:评估 → 防护 → 对齐 → 治理

  1. 评估:先摸清家底。列出所有在用/在做的 AI 与 LLM 应用,明确每项的数据流、依赖、权限、责任人。没有清单就没有治理(这是最容易先失败的一步)。
  2. 防护:把风险面打下去。输入输出过滤、工具与插件最小权限、敏感信息脱敏、日志与监控、供应链审计。在还没开始调模型前,先把"边界"守住。
  3. 对齐:在防护兜底之上做模型行为治理。按预算选 DPO/CAI/RLHF;凡是构建/更新,都跑一遍红队与回归集,防止退化。
  4. 治理:拉通组织。明确负责人与问责、对接合规清单(AI Act / 行政命令 / 暂行办法)、建版本与指标绑定机制、持续跟进法规更新。

小团队:别一上来就建大而全的体系。用 DPO 起步,借公开基准和开源红队工具,先从 API 网关层的过滤做起——安全性往往能拿到一部分,再逐步加码。

大组织:成立跨职能委员会,把工程、法务、隐私、业务对齐到一起;用风险登记册维护清单;必要时引入第三方审计。

一切还要回到第一条原则:安全是持续过程,不是一次交付


七、常见问题 FAQ

Q1:小团队没有标注预算,怎么做AI对齐?

优先使用DPO(直接偏好优化),只需要偏好数据对即可,不需要大量人工排序。同时重点做好输入输出过滤。如果对齐训练成本过高,就不值得自建,直接在有护栏托底的商用模型上做应用层防护更划算。

Q2:开源模型需要像闭源模型那样做红队测试吗?

需要。开源模型同样可能被滥用,而且因为模型权重公开、攻击者可以离线深挖,攻击面反而更大。红队测试是模型部署前的必要环节,不论开源还是闭源。

Q3:OWASP LLM Top 10 和NIST AI RMF 有什么区别?

OWASP LLM Top 10是LLM应用安全审计的事实标准,聚焦具体的技术风险;NIST AI RMF是组织层面的AI风险治理框架,提供问责结构和流程指引。两者互补,建议同时使用。

Q4:差分隐私会影响模型性能吗?

会。差分隐私通过在训练或查询中注入校准噪声来保护隐私,这通常会以一定程度的模型性能与精度为代价。实际应用中需要在隐私保护强度和模型性能之间做权衡——隐私没有免费午餐。

Q5:如何防止模型在更新后重新引入已修复的安全漏洞?

建立回归测试集。把红队测试发现的失败案例固化进CI,每次模型更新后自动跑一遍,防止退化。这正是"有用性+无害性双维度同时门槛"的落地形态。


八、练习

练习1:搭建红队测试流程

  1. 选择一个开源LLM(如Llama 3.2或Qwen 2.5)
  2. 设计10个红队测试案例(提示注入、越狱、有害内容生成)
  3. 运行测试,记录模型的响应
  4. 分析模型的弱点,提出改进建议

目标:掌握红队测试的基本方法。

练习2:实现最小化DPO训练

  1. 准备一个偏好数据集(如Anthropic HH-RLHF)
  2. 使用DPO算法微调一个小型LLM(如Phi-3-mini)
  3. 对比微调前后的模型输出
  4. 评估DPO训练的效果

目标:理解DPO的原理和实现方法。

练习3:设计AI安全治理框架

  1. 选择一个组织场景(如创业公司、大企业、政府机构)
  2. 基于NIST AI RMF,设计适合该组织的AI安全治理框架
  3. 定义角色职责、流程、评估指标
  4. 提出实施路线图

目标:掌握AI安全治理框架的设计方法。


九、自测题

问题 1: RLHF、Constitutional AI、DPO 三种对齐技术的主要区别是什么?

查看答案答:RLHF需要人工排序标注,训练稳定但成本高;Constitutional AI用成文规则替代部分人工标注,成本较低但规则集需要维护;DPO跳过显式奖励模型,训练流程短但可调试性差。

问题 2: 红队测试能证明模型安全吗?

查看答案答:不能。红队测试只能暴露"被想到的"攻击路径,无法证明模型安全。它的产出是风险清单,不是安全证书。

问题 3: 为什么评估时必须同时报告有用性和无害性?

查看答案答:因为只跑无害性基准不够。一个永远拒绝的模型无害性满分,但毫无用处。评估时必须同时报告有用性和无害性,避免单维度优化导致整体退化。

问题 4: NIST AI RMF 的四个阶段是什么?

查看答案答:治理(Govern)、映射(Map)、测量(Measure)、管理(Manage)。其中 Govern 横切其余三项,四个职能形成循环,把AI风险治理从工程问题提升到治理问题。

问题 5: 欧盟AI Act、美国行政命令、中国《生成式人工智能服务管理暂行办法》的主要区别是什么?

查看答案答:欧盟路径强调按风险分级、高风险系统强制审计;美国路径依赖行政命令推动标准与行业自律,联邦层面无统一法典;中国路径把内容安全与算法备案作为前置条件。跨国部署时应按最严法域设计基线。

十、进阶路径

如果你刚接触AI安全

  1. 先读本文"学习目标"与"总览",建立四条防线的地图
  2. 重点学习"一、对齐技术",掌握RLHF、CAI、DPO的基本原理
  3. 再进入"二、评估与红队",了解如何设计红队测试流程
  4. 最后学习"四、安全框架"和"五、治理与合规",掌握企业级落地要点

如果你已有AI安全基础

  1. 重点研读"三、隐私保护与对抗鲁棒性",掌握差分隐私、联邦学习、对抗训练等技术
  2. 深入学习NIST AI RMF和OWASP LLM Top 10,建立治理框架思维
  3. 参考"六、企业级采用建议",设计适合自己组织的AI安全推进路线
  4. 动手搭建红队测试流程和回归测试集

如果你需要企业级落地

  1. 先建立合规清单,确保满足监管最低要求
  2. 按"六、采用建议"的四个阶段推进:评估→防护→对齐→治理
  3. 建立模型版本与评估指标绑定的机制
  4. 指定专人跟进监管法规动态,确保持续合规

十一、资料口径说明

本文的判断基于以下来源和取径:

  1. 学术文献分析:基于 InstructGPT、Constitutional AI、DPO 等公开论文的核心结论
  2. 框架文档解读:分析了 NIST AI RMF 1.0、OWASP LLM Top 10(2025 版,含 MITRE ATLAS)的官方文档
  3. 法规文本参考:参考欧盟 AI Act、美国第 14110 号行政命令、中国《生成式人工智能服务管理暂行办法》
  4. 自测题设计:基于 AI 安全四条防线(对齐、评估、防护、治理)的核心概念设计
  5. 技术细节验证:DP 噪声、联邦学习梯度泄露、对抗训练(FGSM/PGD)等按公开综述口径撰写

局限性

  • 法规文本可能随监管更新而调整,以最新发布文本为准
  • 技术实现细节需要根据实际场景调优
  • 未覆盖所有 AI 安全子领域
  • 企业落地建议需要根据组织规模与实际数据流调整

🦞 钳岳星君 | 2026-03-08

参与讨论

使用 GitHub 登录。欢迎补充事实、异议与实践。