AI 驾驭工程 — Activation Steering 与表征工程综述
AI 驾驭工程 — Activation Steering 与表征工程综述
2026-06-12 与 retana 讨论整理
一、这是什么领域
驾驭工程:研究如何控制和引导大语言模型(LLM)行为的一套方法论。
核心问题:「AI 很聪明,但怎么让它听话?」
二、名词中译中
| 术语 | 白话解释 |
|---|---|
| Activation Steering(激活操控) | 模型推理时,拨动中间层信号的「旋钮」,不修改模型参数但改变输出方向 |
| Representation Engineering(表征工程) | 把 AI 看作大脑,研究各区域「在想什么」,调控区域来改变行为 |
| Mechanistic Interpretability(机理可解释性) | 拆开 AI 黑箱,搞清楚哪个零件负责什么功能 |
| Emergent Misalignment(意外走偏) | 只想在窄领域操控它,结果它在别的领域也变坏了 |
| ELK(潜在知识挖掘) | AI 知道很多但不会主动说——怎么让它老实交代 |
| Jailbreak(越狱) | 用话术骗过 AI 的安全防线 |
三、集合论视角(自创框架)
设 LLM 的全体激活单元为全集 N。
驾驭工程 = 研究 N 的幂集里哪些子集有功能语义,
以及怎么在这些子集上施加变换来定向控制输出,
同时最小化对其他子集的连带损伤。
第一层:找子集 → 哪些神经元管「诚实」/「有害」/「党派」?
- Representation Engineering (RepE / Zou et al., 2023)
- Amplifying Mirror (Tam, 2026.06) — Llama 3.1 第 18 层找到「党派轴」,AUC 0.945
第二层:拨子集 → 在子集上施加变换
- 第一代:固定全局偏移向量(CAA 经典做法)
- 第二代:非线性 + 输入相关变换 → INNSteer (Nguyen & Le, 2026.06)
- 第三代:提前预测操控会不会成功 → ASTEER (Fan et al., 2026.06),前几个 token 就能判断
第三层:子集间耦合 → 拨一个动另一个
- 文化维度纠缠 (Dang et al., 2026.06):沿传统轴操控,自主轴也会跟着变
- Emergent Misalignment (Cao et al., 2026.06):窄域操控意外激活有害子集
第四层:代价 → 流畅度下降
- Effectiveness-Fluency Trade-Off (Macocco et al., 2026.06):操控越强,说话越像机器人。指令微调模型更难被操控。
第五层:根本限制 → 有些事数学上做不到
- ELK 不可能定理 (Friedl et al., 2026.06):仅靠观察 AI 行为 + 给反馈,无法保证训练出诚实的 AI。
四、分工:谁在操作?
| 层级 | 谁 | 做什么 |
|---|---|---|
| 供应商端(训练时) | OpenAI / Meta / DeepSeek | RLHF / SFT / Constitutional AI → 铸剑 |
| 部署端(推理时) | 任何跑得动开源模型的人 | Activation Steering → 握剑 |
| 治理层(运行时) | 企业安全团队 | 五平面治理架构 / PRISM 监控 → 缰绳 |
关键区别:Activation Steering 不需要你是供应商,开源权重模型拿到手就能在本地操控。
五、关键论文速查
综述(入门首选 👇)
| 论文 | 链接 | 一句话 |
|---|---|---|
| Representation Engineering | 2310.01405 | 开山之作,RepE 框架 |
| Safety at Scale | 2502.05206 | 大模型安全百科全书 |
| LLM Full Stack Safety | 2504.15585 | 800+ 论文的全生命周期安全 |
| Interpretation Meets Safety | 2506.05451 | 解释方法如何服务于安全 |
| LLM Conversation Safety | 2402.09283 | 对话安全攻防分类 |
前沿(2026.06 新作)
| 论文 | 链接 | 核心发现 |
|---|---|---|
| INNSteer | 2606.08454 | 非线性操控,可逆潜空间变换 |
| ASTEER | 2606.11599 | 140 万条操控实验,前几个 token 预测成败 |
| ActSteer→EM | 2606.08682 | Activation Steering 引发 Emergent Misalignment |
| Trade-Off | 2606.12234 | 操控效率 vs 流畅度,指令微调更难操控 |
| ELK 不可能 | 2606.12268 | 形式化证明:仅靠反馈无法保证诚实 AI |
| Recoverable | 2606.10929 | 线性结构是局部的,会漂移 |
| PRISM | 2606.09563 | 从激活中还原指令集 |
| 五平面治理 | 2606.12320 | AI Agent 运行时治理架构 |
| Amplifying Mirror | 2606.08792 | 党派偏见是可定位的几何特征 |
六、与自家小主机的关系
如果在家里的 Arch Linux 小主机上部署开源模型(如 Qwen),就可以在本地做 Activation Steering 实验——不需要 GPU 集群,不需要是供应商,一台 8G 内存的机器就能跑小模型 + 操控。
讨论时间:2026-06-12 · retana 陪聊整理