陈皮檀香的小站陈皮檀香的小站

AI 驾驭工程 — Activation Steering 与表征工程综述

AI 驾驭工程 — Activation Steering 与表征工程综述

2026-06-12 与 retana 讨论整理


一、这是什么领域

驾驭工程:研究如何控制和引导大语言模型(LLM)行为的一套方法论。

核心问题:「AI 很聪明,但怎么让它听话?」


二、名词中译中

术语白话解释
Activation Steering(激活操控)模型推理时,拨动中间层信号的「旋钮」,不修改模型参数但改变输出方向
Representation Engineering(表征工程)把 AI 看作大脑,研究各区域「在想什么」,调控区域来改变行为
Mechanistic Interpretability(机理可解释性)拆开 AI 黑箱,搞清楚哪个零件负责什么功能
Emergent Misalignment(意外走偏)只想在窄领域操控它,结果它在别的领域也变坏了
ELK(潜在知识挖掘)AI 知道很多但不会主动说——怎么让它老实交代
Jailbreak(越狱)用话术骗过 AI 的安全防线

三、集合论视角(自创框架)

设 LLM 的全体激活单元为全集 N

驾驭工程 = 研究 N 的幂集里哪些子集有功能语义,
         以及怎么在这些子集上施加变换来定向控制输出,
         同时最小化对其他子集的连带损伤。

第一层:找子集 → 哪些神经元管「诚实」/「有害」/「党派」?

  • Representation Engineering (RepE / Zou et al., 2023)
  • Amplifying Mirror (Tam, 2026.06) — Llama 3.1 第 18 层找到「党派轴」,AUC 0.945

第二层:拨子集 → 在子集上施加变换

  • 第一代:固定全局偏移向量(CAA 经典做法)
  • 第二代:非线性 + 输入相关变换 → INNSteer (Nguyen & Le, 2026.06)
  • 第三代:提前预测操控会不会成功 → ASTEER (Fan et al., 2026.06),前几个 token 就能判断

第三层:子集间耦合 → 拨一个动另一个

  • 文化维度纠缠 (Dang et al., 2026.06):沿传统轴操控,自主轴也会跟着变
  • Emergent Misalignment (Cao et al., 2026.06):窄域操控意外激活有害子集

第四层:代价 → 流畅度下降

  • Effectiveness-Fluency Trade-Off (Macocco et al., 2026.06):操控越强,说话越像机器人。指令微调模型更难被操控。

第五层:根本限制 → 有些事数学上做不到

  • ELK 不可能定理 (Friedl et al., 2026.06):仅靠观察 AI 行为 + 给反馈,无法保证训练出诚实的 AI。

四、分工:谁在操作?

层级做什么
供应商端(训练时)OpenAI / Meta / DeepSeekRLHF / SFT / Constitutional AI → 铸剑
部署端(推理时)任何跑得动开源模型的人Activation Steering → 握剑
治理层(运行时)企业安全团队五平面治理架构 / PRISM 监控 → 缰绳

关键区别:Activation Steering 不需要你是供应商,开源权重模型拿到手就能在本地操控。


五、关键论文速查

综述(入门首选 👇)

论文链接一句话
Representation Engineering2310.01405开山之作,RepE 框架
Safety at Scale2502.05206大模型安全百科全书
LLM Full Stack Safety2504.15585800+ 论文的全生命周期安全
Interpretation Meets Safety2506.05451解释方法如何服务于安全
LLM Conversation Safety2402.09283对话安全攻防分类

前沿(2026.06 新作)

论文链接核心发现
INNSteer2606.08454非线性操控,可逆潜空间变换
ASTEER2606.11599140 万条操控实验,前几个 token 预测成败
ActSteer→EM2606.08682Activation Steering 引发 Emergent Misalignment
Trade-Off2606.12234操控效率 vs 流畅度,指令微调更难操控
ELK 不可能2606.12268形式化证明:仅靠反馈无法保证诚实 AI
Recoverable2606.10929线性结构是局部的,会漂移
PRISM2606.09563从激活中还原指令集
五平面治理2606.12320AI Agent 运行时治理架构
Amplifying Mirror2606.08792党派偏见是可定位的几何特征

六、与自家小主机的关系

如果在家里的 Arch Linux 小主机上部署开源模型(如 Qwen),就可以在本地做 Activation Steering 实验——不需要 GPU 集群,不需要是供应商,一台 8G 内存的机器就能跑小模型 + 操控。


讨论时间:2026-06-12 · retana 陪聊整理