What 是什么
用 SAE 把模型内部纠缠激活拆成可读特征,并直接操控这些概念。
Why 为什么有效
提示词是请求,特征操控改的是计算本身,能根治幻觉与 tone 漂移。
Who 适合谁
在线上部署 AI、被幻觉/跑偏折磨的构建者。
When 何时做
现在工具已开源落地,周末即可上手,越早越有先发优势。
Where 在哪做
Gemma Scope SAE + SAELens/TransformerLens + Neuronpedia + NNsight。
How 怎么做
抓一层激活→SAE 编码成命名特征→读取或编辑→解码回残差流→继续前向,可条件式门控干预。
How much 成本/收益
几乎零成本,单卡即可跑,或用 Neuronpedia API 免 GPU。
Step-by-Step 执行 SOP
1
装工具跑通读概念
拉 DeepMind 的 Gemma Scope SAE 跑 SAELens Colab,或在 Neuronpedia 浏览器里打印一个 prompt 点燃的 feature 榜,见一次就重构认知。
2
找一个你恨的行为找拨盘
选一个跑偏的 tone、误拒或可复现幻觉,上下调节对应 feature 直到行为改变;找拨盘是主要工作,转动它最简单。
3
用 steering 取代加提示词
找到形式/拒绝/幻觉方向,把方向倍数加进残差流(如真实方向来自 ITI),直接改计算而非「请求」模型,少写第十四条系统提示。
4
做条件式门控干预
在同一个 forward hook 里读当前概念、只当条件满足才介入,等于对概念写 if 语句;或用 repeng 控制向量低成本上手。
5
读参考论文守住诚实
读 Amodei《解释性紧迫性》与 2025 CoT 可监控性论文,明白特征会跨层纠缠、模型会自修复,且用内部信号训练可能蒙住自己的窗口。