2026 年几乎没人教的 AI 技能:机械可解释性与特征操控

打开模型黑箱、读内部概念并直接操控它们:SAE 与特征操控这个几乎没人教的 2026 核心技能。

产品机械可解释性 + 特征操控(SAE)
创始人Maxed.wiki 作者

What 是什么

用 SAE 把模型内部纠缠激活拆成可读特征,并直接操控这些概念。

Why 为什么有效

提示词是请求,特征操控改的是计算本身,能根治幻觉与 tone 漂移。

Who 适合谁

在线上部署 AI、被幻觉/跑偏折磨的构建者。

When 何时做

现在工具已开源落地,周末即可上手,越早越有先发优势。

Where 在哪做

Gemma Scope SAE + SAELens/TransformerLens + Neuronpedia + NNsight。

How 怎么做

抓一层激活→SAE 编码成命名特征→读取或编辑→解码回残差流→继续前向,可条件式门控干预。

How much 成本/收益

几乎零成本,单卡即可跑,或用 Neuronpedia API 免 GPU。

Step-by-Step 执行 SOP

1

装工具跑通读概念

拉 DeepMind 的 Gemma Scope SAE 跑 SAELens Colab,或在 Neuronpedia 浏览器里打印一个 prompt 点燃的 feature 榜,见一次就重构认知。

2

找一个你恨的行为找拨盘

选一个跑偏的 tone、误拒或可复现幻觉,上下调节对应 feature 直到行为改变;找拨盘是主要工作,转动它最简单。

3

用 steering 取代加提示词

找到形式/拒绝/幻觉方向,把方向倍数加进残差流(如真实方向来自 ITI),直接改计算而非「请求」模型,少写第十四条系统提示。

4

做条件式门控干预

在同一个 forward hook 里读当前概念、只当条件满足才介入,等于对概念写 if 语句;或用 repeng 控制向量低成本上手。

5

读参考论文守住诚实

读 Amodei《解释性紧迫性》与 2025 CoT 可监控性论文,明白特征会跨层纠缠、模型会自修复,且用内部信号训练可能蒙住自己的窗口。