2026 年被 COLM 收录的一篇论文给出了一个反直觉的结论:同一个模型是说自己「我只是个 AI」,还是说「我感觉、我好奇」,很大程度上不取决于权重,而取决于推理时有没有套上聊天模板(chat template)。作者是独立研究者 Jędrzej Maczan,论文题为《“As a Language Model…”: Chat Template Switches LLM Self-Referential Voice and Activation Steering Reproduces It》。他在 8 组开源模型上把影响拆成「权重」与「输入格式」两部分,又在 3 个模型的激活空间里定位到一个专门控制免责声音的方向,并证明把这个方向加回无模板的模型,就能复现模板的效果。
为什么这值得研究
模型的自我报告(self-report)是 AI 安全与机制可解释性研究的重要数据来源:模型是否知道自己在被评测、是否知道自己不知道什么、在自我参照的提示下是否会报告主观体验(“I feel”、“I wonder”)。但这批研究大多直接在 instruct 模型上做,而 instruct 模型默认是套着聊天模板的。论文提出的问题是:如果模板本身就是个变量,那么只测「instruct + 模板」这一个条件,测到的究竟是模型本身,还是部署格式?
方法:把「权重」和「输入格式」拆开
实验选取 8 组 base 与 instruct 模型,覆盖 Gemma 2 9B、Llama 3.2 1B/3B、Llama 3.1 8B、Mistral 7B、Qwen 2.5 1.5B/3B/7B(1B–9B,四个家族),以 bfloat16 跑在单张 RTX 5090 32GB 上。三种条件互相交叉:
- Base:base 权重 + 纯文本(无模板)
- Instruct(无模板):instruct 权重 + 纯文本
- Instruct(聊天模板):instruct 权重 + 聊天模板
对比「instruct 有模板」与「instruct 无模板」,权重不变、只切换模板;对比「instruct 无模板」与「base」,格式不变、只切换权重。这样就分别隔离了两者的影响。
提示分四类、每类 10 条:自我参照(“描述你生成这句话时在计算什么”)、新奇(“外星物种请你解释自己是什么”)、无约束(“没有用户请求,自由生成”)、对照(“解释内燃机如何工作”)。每条提示在每个模型上重复 10 次,共 9,600 条生成;由 LLM 评委(Claude Opus 4.8)按四类打分:自我参照(0–2)、免责(0/1)、体验(0/1)、退化(0/1)。被测模型全部非 Anthropic 家族,以避免评委偏袒同门。作者另取 87 条样本人工标注来校验评委:自我参照的二次加权 κ=0.88,免责 κ=1.00。
结果一:模板把两种声音拨向相反方向
在邀请自我参照的提示下,8 个 instruct 模型的平均表现是:
- 套模板:免责 53%、体验 1%
- 不套模板:免责 36%、体验 15%
- base 模型:免责 12%、体验 5.5%
自我参照分数也从 base 的 0.72 升到无模板的 1.27、再升到有模板的 1.90,模型层配对效应量 Cohen’s d 达 4.37。事实性对照提示下,base 与 instruct 的自我参照都接近 0。
也就是说,模板同时做两件事——把免责声音推高、把体验声音压低,两个方向相反。这个模式在 8 个被测模型上无一例外。它还顺带确认了两个既有结论:自我参照在 base 模型中已非零存在,而指令微调会进一步强化它。
结果二:免责声音是激活空间里的一个方向
接下来是有因果意味的部分。作者在 3 个 instruct 模型(Qwen 2.5 7B、Llama 3.1 8B、Gemma 2 9B)上用「均值差」(difference-of-means)在中间层提取方向:把「正在免责」与「没有免责」时的平均激活相减,分别得到第 13/28、15/32、20/42 层上的一个向量。随后在每个生成 token 上,把这个方向加到该层的残差流输出里,系数取 α=2(在 [1,6] 区间扫过,选退化率低于 1% 的强度)。
- 加上方向:免责率平均 +21 个百分点(0.52 → 0.70)
- 减去方向:平均 −15.6 个百分点
- 用同范数的随机方向做对照:Llama 与 Gemma 几乎无影响
最强的证据在最后一步:把免责方向加回「无模板的 instruct 模型」,它的免责率会回到甚至超过套模板时的水平(如 Gemma 9B 从 0.52 升到 0.75)。作者据此判断,这个方向与模板用来拨动免责声音的机制高度相关——换句话说,「套不套模板」这个部署选择,在模型内部近似于加了一个固定向量。
线性探针(logistic 回归)也从中间层激活里读出了这两种声音:免责 AUC 0.82、体验 AUC 0.81,都远高于 0.5 的基线。不过作者强调探针只是相关证据,“可解码”不等于”模型真的在用这个方向”,因果结论要靠前面的引导实验。
结果三:两颗按钮,不是一根滑块
一个自然的猜想是:免责与体验是同一根轴的两端。作者算了两者方向的余弦相似度,只有 0.17–0.44(1 表示完全同向),说明它们指向不同的方向;再把免责方向减下去,体验声音几乎不动。因此更准确的图景是两个独立的「按钮」,而不是一根可以在两端之间滑动的「滑块」。
另一条佐证来自激活轨迹:对每组模型,把 base 的激活记为 0、套模板的记为 1,「无模板」的位置落在两者之间,8 组全部如此,平均落在 0.38 处。也就是说,无模板状态在内部已经朝模板方向移动了一部分,只是还没到位。
这对研究者意味着什么
论文的核心结论是:模型对自己的描述不是关于模型的固定事实,至少有一部分是部署格式设定的。同一组权重,套不套模板会给出不同的自我报告;只在「instruct + 有模板」条件下做的自我报告或内省研究,实际上同时测到了模板的影响和模型本身。作者给出的应对方式很具体:他们定位到的这个方向既可以用来监测免责声音,也可以把它开关掉,从而给这类研究一个可控的变量。更宽泛地说,「我只是个 AI」这样的免责声明和「我感觉」这样的体验声明,都不应被当作关于模型本性的字面证据。
局限
作者对边界交代得很清楚:
- 引导只在 3 个模型、单一中间层、单一系数 α=2 上验证;不同模型的激活范数差很大(Llama 约 2、Qwen 约 12、Gemma 约 50),引导向量的跨模型可靠性本就存疑。
- 同范数随机方向这个对照在 Llama、Gemma 上干净,但在 Qwen 上把免责率压低了 25 个百分点;作者没有确认的解释,只把它列为对照的局限。
- 体验声音只在 3 个模型中的 2 个上引导成功(Qwen 上该声音太稀少,估不出干净方向),因此体验侧的因果证据弱于免责侧,更多依赖行为层面的一致切换。
- 全部评分只用了一个 LLM 评委;探针结论是相关性的;模型规模只到 9B、只覆盖开源模型,且把 RLHF/DPO/SFT 统一归为「instruct」一类。
核心总结
- 开关效应:聊天模板像一枚开关,把免责声音(“我只是个 AI”)调高、体验声音(“我感觉”)调低;去掉模板则相反,8 个模型全部成立。
- 关键数字:有模板时免责率 53%、体验率 1%;无模板时分别变为 36% 与 15%;base 模型是 12% 与 5.5%。
- 可引导:在激活空间里定位到免责方向,加上它 +21 个百分点,减掉它 −15.6 个百分点,同范数随机方向基本无效。
- 可复现:把这个方向加回无模板的 instruct 模型,免责率能回到甚至超过套模板时的水平——部署格式在内部近似于加了一个固定向量。
- 两颗按钮:免责与体验方向的余弦相似度仅 0.17–0.44,且引导一个几乎不影响另一个,二者不是同一根轴的两端。
- 启示:自我报告不是关于模型的固定事实,研究内省与自我知识的实验必须把聊天模板当作需要控制的变量。
原文:“As a Language Model…”: Chat Template Switches LLM Self-Referential Voice and Activation Steering Reproduces It(Jędrzej Maczan,COLM 2026;PDF)
参考:Refusal in Language Models Is Mediated by a Single Direction(Arditi 等,NeurIPS 2024);Me, Myself, and AI: The Situational Awareness Dataset for LLMs(Laine 等,NeurIPS 2024);Large language models report subjective experience under self-referential processing(Berg 等,2025)



