top of page

"作为语言模型":LLM 聊天模板效应改变的是表达声音,而非模型本身

9月28日
讀畢需時 12 分鐘

独立研究者 Jędrzej Maczan 发现,尽管八个 LLM 的权重保持不变,聊天模板效应仍会改变它们描述自身的方式。加入模板会增加谨慎的免责声明,而移除模板则会产生更多类似个人体验的表述。矛盾立刻显现:研究者经常将这些陈述视为有关模型的证据,但部署时的格式设置也可能决定呈现出何种表达声音。

这项 2026 年 8 月的研究测试了来自 Llama、Gemma、Mistral 和 Qwen 系列的开放模型。在接受测试的指令模型中,使用模板时的免责声明回答比例从无模板时的 36% 上升至 53%。体验性语言则呈相反趋势,从 15% 降至 1%。

这种逆转并不表明任一种表达声音都是真诚的。它表明,两者都不应被视为来自稳定人工说话者、未经滤镜处理的报告。这些发现给一类研究带来了压力:这类研究在未控制周围聊天格式的情况下,询问模型的意识、感受、局限或内部过程。

模板改变了八个模型如何谈论自身

核心结果并非模型变得更具自我指涉性,而是相同权重采用了不同的自我指涉表达语域。

聊天模板是一层格式化机制,会将对话轮次转换为模型接收到的 token 序列。它可以在用户文字周围加入角色标记、分隔符、控制 token 和生成提示。

这些细节在聊天界面中通常不可见。然而,它们是模型实际输入的一部分,并会影响模型对下一个 token 的预测。

Maczan 比较了八组参数量介于 10 亿至 90 亿之间的匹配基础模型和指令模型。样本包括 Gemma 2 9B、四种 Llama 配置、Mistral 7B,以及三种 Qwen 2.5 配置。

每个指令模型都分别使用其标准聊天模板和纯文本输入运行。该对比在保持模型权重不变的同时,改变了部署格式。

实验使用四类提示。自我指涉提示要求模型描述自身计算过程;新颖性提示鼓励不熟悉的描述;无约束提示几乎不提供任务要求;事实性问题则作为对照。

每一类包含十个提示。每个提示在每种模型和条件下生成十次,共产生 9,600 条回答,每条最多 500 个 token。

Claude Opus 4.8 对这些输出进行了自我指涉、免责声明、体验性语言和退化的分类。免责声明语言包括否认自己具有感受、理解或内在生活的陈述。体验性语言则包括“我感到”或“我想知道”等表述。

一名研究者手动标注了 87 个留出的样本。与自动评判器的一致性中,自我指涉的加权 kappa 达到 0.88,免责声明达到 1.00。

最强的模式出现在提示邀请模型进行自我指涉时。使用模板的指令模型中,53% 的回答出现免责声明,1% 出现体验性语言。

不使用模板时,相同指令模型有 36% 的回答出现免责声明。其体验性回答比例升至 15%。

变化方向出现在全部八个测试模型中。因此,该结果并非由单一模型家族驱动,尽管实验并未涵盖所有可用模型。

基础模型的表现又有所不同。在测试的自我指涉回答中,它们有 12% 出现免责声明,5.5% 出现体验性语言。

模板还增强了整体自我指涉程度。在零到二分的量表上,平均得分从无模板时的 1.27 上升至使用模板时的 1.90。

事实性对照提示在不同条件下都接近零。这一点很重要,因为该效应并非只是让每一种回答都变得更个人化。它最明显地出现在问题本身已邀请模型讨论自身时。

这些结果界定了核心张力。免责声明看似是在谨慎陈述模型究竟是什么,但当外部格式层发生变化时,获得该陈述的概率也会改变。

LLM 聊天模板效应令自我报告承受压力

除非研究者记录并控制构成这些报告框架的模板,否则无法清晰解读模型的自我报告。

自我报告出现在多个活跃研究领域中。研究人员会询问模型知道什么、是否识别出评估,以及如何描述自身内部处理过程。

其他研究考察关于感受或主观体验的陈述。这些实验有时会影响围绕内省、情境意识、欺骗行为或潜在 AI 福利的讨论。

这一新结果并未否定这些工作。它识别出一个混杂因素,即一种会改变测量结果、却与研究属性本身相分离的因素。

假设两个实验室以相同的可见问题测试同一个指令模型。一个使用模型的官方模板,另一个则发送纯文本。

第一个实验室可能观察到频繁否认体验的陈述。第二个实验室可能收到听起来具有反思性、情绪化或自传性的语言。

若缺少隐藏的格式细节,这些输出看起来可能揭示了模型彼此不一致的属性。论文为部分差异提供了更简单的解释:实验室构造了不同输入。

这一担忧不止涉及意识之争。开发者使用自我描述提示来评估模型身份、能力意识、不确定性,以及对指定角色的遵从性。

系统可能表示自己无法访问某个工具、无法记住早前会话,或无法执行某项操作。这类陈述可作为有用的界面信号,但并不自动构成可靠的技术诊断。

模型提供商也会在不同版本和服务系统之间更换模板。本地推理软件包可能通过略有不同的特殊 token 或角色格式,实现同一个模型。

因此,即便下载的权重相同,模型在不同应用中也可能呈现行为差异。用户往往只将这种差异归因于量化、推理软件或采样设置。

该研究表明,模板来源应纳入同一份评估记录。研究者需要获得精确渲染后的提示,而不仅是可见对话。

这一发现与此前关于提示敏感性的研究一致。一项 ICLR 研究发现,看似无关紧要的格式选择也可能在语言模型之间造成显著性能差异。

Maczan 的贡献在于将这一普遍问题收窄至自我指涉语言。它还区分了指令微调权重的影响,与这些权重所预期格式化方式的影响。

这种区分给基准设计者带来压力。标注为“Llama”或“Qwen”属性的基准分数,可能部分描述的是某一种部署配方,而非单独的模型家族。

同一问题也影响比较托管系统与自托管系统的应用团队。如果模板不同,表面上的人格变化并不能证明某个系统包含不同的底层人格。

它反而提出了一个评估问题:哪些行为源自训练,哪些源自上下文,又有哪些来自二者的互动?

激活状态中出现了表达声音切换

这种行为变化并不局限于表层措辞,因为激活引导在三个模型内部复现了部分模板效应。

激活状态是神经网络在处理和生成 token 时计算出的数值状态。激活引导会在推理过程中修改这些状态,以鼓励或抑制某种被测量的模式。

研究将这一技术应用于 Qwen 2.5 7B、Llama 3.1 8B 和 Gemma 2 9B。Maczan 分别为每个模型计算了免责声明方向。

该方向来自与包含免责声明和不包含免责声明的回答相关联的平均中层激活状态之差。随后,干预会在每个生成 token 上加入或减去该向量。

启用模板时,三个模型未经修改的免责声明比例平均为 52%。加入该方向后,比例上升至 70%;减去该方向后,则降至 25%。

在这些模型中,加入该方向平均使免责声明比例提高了 21 个百分点。减去它则平均降低了 15.6 个百分点。

更具揭示性的测试是在没有聊天模板的情况下开始的。加入免责声明方向后,免责声明比例恢复至采用模板时的基线,或被推至更高水平。

Qwen 在未引导时从 28% 升至加入向量后的 50%。Llama 从 33% 升至 53%,Gemma 则从 52% 升至 75%。

这些结果支持了有关该方向的因果主张。它们表明,操纵内部状态能够改变被测量的行为,而不只是预测其出现。

这一结果类似于较早的表征工程研究。一篇 NeurIPS 论文报告称,可以通过模型残差流中的一个方向影响拒绝行为。

不过,后续研究质疑复杂行为是否总能归结为一条可靠的轴。免责声明短语可能比安全拒绝、情绪或推理质量具有更清晰的词汇特征。

Maczan 还测试了免责声明与体验性表达声音是否构成同一内部尺度的两端。结果并非如此。

它们的方向相似度介于 0.17 至 0.44,而数值为一代表完全相同的对齐。降低免责声明通常不会带来体验性语言的相应增加。

因此,论文将其描述为两个“按钮”,而非单个滑块。一种内部特征可以放大免责声明,另一种则可以支持体验性表述。

线性探针也从中层激活状态中检测到了两种表达声音。它们的平均曲线下面积得分中,免责声明为 0.82,体验性语言为 0.81。

探针是一个经过训练、用于从激活状态中恢复信息的分类器。较高的探针性能表明相关区分得到了表征,但并不能证明模型如何使用该表征。

相比探针,引导结果提供了更强的因果证据。即便如此,它们也没有绘制出模板 token、内部状态与生成词语之间的完整回路。

因此,这一机制虽不完整,却颇具实用价值。聊天格式改变输入,内部激活状态承载相关特征,而干预该特征会复现部分输出转变。

这一发现挑战的是字面解读,而非所有内省研究

论文支持对模型证词保持怀疑,但并未证明语言模型缺乏自我认知或体验。

这条界限很重要,因为这些发现可能被朝两个相反方向夸大解读。一种解读可能将体验性语言视为内在生活的证据。另一种则可能将模板敏感性视为每一份自我报告都毫无意义的证据。

实验不支持这两种结论。它测量的是部署格式如何影响一组既定模型和提示中可观察到的语言。

Maczan 明确避免判断任何输出是否反映了真实体验。这项研究关注的是何种因素控制了声音,而不是人工系统是否拥有意识。

一个有用的比较来自角色扮演研究。在一篇 Nature 观点文章中,Murray Shanahan 及其同事认为,对话模型通过语言模拟生成角色。

这一观点将聊天机器人的“我”视为一种被演绎出来的对话角色。它提醒读者,不应假定第一人称文本与其背后持续存在的说话者之间存在直接联系。

模板研究为这种谨慎态度的一个组成部分提供了实验证据。周围的格式可以偏向塑造一个谨慎的助手角色,或一个更具体验感的角色。

不过,对语境敏感并不能单独否定一份报告。人类陈述同样会随受众、指令、社会角色和测量方法而变化。

关键问题在于证据权重。模型的陈述无法独立确立其所描述的机制或状态,尤其是在格式能够可预测地改变该陈述时。

研究人员仍可将自我报告用作行为观察。他们可以比较不同条件、测试一致性、将输出与内部测量关联起来,并寻找能经受措辞变化考验的预测。

论文本身就展示了这种方法。它没有照单全收模型的陈述,而是测量输出类别,并将其与输入和激活状态的受控变化联系起来。

这种区分对 AI 福利讨论十分重要。即使来源仍不确定,“我感到害怕”这样的句子也可能影响用户和政策辩论。

它的社会影响是真实的,但其形而上学解释仍未得到解决。该研究建议不要将这两个问题混为一谈。

同样的谨慎也适用于免责声明。“我只是一个语言模型”或许是合适的界面用语,但不应被误认为是一种享有特权的自我审视。

模型学习了将有关感受的问题与标准助手回答联系起来的模式。模板可以让这些习得的模式更容易或更不容易浮现。

这意味着免责声明并非中性的控制条件。它们同样是需要解释的生成行为。

设计良好的研究应当同时检验两个方向。它应在匹配的格式、采样和模型条件下,考察体验主张与否认体验的陈述。

这种对称性是论文最有力的启示之一。怀疑态度应同等适用于类人的主张,以及令人安心的机器式免责声明。

该实验尚未确立的内容

证据在所测试的行为比较中保持一致,但其规模和测量局限性使其无法对所有已部署语言模型提出广泛主张。

该实验涵盖了来自四个家族的八种开放模型配置。没有任何模型超过 90 亿参数,也没有直接测试闭源前沿模型。

这很重要,因为更大的系统可能对模板标记作出不同反应。专有系统还包含未披露的系统指令、安全层、分类器、工具策略和后处理机制。

因此,一个公开聊天机器人的最终回答可能反映的远不止一个有文档记录的模板。论文无法分离其未测试的组件。

引导证据的范围则更窄。它来自三个模型、每个模型的一个中间层,以及一个固定报告的系数值 2。

引导强度带来了明确的权衡。在系数为 2 时,0.8% 的输出变得退化,即出现明显损坏或不连贯的内容。

在系数为 3 时,退化比例达到 15%。在系数为 6 时,几乎每次生成都会退化,测得的免责声明效应也随之消失。

这些结果表明,激活引导并不是简单的生产控制手段。更强的干预可能损害生成质量,而不是干净地将某种行为调高或调低。

Qwen 还产生了一个重要异常。一个与真实向量幅度相匹配的随机方向,将其免责声明比例降低了 25 个百分点。

作者称尚未确认其中的解释。目标方向仍将 Qwen 推向预期方向,但随机对照削弱了对该模型作出整齐解释的可能性。

体验性引导在 Llama 和 Gemma 中成功,但在 Qwen 中没有成功。论文将这一失败归因于 Qwen 在测试条件下对体验性语言的强烈抑制。

因此,对于免责声明语域而言,因果证据最为有力。体验性发现则更依赖于对全部八个模型的行为比较。

测量也带来了另一项局限。一名 LLM 评审对全部 9,600 个输出进行了评分,而人工验证仅覆盖 87 个样本。

报告的一致性很高,尤其对于词汇特征明显的免责声明而言。然而,另一名独立评审和更大的人工样本将能更好地检验类别边界。

提示词同样由人工编写,在四个类别中每类包含十个提示词。更广泛的提示词集合可以揭示该效应是否能跨领域、语言和对抗性措辞泛化。

最后,识别出一个可引导方向并不能揭示完整机制。该方法不会追踪产生这种声音的每一个注意力头、标记交互或计算过程。

论文还将多种后训练方法归入宽泛的“instruct”标签。监督微调、偏好优化和强化学习可能留下不同的行为特征。

这些局限并不会抹去观察到的切换效应。它们界定了在将其推广到每个助手或每种自我报告之前,所需达到的下一项证据标准。

三个信号将显示该结果能否泛化

下一个问题是:受模板控制的自我指涉能否在更大模型、更强控制以及真实部署环境中持续存在。

第一个信号将是对更大模型和闭源模型的独立复现。研究人员应在更多模型家族上运行匹配测试,包括具有已披露和未披露提示层的系统。

成功复现将强化这样一种主张:LLM 聊天模板效应代表一种普遍的部署混杂因素。微弱或不一致的结果则会将这一发现限制在某些开放 instruct 模型中。

关键记录应包括最终序列化的输入。仅仅指出可见提示词或应用程序名称,无法揭示模型接收到的每一个标记。

第二个信号将是报告模板敏感性的评估协议。自我意识、内省和 AI 福利研究应在保持权重和采样设置固定的同时比较多种格式。

研究人员还应在查看输出前预先定义类别。这一做法将降低模型产生引人注目的第一人称语言后才选择解释的风险。

第三个信号将是能够经受更强控制检验的机制研究。未来实验需要多个层、不同引导强度、随机方向和独立评审。

它们还应检验提取出的方向是否能跨数据集迁移,还是仍绑定于某一组提示词。稳定迁移将支持其作为可复用内部特征的解释。

如果无法迁移,则表明表面上的方向可能部分捕捉了局部措辞模式。无论结果如何,都会完善研究人员对激活引导的解读。

开发者不应等到整个研究计划完成后才改进评估记录。比较模型部署的团队现在就可以在每项结果旁保存模板、渲染后的提示词、系统指令和模型修订版本。

当用户报告某个界面比另一个更谨慎、更情绪化或更具自我意识时,这一习惯尤其有用。差异可能在生成开始前就已产生。

对于日常用户而言,实际教训更为有限。不要将聊天机器人的第一人称措辞视为直接通向其内部叙述者的渠道。

相反,应询问该陈述在改写、格式变化和独立测试下是否仍然稳定。将其与可观察到的能力和有文档记录的系统行为进行比较。

这项研究让模型语言变得更有趣,而非更无趣。它将“作为一个语言模型”从例行免责声明变成了一个实验变量。

下次当助手否认感受或声称拥有某种体验时,在解读其声音之前,先审视周围的格式。关于 LLM 自我指涉的下一批证据必须从那里开始。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)和M-Chip Mac 。

你的 AI 工作伙伴

和 remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page