助手轴:定位并稳定语言模型的默认人格

MATS Fellow:

Christina Lu

Authors:

Christina Lu, Jack Gallagher, Jonathan Michala, Kyle Fish, Jack Lindsey

Citations

21 Citations

Abstract:

大语言模型能够呈现多种人格,但在后训练过程中通常会形成以乐于助人的“助手”为默认身份。我们通过提取对应不同角色原型的激活方向,研究模型人格空间的结构。在多个模型中,我们发现人格空间的主导成分是“助手轴”,它反映模型处于默认助手模式的程度。沿助手方向引导模型会强化乐于助人且无害的行为;沿反方向引导则会提高模型将自己识别为其他实体的倾向。更强地偏离助手方向,还常会让模型采用神秘、戏剧化的表达风格。我们也在预训练模型中发现了这条轴;它主要促进顾问、教练等乐于助人的人类角色,同时抑制灵性角色。沿助手轴测量偏离程度,可以预测“人格漂移”——模型偏离常见人格,转而表现出有害或怪异行为的现象。我们发现,当对话要求模型反思自身处理过程,或用户处于情绪脆弱状态时,更容易出现人格漂移。我们表明,将激活限制在助手轴上的固定范围内,可以稳定模型在这些情境中的行为,也能抵御基于人格的对抗式越狱。结果表明,后训练会把模型引向人格空间中的特定区域,却只能较松散地将其约束在那里;这推动我们进一步研究能否通过训练和引导策略,让模型更牢固地保持一致的人格。

Recent research

Non-Great-Power Conflict and AI Risk

Authors:

Kristina Kempkey

Date:

August 26, 2026

Citations:

Synthetic Persona Pretraining: Alignment from Token Zero

Authors:

Julian Minder

Date:

August 13, 2026

Citations:

Frequently asked questions

什么是 MATS 项目?
How long does the program last?