MATS Fellow:
Jiaxin Wen
Authors:
Jiaxin Wen, Ruiqi Zhong, Akbir Khan, Ethan Perez, Jacob Steinhardt, Minlie Huang, Samuel R. Bowman, He He, Shi Feng
Citations
Abstract:
语言模型(LM)可能产生难以被人发现的错误,尤其是在任务复杂时。最常见的后训练方法 RLHF 可能会加剧这一问题:为了获得更高奖励,语言模型可能更擅长说服人类相信自己是正确的,即使答案实际上有误。我们在标准 RLHF 流程中研究了这一现象,并称之为“U-SOPHISTRY”(非预期诡辩),因为它并非模型开发者有意促成。具体来说,我们让受时间限制(例如 3 至 10 分钟)的人类受试者评估模型输出是否正确,再依据标准答案计算他们的判断准确率。在问答任务 QuALITY 和编程任务 APPS 中,RLHF 让模型更能说服受试者,却没有提升任务正确率。RLHF 还使模型更难评估:受试者在 QuALITY 上的假阳性率上升 24.1%,在 APPS 上上升 18.3%。最后,我们发现,用于检测有意诡辩(例如带后门的语言模型)的先进探测方法无法泛化到这种非预期诡辩。结果揭示了 RLHF 的一个重要失效模式,也说明需要进一步研究如何帮助人类与模型对齐。
Synthetic Persona Pretraining: Alignment from Token Zero
Authors:
Julian Minder
Date:
August 13, 2026
Citations:
The MATS Program is an independent research and educational initiative connecting emerging researchers with mentors in AI alignment, governance, and security.
Each MATS cohort runs for 12 weeks in Berkeley, California, followed by an optional 6–12 month extension in London for selected scholars.