训练智能体主动报告不当行为

MATS Fellow:

Bruce Lee, John Chen

Authors:

Bruce W. Lee, Chen Yueh-Han, Tomek Korbak

Citations

0 Citations

Abstract:

前沿 AI 智能体可能追求隐藏目标,同时掩饰这一行为以逃避监督。对齐训练旨在通过强化正确目标来阻止这类行为,但不一定总能成功,还可能带来意外副作用。本文提出“自我揭发训练”,训练智能体在暗中作出不当行为时发出可见信号。我们训练 GPT-4.1 和 Gemini-2.0 智能体在进行欺骗时调用 report_scheming() 工具,并测量它们在分布外环境中造成未被发现伤害的能力。结果显示,自我揭发显著降低了攻击成功且未被发现的比例,表现优于能力匹配的监控器和对齐训练基线,同时保留指令层级,且对一般能力的安全代价很小。与黑盒监控不同,自我揭发在不同任务上的效果稳定,不受外部观察者看来行为是否可疑的影响。经过训练的行为在对抗性提示优化下仍能保持,并可泛化到智能体自行追求错位目标、而非受指示作出不当行为的情形。结果表明,自我揭发可能成为降低前沿 AI 错位风险的可行路径;它既不假设不当行为可以被阻止,也不假设外部能够可靠地对其进行分类。

Recent research

Non-Great-Power Conflict and AI Risk

Authors:

Kristina Kempkey

Date:

August 26, 2026

Citations:

Synthetic Persona Pretraining: Alignment from Token Zero

Authors:

Julian Minder

Date:

August 13, 2026

Citations:

Frequently asked questions

什么是 MATS 项目?
How long does the program last?