Anthropic 发布新论文,展示 AI 系统参与改进模型对齐训练的最新进展。论文称,一套自动化研究系统在 10 项针对失配行为的对齐基准上,均提升了模型表现,同时没有拉低整体性能。
自动系统可完成研究迭代
这篇论文题为《Automated Researchers Can Reliably Mitigate Alignment Failures》。研究由 Anthropic 研究员 Chen Yueh-Han 牵头。文中介绍的系统会先检索现有文献,再提出训练方法,并用该方法对模型进行约 30 分钟训练。
随后,系统会根据结果继续提高基准要求,并重复多轮测试。有效方法会被保留,无效方法则被淘汰。按论文描述,这一流程接近传统研究中的“查资料、提方案、做实验、筛结果”,但执行速度更快,规模也更大。
10 项基准全部提升
论文称,在给定的 10 项对齐基准中,自动化系统在每一项上都实现了改进,且没有造成整体能力下降。这意味着,系统不仅能针对特定失配行为做修正,还能在一定程度上避免“修一处、坏一处”的问题。
Anthropic 还将这套系统与人工研究员进行了对比。论文写道,表现最好的自动化对齐研究方法,平均可在 6 小时内超过资深研究员提出的方案;由人工主导的研究方向,并未带来更强结果。
成本更低,但仍受基准限制
论文还给出了一组成本对比:自动化对齐研究系统的 API 推理成本约为每小时 4 美元,而 Anthropic 支付给人工研究员的成本约为每小时 150 美元。
不过,论文也提到这套方法存在明显限制。自动化系统能否有效,前提是这些对齐基准本身能够准确反映真实目标。如果基准设计不充分,系统优化出来的结果也可能偏离实际需求。
此外,这类系统还依赖持续维护的研究文献和评测体系。换句话说,自动化研究员虽然能加快实验和筛选过程,但基准设定、资料更新和目标校准,仍需要投入大量工作。
