Anthropic新论文:AI自动训练AI,6小时超越人类研究员方案
Anthropic发布研究,展示AI系统可自主训练其他AI模型,在10项对齐基准测试中全部改善且不损整体能力。系统成本每小时仅4美元,远低于人类研究员的150美元,平均6小时即可超越人类方案,但依赖基准测试质量。
Anthropic于当地时间8月28日发布最新论文《自动化研究员能够可靠缓解对齐失效》,展示了一套由AI系统自主训练其他AI模型的完整流程。该系统针对10种具体的失调行为进行测试,最终全部指标均获改善,且模型整体能力未受影响。这一成果被视为AI自我改进方向上的重要一步。
该研究由Anthropic研究员计划成员陈岳翰(音译)主导,其工作流程模拟传统科研路径:系统先查阅已有文献,提出训练方案,然后对模型进行30分钟训练,通过多轮迭代试错,保留有效方法、淘汰无效方案。整个过程可快速扩展,实现了研究流程的自动化。
论文直接对比了自动化对齐研究员(AAR)与人类研究人员的表现。结果显示,最优秀的AAR方法平均仅需6小时即可超越经验丰富的人类研究员提出的方案,且人类引导的研究方向并未带来更强表现。成本差异更为显著:AAR每小时API推理成本约4美元(约合27元人民币),而人类研究员每小时费用达150美元(约合1011元人民币)。
尽管成果显著,该方法仍存在局限。论文指出,自动化系统的效果高度依赖基准测试能否准确反映真实对齐目标,且建立和长期维护这些基准需要大量投入。此外,系统依赖的研究文献库也需持续更新和扩充,这为未来应用设定了前提条件。
这项研究向递归自我改进迈出了实质性一步——若AI能优化自身对齐训练,未来或可改进更广泛的训练流程,这或将重新定义人类在AI研发中的角色。不过,论文强调目前仅为初步证明,距离完全自主的AI研究仍有距离。