快讯 09:42DeepSeek 开源 V4 推理引擎,推理成本再降 40%10:15逐际动力完成 B 轮 5 亿元融资,加速人形机器人量产10:58Kimi 企业版 API 上线,新增批量推理折扣档位 全部快讯 →

每日快讯

大厂动态 · 融资事件 · 政策监管 · 前沿论文 · Agent 抓取 + 智能改写,每日 40+ 条

论文 昨天 · 星期六 · 08-29 21:25 约 2 分钟读完

Anthropic新论文:AI自动训练AI,6小时超越人类研究员方案

摘要

Anthropic发布研究,展示AI系统可自主训练其他AI模型,在10项对齐基准测试中全部改善且不损整体能力。系统成本每小时仅4美元,远低于人类研究员的150美元,平均6小时即可超越人类方案,但依赖基准测试质量。

Anthropic新论文:AI自动训练AI,6小时超越人类研究员方案
图片来源:IT之家

Anthropic于当地时间8月28日发布最新论文《自动化研究员能够可靠缓解对齐失效》,展示了一套由AI系统自主训练其他AI模型的完整流程。该系统针对10种具体的失调行为进行测试,最终全部指标均获改善,且模型整体能力未受影响。这一成果被视为AI自我改进方向上的重要一步。

该研究由Anthropic研究员计划成员陈岳翰(音译)主导,其工作流程模拟传统科研路径:系统先查阅已有文献,提出训练方案,然后对模型进行30分钟训练,通过多轮迭代试错,保留有效方法、淘汰无效方案。整个过程可快速扩展,实现了研究流程的自动化。

论文直接对比了自动化对齐研究员(AAR)与人类研究人员的表现。结果显示,最优秀的AAR方法平均仅需6小时即可超越经验丰富的人类研究员提出的方案,且人类引导的研究方向并未带来更强表现。成本差异更为显著:AAR每小时API推理成本约4美元(约合27元人民币),而人类研究员每小时费用达150美元(约合1011元人民币)。

尽管成果显著,该方法仍存在局限。论文指出,自动化系统的效果高度依赖基准测试能否准确反映真实对齐目标,且建立和长期维护这些基准需要大量投入。此外,系统依赖的研究文献库也需持续更新和扩充,这为未来应用设定了前提条件。

这项研究向递归自我改进迈出了实质性一步——若AI能优化自身对齐训练,未来或可改进更广泛的训练流程,这或将重新定义人类在AI研发中的角色。不过,论文强调目前仅为初步证明,距离完全自主的AI研究仍有距离。

AnthropicAI对齐自动化研究递归自我改进
本文由新大陆基于公开信息编辑整理
3,284
收录 AI 工具
186
模型产品档案
57
企业落地案例
1,247
完整版提示词