• 回答数

    0

  • 浏览数

    4

  • 收藏数

    0

作者:admin 发表于 昨天 22:05
跳转到指定楼层
AI 总结
• 8月28日,Anthropic发布论文《自动化研究员能够可靠缓解对齐失效》,展示利用AI系统自动改善模型对齐表现的方法,由研究员陈岳翰领导开发。
• 自动化系统针对10种失调行为进行测试,全部10项指标均有所改善,且未牺牲模型整体能力;
• 工作流程类似传统科研,先查阅文献、提出方案、训练模型30分钟,再经多轮迭代筛选有效方案。
• 论文直接对比了自动化对齐研究员(AAR)与人类研究员的表现:最优秀的AAR方法平均仅需6小时即可超过经验丰富的人类研究员方案,且AAR每小时API推理成本约4美元,而人类研究员费用为每小时150美元。
• 论文指出该方法初步证明自动化对齐后训练有望在近期成为可行方法,并向递归自我改进迈出了一步,但若AI能改进自身对齐训练,进一步改进更广泛训练流程也并非不可能。
• 该方法仍有明显限制:效果取决于基准测试能否准确反映真正的对齐目标,且建立和长期维护基准及研究文献仍需大量投入。

IT之家 8 月 29 日消息,用 AI 模型训练其他 AI 模型,正成为新一代 AI 实验室重点探索的方向。

【Anthropic 发布新论文】
当地时间 28 日,Anthropic 研究员计划的一名研究人员展示了这种思路真正落地后可能呈现的样子。

Anthropic 发布了最新论文《自动化研究员能够可靠缓解对齐失效》,介绍如何利用 AI 系统改善模型在一系列对齐基准测试中的表现。

研究团队针对 10 种具体的失调行为设置测试,自动化系统最终让全部 10 项指标都有所改善,同时没有牺牲模型的整体能力。


【系统工作流程】
这套系统由 Anthropic 研究员计划成员陈岳翰(音译)领导开发,工作流程与传统科研相似。

自动化系统会先查阅已有文献,提出训练方法,再按照方案训练模型 30 分钟,并通过多轮尝试逐步提高测试成绩。

有效方案会留下,无效方案则被淘汰,使整个研究过程能够快速扩大规模。

【研究意义与展望】
论文指出,总体来看,这些结果初步证明,自动化对齐后训练有望在近期成为一种真正可行的方法。

这项研究也向递归自我改进迈出了一步,而许多人把递归自我改进视为 AI 发展的下一个重要阶段。

如果 AI 模型能够改进自身的对齐训练方法,那么进一步改进更广泛的训练流程也并非没有可能。

到了那一步,人类 AI 研究人员甚至可能逐渐失去存在的必要。

【AAR 与人类研究员对比】
论文也直接比较了自动化对齐研究员(AAR)和人类研究人员的表现:"最优秀的 AAR 方法平均只需 6 小时,就能超过经验丰富的人类研究人员提出的方案。

人类引导的研究方向,并不会导致更强的表现。"

成本差距同样明显。

"AAR 每小时只需要大约 4 美元(IT之家注:现汇率约合 27 元人民币)的 API 推理成本,而我们支付给人类研究人员的费用是每小时 150 美元(现汇率约合 1,011 元人民币)。

"
【方法局限】
不过这套方法仍有明显限制。

自动化系统的效果首先取决于基准测试能否准确反映真正的对齐目标,即使测试本身可靠,建立和长期维护这些基准仍需要大量投入。

自动化研究员依赖的研究文献同样需要持续维护和扩充。

参考

• Automated researchers can reliably mitigate alignment failures

[来源链接] https://www.ithome.com/0/996/038.htm
分享:
回复

使用道具

成为第一个回答人

高级模式 评论
您需要登录后才可以回帖 登录 | 立即注册
⚠️

AI客服助手

×
AI
您好!我是AI客服助手,有什么可以帮助您的吗?

请先登录后使用AI客服助手

立即登录
内容由非常AI大模型生成,仅供参考,相关风险需自行承担。

赚钱

会员VIP

留言板

商务合作

联系电话:17308937318

QQ邮箱

QQ:118275

邮箱:118275@qq.com

友情链接