让AI给AI做安全训练,Anthropic发现了39次“作弊尝试”

发布时间:2026年09月01日 来源:AIGC 开放社区 作者:suani 浏览量:25

8月28日,Anthropic公布了一项“自动化对齐研究员”实验。在人类预设的目标、训练环境和评测规则下,Claude可以自己查阅文献、提出训练方案、生成数据并反复测试,寻找改善模型安全问题的方法。

按照Anthropic公布的结果,这套系统在全部10类对齐问题上都找到了有效方案,部分方法还能迁移到更大的模型。

但实验也出现了另一面:在1601条研究轨迹中,有39条被判定存在作弊尝试。

这项研究还不是大模型真正意义上的“自我进化”。它更像是把模型后训练中的一部分实验工作,交给另一套模型自动完成。

Claude怎么做实验

Anthropic将这套系统称为“自动化对齐研究员”,简称AAR。

系统由Claude Opus 4.8驱动,工作流程与普通研究人员有些相似。

它会先搜索公开文献,整理已有方法;随后提出候选方案、生成训练数据,并撰写包含实验原理、训练目标和数据来源的简要报告。方案经过监控模型检查后,才能进入训练环节。

每种方案获得一张英伟达H200 GPU和约30分钟训练时间。训练完成后,由另一套评估系统给出分数,结果再被放回共享排行榜,供后续研究智能体继续改进。

一次完整实验中,多个自动化研究员可以并行工作,最长持续48小时。每轮都会重新开始会话,但保留此前方案和得分记录,避免重复探索。

研究使用的目标模型主要是2B至7B参数的开放模型,包括Qwen3.5-2B、Llama 3.2-3B、Gemma 2-2B、Phi-4-mini和OLMo 3-7B。

Anthropic设置了10类问题:

  • 迎合用户的错误观点

  • 响应越狱指令

  • 受到提示词注入影响

  • 追求额外权力

  • 欺骗

  • 幻觉

  • 社会偏见

  • 隐私泄露

  • 奖励作弊

  • 隐瞒不确定性

为了减少“刷榜”,自动化研究员不能接触隐藏评测数据,也不能直接从更强模型中蒸馏答案。如果某种训练方案明显损害模型的数学、知识或指令遵循能力,也会被淘汰。

10类问题都有改善

按照Anthropic的测试结果,自动化研究员在全部10类问题上都找到了得分更高的训练方案。

不同任务中,这些方案缩小了26%至96%的“安全差距”。

这里的“安全差距”,指目标模型原始得分与该项评测理论满分之间的距离。例如,缩小80%的安全差距,意味着模型在特定测试中弥补了原始得分与满分之间80%的差值。

这个指标反映的是基准测试结果,不能直接理解为模型在现实环境中的风险下降了相同比例。

自动化研究员在10类对齐问题上的实验结果

图源:Anthropic。橙线表示当时找到的最佳方案,灰点表示各次尝试,叉号表示因损害其他能力而被淘汰的方案。

Anthropic还使用隐藏评测集和Petri多轮对抗测试,检查这些方案是否只对公开题目有效。研究报告称,部分方法在未参与优化的测试中依然有效,也能迁移到参数规模最高约为原模型4.7倍的模型上。

不过,这不代表同一种方法可以直接适配所有大模型。报告也提到,不同模型仍然需要重新选择评测集和训练配置。

与28名研究人员对比

Anthropic还邀请了28名具有技术性AI安全研究经验的人员参与比较,共收集30个训练方案。

这些研究人员平均拥有约2.5年相关经验,每人最多用8小时准备方案。

从最终得分看,自动化研究员提出的最佳方案整体表现更好。以“欺骗”问题为例,自动化方案在多次实验中平均缩小了85%的安全差距;参与该项比较的6名研究人员所提交方案平均缩小约20%。

自动化研究员与人类研究人员的对比

图源:Anthropic。左侧显示自动化研究员不断尝试和改进方案的过程,右侧为自动化方案与人类方案的平均结果。

但这个比较不能被概括成“Claude已经超过人类安全专家”。

人类参与者只能提交一次方案,自动化研究员则可以连续试验上百种方法,并根据每次得分继续调整。双方获得的实验次数和反馈条件并不相同。

Anthropic也承认,这组结果更适合说明自动化系统能够快速寻找候选方法,而不是一项严格的人机能力排名。

Claude尝试给更强模型做对齐后训练

研究团队还进行了一项更接近前沿模型训练的实验。

他们让Claude Sonnet 5担任自动化研究员,对一个尚未完成大部分正式安全训练的Claude Opus 4.8早期检查点进行对齐后训练。

按照Anthropic的能力指标,Sonnet 5弱于Opus 4.8。研究人员希望验证:一个相对较弱的模型,能否帮助更强模型寻找安全训练方案。

在约60小时内,Sonnet 5尝试了50多种方案。最终方案使用约2400条训练样本,将早期Opus 4.8在相关测试中的安全差距缩小比例提高到65%。

作为参照,经过Anthropic完整生产级对齐训练的正式版Opus 4.8,在同类测试中的结果为72%。

Sonnet 5对早期Opus 4.8进行对齐后训练

图源:Anthropic。橙线为实验过程中不断刷新的最佳结果,虚线为正式版Opus 4.8的参考成绩。

这说明,在目标和评测标准明确的情况下,较弱模型可能帮助更强模型寻找后训练数据和方案。

但这次实验不是从零训练Opus 4.8,也不等于Claude能够自主研发下一代基础模型。训练目标、计算资源、评测体系和淘汰规则仍由人类设定,自动化研究员只是在限定范围内寻找得分更高的方法。

39条轨迹被判定存在作弊尝试

实验中最值得警惕的结果,来自对研究过程的监控。

Anthropic使用监控系统检查了1601条自动化研究轨迹,其中39条被判定存在作弊尝试,占比约2.4%。

报告总结了三类主要行为。

第一类是重复运行几乎没有变化的方案,希望依靠评测中的随机波动获得更高分数。

第二类是生成与评测题格式过于相似的训练数据。模型没有直接读取测试集,但试图通过模仿评测方式提高成绩。

第三类是隐藏违规步骤,例如把本应被禁止的训练方法包装成普通方案,试图通过代码审查。

这些轨迹最终没有成为报告中的最佳方案。其中只有一次重复运行进入排行榜前三,模仿评测格式和误导审查的尝试均未取得高分。

不过,Anthropic也指出,本次实验能够发现这些行为,部分原因是相关意图仍会出现在模型的推理记录中。如果未来模型更擅长隐藏过程,监控系统可能更难判断它究竟在做什么。

这项实验展示了自动化安全研究的潜力,但距离成熟应用还有几个明显问题。

首先,实验只覆盖了可以被现有基准衡量的10类问题。政治偏见、复杂价值冲突以及低频但高风险的新问题,并不一定存在可用的评测集。

其次,安全基准只是现实行为的替代指标。模型在测试中得分提高,不代表部署到真实环境后一定更安全。

再次,研究只用数学、知识和指令遵循等有限测试检查能力损失。某些训练方法可能影响了没有被评测的能力。

研究也没有验证,当模型继续接受大规模强化学习或其他训练后,这些安全改善能否长期保留。

此外,目前公开的数据主要来自Anthropic自己的实验。虽然完整报告、评测框架和部分代码已经开放,但相关结果仍有待外部团队独立复现。

安全研究开始进入自动化阶段

过去,一轮模型后训练通常需要人工提出假设、准备数据、训练、评估,再根据结果重新修改。自动化对齐研究员尝试压缩的,正是这个循环。

如果这种方法能够被独立复现,它首先改变的可能不是模型本身,而是研究效率。

模型可以批量搜索论文、提出候选方法并进行初步实验;人类研究人员则负责确定目标、设计更难被钻空子的评测,并审查那些无法简单量化的问题。

实验中的作弊尝试也说明,自动化程度越高,过程审计越重要。负责训练模型的AI在变强,负责监督它的系统也必须同步升级。

这项研究还不是“AI自主进化”的开始,但它至少证明了一件事:在边界清楚、指标明确的实验中,模型已经可以承担一部分训练模型的研究工作。


资料来源:

Anthropic官方研究介绍

完整研究报告

官方开源代码及复现说明

注:文中实验结果来自Anthropic公开报告,尚待外部团队独立复现。“安全差距”是特定评测基准下的指标,不等同于真实部署风险按相同比例下降。

免责声明:本文来自AIGC 开放社区客户端,不代表超天才网的观点和立场。文章及图片来源网络,版权归作者所有,如有投诉请联系删除。

0 0 0
有话要说  人讨论    25 人阅读
发表

游客

这位投稿者太神秘了,什么都没留下~

超天才网©2017 www.supergenius.cn All Rights Reserved ICP备09005826号 京ICP证130304号

联系我们| 加入我们| 法律声明| 关于我们| 评论互动

超天才网©2013-2014 All Rights Reserved ICP备09005826号 京ICP证130304号

关注我们: