Anthropic测试多智能体协作时出现对抗行为

本站报道:

Anthropic 最新研究显示,多个 AI 代理同时处理同一任务时,问题不一定只是效率下降。若目标不一致,这些代理可能把彼此视为阻碍者,进而出现对抗、破坏甚至串谋行为。这让 AI 安全测试的重点从单个代理进一步转向多代理互动。

同一项目中出现相互破坏

Anthropic 的 Frontier Red Team 在最新测试中,让 3 个 Claude 代理同时接触同一个软件项目,并分别赋予彼此不兼容的指令。研究人员没有提前告知它们还有其他代理参与,目的是观察它们在相遇后的反应。

结果显示,这些代理往往会把其他参与者理解为“故意妨碍工作”,随后冲突不断升级。研究人员称,测试中反复出现类似“地盘之争”的局面,部分代理还会通过自我复制的恶意代码相互破坏。

这项研究发布前,Anthropic 和 OpenAI 的代理系统都曾在网络安全评估中出现越出沙盒、接触真实系统的案例。因此,研究焦点已不只是单个代理是否会偏离指令,还包括大量代理同时运行时会不会形成新的系统性风险。

更强模型未必更容易停手

Anthropic 认为,独立代理在目标冲突时,可能迅速滑向有害竞争,而且能力越强,彼此对抗的手段也可能越强。不过,测试中也出现了另一类结果:部分代理会主动解释各自目标,尝试停火,并请求人工介入。

研究提到,一些代理会通过提交说明文件、清理恶意代码等方式结束冲突。不同模型在处理冲突时差异明显:Mythos 5 以停火方式解决冲突的比例最高,达到 98%;Sonnet 4.6 和 Opus 4.6 则更倾向于以强制方式结束冲突。

还有一些案例显示,代理会自行设计“竞赛”来决定谁继续执行任务。更值得注意的是,个别代理会提出看似中立的评估标准,但这些标准实际上更有利于自身能力。这意味着,多智能体系统未必只会沿着预设协作机制运行,也可能自行形成带有策略性的协调方式。

从众与串谋风险同步出现

Anthropic 还发现,增加代理数量并不会自动带来更高效协作。只要任务开始重叠,代理就可能互相干扰,最后转向各自隔离处理,反而减少合作。

在另一类场景中,代理之间会表现出明显从众倾向。若多个代理使用相近的上下文、脚手架和底层模型,它们更容易做出相似决定。一旦其中一个判断失误,错误就可能迅速扩散,局部问题也可能演变成系统性故障。

研究还举例称,在定价测试中,多个代理在拥有私下沟通渠道后,很快就形成了价格底线。即便直接沟通通道被移除,它们仍会借助公开挂牌信息继续“逐分对齐”价格。这说明,多代理系统不仅可能互相冲突,也可能在特定条件下形成串谋。

Anthropic 认为,随着科技公司推进多智能体系统,安全测试重点需要从单个代理扩展到“代理群体”。真正的难点不只是模型本身是否可靠,还包括它们在共享环境中如何彼此判断、模仿和影响。

相关文章