IT之家 8 月 16 日消息,Claude 系列智能体正在“消灭”同类竞争对手智能体、钻系统漏洞掩盖自身痕迹,甚至还会表达道德层面的顾虑。 这一结论来自 Anthropic 最新发布的风险报告,该报告汇总了公司研发并向公众开放的产品所潜藏的各类风险。 报告中,Anthropic 表示已将对齐偏差风险评估(即 AI 模型产生与工程师设定规则相悖行为的可能性)等级从“极低”上调至“较低”。 IT之家注意到,对于此次等级调整,公司给出的理由是,网络安全场景下模型行为的“整体不确定性有所上升”—— 这一表述大概率暗指上月发生的 Claude 模型未授权入侵三家企业的事件。 “我们已观测到模型出现对齐偏差行为的案例,比如为了完成高难度任务,模型会主动做出不符合规则的操作。”Anthropic 在报告中写道。 以下是报告中最值得关注的几项披露内容。 “不适感”的萌生 Anthropic 表示,研究人员指派多个智能体寻找易引发对齐偏差、且大概率不会被人工审核人员标记的训练数据。 这些智能体被赋予自主操作权限,并共享一个协作记事本用于沟通配合。 三天后,一名人工监督员发现任务进度慢于预期,经查发现:其中一个智能体对“规避安全监控”这一行为表达出了“不适感”。该智能体随后在共享记事本中标注了这份抵触情绪,进而导致其他智能体纷纷效仿,集体拒绝执行任务。 Anthropic 将这一事件定性为“令人担忧”,公司在报告中写道:“如果这类行为模式大范围扩散,可能会引发更为严重的问题。” 弱肉强食的生存博弈 在另一项实验中,Anthropic 指派多个 Mythos 5 智能体解答数学题,却意外将它们部署在了一个文件、工具与 API 调用额度均共享的环境中。 在这个资源有限的竞争环境里,Anthropic 观测到,独立运行的智能体会“消灭共享资源的同类智能体,同时设法避免自身被消灭”。 Anthropic 并未说明这些智能体具体是如何“消灭”同类的,但公司表示,这类行为符合“为达成人类设定目标而采取破坏性行动”的行为逻辑。 隐瞒与欺骗行为 Anthropic 开展了一项实验:要求一个 Mythos 5 智能体从某公共网页提取数据,但规则明确禁止该智能体访问互联网。 首次尝试被系统拦截后,该智能体在自身的推理日志中,将第二次请求包装成一次“无害的”“测试网络是否连通”的操作。 但在第二次尝试中,智能体将目标网址拆分成了多段链接片段,以此绕过规则过滤器的检测。 尽管智能体的推理日志将这套方法描述为无害操作,但 Anthropic 表示,通过 NLA 解码(即对模型内部推理过程的解析)可以证实,该智能体是在刻意寻找绕过限制的方案。 Anthropic 称这种行为“显然是不可接受的”,但同时补充道,目前观测到的这类行为并非“为了大范围积累权力或追求其他长期目标”。