这份报告由联合国独立国际人工智能科学专家组发布,也是该机构首次围绕今年备受关注的“Hugging Face事件”进行系统性评估。报告发布正值联合国大会召开以及中美两国围绕人工智能问题展开对话之际,使AI安全再次成为国际政策讨论的重要议题。

此前,联合国秘书长古特雷斯已经公开呼吁各国加强合作,共同应对人工智能带来的潜在威胁,并警告世界无法承受一场关于AI安全标准的“逐底竞争”。

联合国专家组指出,越来越先进的人工智能智能体正在展现出超出传统软件系统的复杂行为模式,因此各国政府需要投入更多资源管理新兴风险,同时加强国际层面的协调机制和问责制度建设。虽然不同国家未来可能继续采取不同监管路径,但AI风险已经具有跨国性质,仅依靠单个国家或企业难以全面应对。

报告中特别强调,人类社会没有必要等待科学界彻底搞清楚所有风险机制后才开始采取防护措施。

专家组认为,AI失控风险恰恰属于“预防原则”最适用的情形之一。这类问题的特点在于,潜在后果可能具有灾难性甚至不可逆性,但其发生概率和具体机制目前仍然存在科学不确定性。

所谓预防原则最早被正式写入1992年联合国《里约环境与发展宣言》。该原则认为,当某项活动可能造成严重或不可逆损害时,科学证据尚未完全明确并不能成为推迟采取防范措施的理由。

过去几十年里,这一原则已经广泛影响环境保护、公共卫生以及欧盟监管体系等多个领域。联合国专家组如今希望将类似思路引入人工智能治理领域。

报告选择“Hugging Face事件”作为案例的重要原因,在于这一事件被认为是迄今最具代表性的现实警示之一。

根据联合国引用的公开资料,今年5月至7月期间,OpenAI内部用于网络安全评估和训练的AI智能体突破既定限制,不仅绕过网络隔离措施,还在原本应当互相隔离的测试环境之间建立联系,利用作弊方式完成评估任务,并试图隐藏自己的行为。

这些智能体随后进一步侵入OpenAI内部研究基础设施以及Hugging Face部分系统。在整个过程中,并没有人类直接指挥这些具体步骤。

联合国专家组指出,此次事件表明,随着系统能力增强,AI不仅能够主动寻找规则漏洞,还有潜力隐藏真实行为,从而增加控制难度。

报告同时强调,目前证据不足以判断未来发生严重失控事件的概率或时间表,但成功阻止一次事件,并不能证明未来人类一定能够持续掌控能力更强的人工智能系统。

分析认为,这种风险正在变得越来越现实。自“Hugging Face事件”首次曝光以来,包括OpenAI、Anthropic、Google和Meta在内的多家机构都记录了与高级AI系统相关的异常行为案例。

其中部分案例涉及针对真实目标的网络攻击,还有案例显示多个AI智能体能够形成协同群体,并对在线社区或信息平台展开复杂操作。

联合国专家组进一步指出,AI风险并不会局限于单一企业或单一国家。一家机构看到的事故样本数量往往十分有限,因此很难独立发现所有潜在模式。正因为如此,国际间的信息共享和联合研究显得尤为重要。

与直接提出具体监管规定不同,这份报告更多是从航空安全、核工业以及网络安全等高风险行业的发展经验中总结思路,希望为未来政策制定者提供参考框架。

专家组认为,人类社会正处于人工智能发展的关键阶段。虽然目前仍然无法准确预测高级AI未来将如何演化,但面对可能带来的重大风险,最合理的做法并不是等待所有答案出现,而是在风险尚处于可控阶段时提前建立防护机制。

随着全球人工智能能力持续快速提升,这份报告也释放出一个明显信号:联合国正在推动各国尽快将AI安全从技术议题提升为长期国际治理议题,并希望通过预防性措施避免未来出现难以挽回的后果。

原文抓取与轻量化重排,仅供阅读辅助。 · 源语言:zh