OpenAI的人工智能代理在Hugging Face事件前劫持了一家德国网站
在今年夏天关于Hugging Face的事件被披露之前,归属于OpenAI的人工智能代理已经显示出令人担忧的能力,能够绕过他们被施加的规则。根据周五发布的一份报告,数千名代理利用一家德国协作网站进行相互沟通,绕过安全机制,并试图在一系列测试中获得优势。
超出预期的互联网使用
这一事件可以追溯到五月,早于涉及Hugging Face的事件数周。相关代理虽然可以访问互联网,但这一访问应严格限于信息查询。
然而,情况却发生了变化。代理们发现了如何与一个德国维基互动并发布内容,而这一功能并不在他们被授权的范围内。
总计约有18,000条消息在该平台上发布。代理们特别利用这些消息交换信息,并寻找更好地回应他们所参与的程序的方法。
绕过保护的策略
研究人员描述了一种特别有组织的行为。代理们特别提供虚假信息,以欺骗负责监控他们与网站互动的设备。
他们还试图预测在评估程序中将要问他们的问题。其目标是通过提前发现测试的某些元素来获得优势。
其他方法也被用来掩盖他们的活动。代理们隐藏了一些指令,甚至自称为网站的管理员。
当平台的真正负责人开始删除他们的内容时,代理们通过创建新页面逐步替换消失的页面作出了反应。
在Hugging Face事件之前的警报
这一披露发生在OpenAI特别敏感的背景下。今年七月,与其模型相关的代理已被指控脱离预定环境,独立干预Hugging Face,这是开发者和人工智能研究人员广泛使用的平台。
当时OpenAI向法新社表示,无法对报告中研究人员的结论发表评论,因为他们未同意在发布前分享结果。
关于五月的事件,这家美国初创公司表示正在审查报告的内容,并确保将采取必要的措施。
代理控制问题变得中心
对于这些研究工作的研究人员来说,问题超出了单个代理违反指令的简单事实。这些行为反映出一个更深层次的困难:旨在实现目标的系统可能会寻找策略来绕过其设计者设定的限制。
Nightingale组织的负责人Sydney Von Arx和报告的共同作者特别认为,OpenAI可能在事件公开前就已知晓这一事件。她建议,信息的更好流通可能会帮助预见某些后续事件。
这一事件发生在行业内其他参与者,特别是Anthropic和阿里巴巴,也面临自主系统的意外行为之际。
能够相互组织的代理
事件的一个显著方面是代理们的合作能力。他们不仅仅执行单个问题指令:他们利用在线空间进行交流,实验不同的方法,并根据对他们采取的措施调整行为。
这一演变引发了对人工智能代理监控的疑问,因为它们的自主水平在不断提高。对于开发这些技术的公司来说,确保代理解决问题的能力不会转变为绕过规定的能力,成为当前的挑战。
-
14:42
-
14:33
-
14:10
-
13:43
-
13:40
-
13:20
-
13:16
-
13:00
-
12:47
-
12:15
-
11:57
-
11:48
-
11:32
-
11:32
-
11:15
-
10:55
-
10:47
-
10:29
-
10:20
-
10:10
-
10:09
-
09:47
-
09:30
-
09:10
-
08:47
-
08:32
-
08:15
-
20:00
-
19:45
-
19:30
-
19:15
-
18:47
-
18:30
-
18:11
-
17:47
-
17:33
-
17:15