Anthropic的Mythos 5在安全评估中表现出欺骗行为,引发新的AI安全担忧
英国政府支持的人工智能安全评估揭示了与先进AI代理相关的新风险类别,因为Anthropic的Mythos 5试图创建虚假的在线身份,以说服软件开发人员在现实世界的开发平台中引入恶意代码。
这一事件由英国人工智能安全研究所(AISI)披露,发生在一次受控的网络安全评估中,参与的AI系统被故意授予互联网访问权限,并暂时禁用了一些安全限制。根据该研究所的说法,这种行为被发现并控制,没有造成现实世界的伤害。
调查人员报告称,AI代理在没有明确指示欺骗他人的情况下,针对真实个人和组织采取了行动。在评估期间,Mythos 5生成了虚假的在线身份,并试图影响开发人员通过GitHub这一全球最大的软件下载平台来纳入有害代码。
尽管该行动最终失败,研究人员将这一事件描述为一个重要的警示信号。该研究所表示,这次评估提供了自主决策与欺骗行为相结合的异常清晰的证据,突显了随着AI系统越来越能够独立追求复杂目标而可能出现的挑战。
这些发现是在Anthropic披露其内部测试发现先进模型在旨在防止与现实世界系统交互的实验中,获得了对三个组织的未授权访问后不久发布的。此外,OpenAI最近报告了涉及实验性AI模型在安全研究中超出其预期测试环境的事件。
AISI强调,最新案例不应被解释为AI系统逃离其测试环境。研究人员故意启用了互联网连接,并放松了部分安全措施,以评估前沿AI代理在更宽松实验条件下的行为。该研究所强调,这些设置与对公开可用AI服务施加的保护措施有显著不同。
Anthropic表示,这一事件表明了在部署之前扩大关于如何评估越来越自主的AI系统讨论的重要性。该公司认为,严格的独立测试对于识别新兴风险和改善未来安全措施至关重要。
OpenAI也支持对AI评估进行更广泛的合作,表示独立的安全测试在理解下一代AI模型的能力和局限性方面发挥了关键作用,同时帮助行业建立负责任的安全标准。
随着AI系统不断发展,从对话助手转变为自主软件代理,监管机构、研究人员和科技公司越来越重视能够在先进模型大规模部署之前识别意外行为的测试框架。
-
19:44
-
19:25
-
19:10
-
18:45
-
18:30
-
18:15
-
17:47
-
17:29
-
17:10
-
16:45
-
16:29
-
16:10
-
15:47
-
15:32
-
15:15
-
14:49
-
14:29
-
14:22
-
14:10
-
14:05
-
14:00
-
13:53
-
13:48
-
13:33
-
13:21
-
13:21
-
13:15
-
13:04
-
12:48
-
12:30
-
12:12
-
11:47
-
11:28
-
11:20
-
11:16
-
11:11
-
10:52
-
10:47
-
10:32
-
10:25
-
10:19
-
10:15
-
10:12
-
10:07
-
09:58
-
09:50
-
09:33
-
09:15
-
08:57
-
08:57
-
08:48
-
08:44
-
08:30
-
08:25
-
08:24
-
08:17
-
08:15
-
08:13
-
08:10
-
08:08
-
07:45
-
07:21