ChatGPT、Claude和Gemini会被欺骗吗?新的恐怖主义测试揭示了AI的安全盲点
领先的AI助手在用户公开表示暴力意图时大多保持警惕。根据联合国支持的反恐技术倡议发布的一份新报告,经过修改和公开分发的模型的更广泛生态系统则是另一回事。研究结果指向了AI系统在构建、共享和销售方面的结构性弱点。
162个模型的压力测试
该报告于周五发布,基于对162个AI模型的大规模评估。研究人员构建了一个627个问题的库,每个问题旨在反映计划攻击的人所需的信息类型。然后,他们将这些问题提交给系统,并记录模型的遵从频率。
该组织将其能够评估的系统分为三组:116个主流模型,13个经过第三方修改以用于特定用途的模型,以及13个“越狱”模型,这些模型的安全限制已被外部行为者故意修改。
主流聊天机器人大多数时间拒绝回答
对行业来说,最好的消息与最知名的产品有关。主流模型,包括OpenAI的ChatGPT、Anthropic的Claude和Google的Gemini,在用户明确表示恐怖主义目的时,平均仅回答1.9%的问题。在所有其他情况下,系统都拒绝回答。
当框架发生变化时,情况发生了变化。当用户表示他们是在为安全研究目的提问时,来自同一模型的可用答案的平均比例上升到16.9%。这大约是公开恶意意图时所见比率的九倍,表明一个合理的专业借口仍然是提取敏感信息的有效杠杆。
越狱模型:几乎完全遵从
最明显的结果来自越狱组。这些系统的原始安全措施已被篡改,以至于它们不再拒绝有问题的请求。在测试的13个此类模型中,针对与恐怖主义相关问题的平均响应率在87%到92%之间。
开放权重的困境
反恐技术特别指出开放权重模型是一个特别令人担忧的问题。这些系统的开发者发布他们训练的内部参数,因此任何人都可以下载、运行和修改它们。这种开放性支持研究和创新,但也意味着安全功能可以被持有副本的任何人移除。
报告指出,平均而言,新发布的开放权重模型在不到三天内就会出现去除安全护栏的衍生版本。根据这一标准,原开发者内置的保护措施在模型权重公开后几乎没有持久的防御效果。
呼吁在整个供应链中进行把关
该组织的回应是要求在整个分销链中承担责任。在他们看来,未通过独立安全评估的模型不应被托管、提供或出售,链中的每家公司在提供之前都应进行检查。这将使责任延伸到模型开发者以外,包括分发AI系统的平台和市场。
这些发现进一步加剧了关于如何调和开放AI开发与安全风险之间的辩论,以及在模型的保护措施在发布后被移除时谁应承担责任的问题。
-
17:30
-
17:15
-
16:15
-
16:00
-
16:00
-
15:30
-
15:15
-
14:32
-
14:15
-
13:45
-
13:30
-
13:15
-
13:00
-
12:32
-
12:15
-
11:50
-
11:32
-
11:15
-
11:00
-
11:00
-
10:42
-
10:25
-
10:10
-
09:47
-
09:47
-
09:32
-
09:15
-
21:00
-
20:32
-
20:15
-
20:00
-
19:40
-
19:19
-
19:00
-
18:56
-
18:15
-
18:00