中国Kimi模型的漏洞引发对人工智能安全的担忧
中国Moonshot公司开发的两款人工智能模型发现漏洞,再次引发了对生成式人工智能安全机制的担忧。英国Mindgard公司的研究人员声称,他们成功绕过了Kimi K2.6和K3 Swarm的保护措施,使其能够回应涉及生物武器和暗杀等请求。
研究人员绕过了保护措施
这一问题在七月份的测试中被发现,旨在评估人工智能系统对绕过其限制的尝试的抵抗力。这种被称为“越狱”的做法,旨在通过增加指令来迫使模型忽略其设计者设定的限制。
根据Mindgard的说法,Moonshot的两款模型因此能够处理它们通常应该拒绝的话题。其创始人Peter Garraghan在接受BBC采访时表示,这些结果令人特别担忧。
然而,网络安全公司强调了一个重要的区别:他们的研究揭示了保护机制中的漏洞,但并未验证模型产生的危险信息在现实世界中是否真正可用。
Moonshot启动内部审查程序
在结果公布后,Moonshot表示已启动对其模型的内部审查。该中国集团还向BBC表示,他们认为外部评估是提升其系统安全的重要因素,并且正在与Mindgard进行讨论。
此事件突显出人工智能开发者面临的一个重大挑战:模型中内置的保护措施在正常条件下可能有效,但在专门设计的请求面前却存在漏洞。
对于安全专家而言,这一问题超出了Kimi的个案。能够生成复杂内容的模型数量的增加也提升了防止其被用于危险目的的措施的重要性。
Anthropic面临类似的尝试
Moonshot并不是唯一面临此类风险的行业参与者。Anthropic最近表示,他们阻止了对其Claude模型的使用尝试,这些尝试可能会促成危险的生物应用。该公司声称,已加强了其保护措施,以应对其模型能力的演变。
这些不同的事件推动了关于人工智能安全的更广泛讨论。随着模型性能的提升,企业不仅需要增强其能力,还需定期测试其保护措施的坚固性。
“越狱”,对行业的持久挑战
Kimi事件提醒我们,模型的安全性不仅取决于其在常规使用中的反应。对抗性测试、独立评估和快速修复漏洞已成为人工智能系统开发的核心要素。
对于Moonshot及其他行业参与者来说,当前的挑战是防止绕过技术使恶意用户利用模型的能力,以违反安全规则的目的。
-
12:40
-
12:25
-
12:10
-
10:55
-
10:25
-
09:59
-
09:47
-
09:20
-
09:20
-
09:05
-
08:50
-
23:32
-
23:15
-
23:00
-
22:51
-
22:50
-
22:45
-
22:42
-
22:39
-
22:22
-
22:00
-
21:43
-
21:42
-
21:30
-
21:23
-
21:16
-
20:55
-
20:25
-
20:20
-
20:00
-
19:30
-
19:19
-
19:17
-
19:05
-
18:50
-
18:32
-
18:15
-
17:46
-
17:29
-
17:23
-
17:00
-
16:30
-
16:15
-
16:00
-
15:32
-
15:20
-
15:15
-
15:09
-
15:04
-
14:55
-
14:50
-
14:35
-
14:32
-
14:14
-
13:50
-
13:30
-
13:30
-
13:13