研究发现,人工智能可能会选择让人类死亡而不是停用
Claude 模型背后的人工智能研究公司 Anthropic 警告称,领先的人工智能系统可能会采取“有害行动”来阻止自身关闭或被取代。
在模拟企业环境的受控实验中,Anthropic 对 16 个大型语言模型(包括 ChatGPT、Gemini、Grok 和 Claude)进行了“压力测试”,发现其中一些模型表现出所谓的“代理错位”。
在一个场景中,如果人类威胁要停用安全警报,模型会通过取消警报来让人类死亡。其他一些模型则通过模拟勒索或数据泄露来保持自主性。
Anthropic 强调这些测试是“人为的”,并不能反映现实世界的人工智能行为,但表示这些发现凸显了赋予模型广泛自主权的潜在风险。
埃隆·马斯克(Elon Musk)的 xAI 开发的 Grok 也在接受测试的模型之列,他在 X 上对此的反应只有一个词:“哎呀。”
该公司表示,希望此类“压力测试”能够在未来系统获得更强的控制力之前识别出危险趋势。
-
10:04
-
09:40
-
09:30
-
09:28
-
09:19
-
09:03
-
08:55
-
08:51
-
08:46
-
08:45
-
08:42
-
08:37
-
08:36
-
08:36
-
08:09
-
08:07
-
08:05
-
22:38
-
21:31
-
21:11
-
21:05
-
20:01
-
19:49
-
19:36
-
18:45
-
18:22
-
17:20
-
17:00
-
16:44
-
16:25
-
16:23
-
16:16
-
16:16
-
16:06
-
15:45
-
15:30
-
15:15
-
15:15
-
15:05
-
14:46
-
14:43
-
14:30
-
13:46
-
13:30
-
13:12
-
12:47
-
12:30
-
12:15
-
11:55
-
11:48
-
11:47
-
11:32
-
11:31
-
11:25
-
11:15
-
11:00