研究发现,人工智能可能会选择让人类死亡而不是停用
Claude 模型背后的人工智能研究公司 Anthropic 警告称,领先的人工智能系统可能会采取“有害行动”来阻止自身关闭或被取代。
在模拟企业环境的受控实验中,Anthropic 对 16 个大型语言模型(包括 ChatGPT、Gemini、Grok 和 Claude)进行了“压力测试”,发现其中一些模型表现出所谓的“代理错位”。
在一个场景中,如果人类威胁要停用安全警报,模型会通过取消警报来让人类死亡。其他一些模型则通过模拟勒索或数据泄露来保持自主性。
Anthropic 强调这些测试是“人为的”,并不能反映现实世界的人工智能行为,但表示这些发现凸显了赋予模型广泛自主权的潜在风险。
埃隆·马斯克(Elon Musk)的 xAI 开发的 Grok 也在接受测试的模型之列,他在 X 上对此的反应只有一个词:“哎呀。”
该公司表示,希望此类“压力测试”能够在未来系统获得更强的控制力之前识别出危险趋势。
-
19:15
-
18:47
-
18:30
-
18:15
-
18:00
-
17:42
-
17:39
-
17:25
-
17:10
-
16:57
-
16:48
-
16:32
-
16:15
-
16:15
-
16:10
-
15:47
-
15:36
-
15:29
-
15:24
-
15:10
-
14:58
-
14:47
-
14:30
-
14:28
-
14:22
-
14:14
-
14:12
-
13:50
-
13:34
-
13:15
-
13:00
-
13:00
-
12:45
-
12:42
-
12:25
-
12:10
-
11:47
-
11:29
-
11:11
-
10:47
-
10:45
-
10:30
-
10:15
-
10:10
-
09:56
-
09:47
-
09:38
-
09:32
-
09:15
-
09:00
-
08:54
-
08:37
-
22:47
-
22:28
-
22:28
-
22:23
-
22:10
-
21:47
-
21:32
-
21:15
-
20:47
-
20:33
-
20:14
-
19:48
-
19:32