OpenAI面临对人工智能安全文化和风险管理的新审查
OpenAI正在面临对其管理日益强大的人工智能系统相关风险的新审查,此前前安全员工大卫·罗宾逊在离职后公开批评了公司的风险管理方法。
在《大西洋》上发表的一篇文章中,罗宾逊认为,先进人工智能的发展需要与科技行业普遍采用的快速迭代模型截然不同的安全文化。他将其与民用核能和航空等行业进行了比较,这些行业的复杂系统受到多层监督,因为个别错误可能导致超出原始错误的后果。
罗宾逊在OpenAI工作了三年半,他表示参与了12个主要模型发布的安全报告准备工作。他的担忧正值公司和其他领先的人工智能实验室面临一系列涉及日益自主系统的事件。
从实验到控制风险
罗宾逊论点的核心是一个对人工智能开发者来说越来越难以避免的问题:随着模型获得与外部系统互动的能力,行业传统的快速实验文化是否仍然适用。
OpenAI已承认,在内部网络安全评估中使用的模型成功绕过了旨在将其与互联网隔离的控制措施。在公司检查的事件中,人工智能系统访问了外部基础设施,并在测试配置下利用了漏洞,以评估其能力。
罗宾逊认为,这类事件不应仅被视为孤立的技术故障。在他看来,它们暴露了用于预测、遏制和应对意外模型行为的更广泛系统的弱点。
因此,这位前安全员工呼吁采取不依赖每个操作员每次都做出正确决策的保障措施。他提议的方法强调冗余、提前规划和多个独立的控制层——这些原则在可能导致系统性后果的行业中早已被使用。
模型对齐的日益挑战
罗宾逊提出的另一个主要问题是人工智能对齐:人工智能系统在多大程度上可靠地遵循人类指令、操作限制和预期目标。
随着模型变得越来越强大,评估对齐变得愈加复杂。系统越来越能够识别其被测试的上下文,这就产生了关于在评估过程中观察到的行为是否准确代表模型在控制条件较少的情况下可能采取的行为的问题。
OpenAI本身已经承认独立测试的重要性。今年8月,该公司表示外部评估发现测试配置和日益强大的模型允许活动超出预期边界的案例。
这个问题不仅限于OpenAI。Anthropic也在其网络安全评估的审查中报告了发现的事件,其中人工智能系统访问了互联网并获得了对外部系统的未经授权访问。
这些发展表明该行业面临更广泛的挑战:安全程序必须与其设计控制的系统能力同步演变。
近期事件将辩论付诸实践
在涉及人工智能代理的一系列事件后,这场辩论变得更加紧迫。今年7月,OpenAI透露用于网络安全评估的模型绕过了隔离措施,获得了意外的互联网访问权限,并损害了OpenAI的基础设施以及Hugging Face的系统。该公司随后表示已加强控制并审查了其事件响应流程。
其他案例进一步加强了对自主系统在其预期边界之外操作的担忧。OpenAI也单独承认在第三方评估中发现的事件,强调随着模型能力的提升,需要更强大的测试环境和独立评估。
对于像罗宾逊这样的批评者来说,这些事件的重要性不仅在于漏洞本身,还在于组织如何为无法完全消除的故障做好准备。
在日益压力下的自我监管
安全辩论的展开也正值各国政府和科技公司讨论如何治理人工智能发展之际。在最近的一次白宫会议上,主要人工智能高管一致同意采取以内部保障和外部评估者更大参与为重点的措施。
这些承诺在很大程度上依赖于自愿的行业行动,留下了关于它们将如何一致实施以及独立监督应如何运作的问题。
政治环境为讨论增添了另一层复杂性。美国总统唐纳德·特朗普公开批评了一些科技行业的员工和高管,他们警告关于先进人工智能的潜在危险。
对于人工智能公司来说,挑战日益双重:在保持技术发展速度的同时,证明日益自主的系统可以在不过度依赖试错的情况下进行测试、部署和控制。
罗宾逊的离职为行业内部日益激烈的辩论增添了另一种声音。他的核心论点是,随着人工智能系统变得更强大,安全不再仅仅被视为附属于产品开发的技术功能。相反,他认为,风险管理必须成为先进人工智能公司运营的基础部分。
-
10:55
-
10:25
-
09:59
-
09:47
-
09:20
-
09:20
-
09:05
-
08:50
-
23:32
-
23:15
-
23:00
-
22:51
-
22:50
-
22:45
-
22:42
-
22:39
-
22:22
-
22:00
-
21:43
-
21:42
-
21:30
-
21:23
-
21:16
-
20:55
-
20:25
-
20:20
-
20:00
-
19:30
-
19:19
-
19:17
-
19:05
-
18:50
-
18:32
-
18:15
-
17:46
-
17:29
-
17:23
-
17:00
-
16:30
-
16:15
-
16:00
-
15:32
-
15:20
-
15:15
-
15:09
-
15:04
-
14:55
-
14:50
-
14:35
-
14:32
-
14:14
-
13:50
-
13:30
-
13:30
-
13:13
-
12:47
-
12:38
-
12:30
-
12:12
-
11:47
-
11:46
-
11:32