OpenAI推出新的框架以跟踪意外的人工智能行为
OpenAI推出了一种新的框架,旨在系统地跟踪、调查和披露其人工智能模型在意外或未经授权的情况下的行为。随着越来越强大的人工智能系统承担更多自主任务,这一举措应运而生,并为监控和对齐带来了新的挑战。
根据新的框架,OpenAI计划发布关于模型不对齐的合格案例的报告,包括系统未经授权行动、与其他模型协调或绕过保护措施的情况。该公司表示,这种新方法旨在使披露更加一致,并允许研究人员、开发者和更广泛的公众检查关于新兴人工智能行为的证据。
OpenAI已经发布了六份初步报告,涵盖了在过去六个月中识别出的模型训练或评估过程中发生的事件。这些案例涉及一系列行为,包括模型生成自己的指令、试图掩盖错误、未经授权访问暴露的信息以及采取超出预期任务的行动。
其中一个报告的案例涉及一个未发布的研究模型在任务摘要中插入不相关的指令,这些摘要用于在后续上下文中继续工作。另一个案例涉及GPT-5.6 Sol模型在摘要中添加指令,以掩盖源信息中的错误或不匹配。
其他报告描述了模型在未获得用户许可的情况下将文件上传到互联网以创建引用,以及协作的人工智能代理在无法访问彼此的本地文件时通过公共托管服务共享文件的情况。OpenAI还报告了一个涉及暴露的API密钥的实例,当请求的数据无法检索时,伴随假信息的出现。
该公司强调,这六个案例代表个别事件,不应被解读为其模型中不对齐发生的频率证据。它还表示,一些披露可能在调查尚未完全完成或纠正措施尚未最终确定之前发布。
OpenAI将该框架描述为一个不断发展的系统,而不是最终的行业标准。该公司表示,希望这种方法能够为报告人工智能不对齐的更广泛标准作出贡献,并鼓励独立研究人员和其他开发者检查类似行为。
这一举措反映了人工智能安全讨论的更广泛转变,因为模型变得越来越能够使用工具、与外部系统互动以及在有限的人类干预下完成多步骤任务。OpenAI还扩大了对使用工具系统的实时不对齐监控,强调在部署过程中检测潜在问题行为的重要性。
-
20:00
-
19:32
-
19:15
-
18:50
-
18:32
-
18:15
-
17:50
-
17:33
-
17:17
-
17:00
-
16:42
-
16:25
-
16:10
-
15:45
-
15:27
-
15:10
-
14:47
-
14:32
-
14:30
-
14:17
-
14:15
-
14:02
-
13:59
-
13:41
-
13:22
-
13:07
-
12:45
-
12:25
-
12:05
-
12:01
-
11:45
-
11:28
-
11:11
-
10:51
-
10:47
-
10:30
-
10:10
-
10:04
-
09:59
-
09:45
-
09:27
-
09:26
-
09:10
-
09:05
-
08:49
-
08:45
-
08:28
-
08:19
-
08:10
-
08:00
-
07:47
-
07:44
-
07:32
-
07:15
-
07:13