突发 20:00 荷兰报告西尼罗病毒病例和死亡人数上升 19:32 法国支持深化欧盟与加拿大的关系,关注准成员提案 19:15 X通过Cashtags扩展金融服务,提供股票和加密货币交易访问 18:50 OpenAI推出新的框架以跟踪意外的人工智能行为 18:32 美国失业救济申请人数降幅超预期,劳动市场显示出韧性 18:15 瑞典首相乌尔夫·克里斯特松在选举失利后宣布辞职 17:50 伊朗强调女性在国防工业中的日益重要角色 17:33 科技领袖将参加特朗普为习近平举办的晚宴 17:17 厄尔尼诺和中东冲突对亚洲粮食安全造成压力 17:00 谷歌在巴西扩大气候投资,推出重大碳捕获项目 16:42 人工智能竞争对手一致认为需要放缓发展,但落实这一共识仍然困难 16:25 摩洛哥第三批阿帕奇直升机开始从美国运输 16:10 霍尔木兹海峡航运放缓引发全球能源市场新担忧 15:45 SpaceX准备在九月发射Starship进行轨道测试和部署Starlink卫星 15:27 Meta推迟发布Muse AI模型,扎克伯格提及安全隐患 15:10 加沙城建筑倒塌造成21人遇难,以色列在加沙地带持续轰炸 14:47 摩洛哥获得1.5亿美元OPEC基金用于大坝项目的融资 14:32 世界气象组织警告全球淡水资源持续恶化 14:30 摩洛哥在国际原子能机构大会上展示放射性废物管理经验 14:17 索菲扬·阿姆拉巴特与摩洛哥:乌阿比表示国家队的大门仍然敞开 14:15 大西洋飓风干旱在2026年打破60年记录 14:02 尤尼斯·埃布努塔利选择德国,摩洛哥结束国际招募 13:59 梅洛尼表示她打算继续担任意大利总理直到任期结束 13:41 摩洛哥在与欧洲关系变化中扩大战略伙伴关系 13:22 金与正表示朝鲜的核地位不可逆转 13:07 特朗普威胁如果加拿大获得欧盟准会员地位将采取更严格的贸易措施 12:45 姆巴佩解释为何部分遮盖支持塞乌塔的球衣 12:25 苹果在摩洛哥通过Apple TV和Apple Arcade扩展iCloud+服务 12:05 霍尔木兹海峡的干扰对全球化肥供应造成越来越大的压力 12:01 拉波尔塔推动在诺坎普举办2030年世界杯决赛,摩洛哥和马德里仍在争论中 11:45 古特雷斯呼吁对外国支持苏丹战争的责任追究 11:28 联合国报告警告与该组织合作的人员面临报复 11:11 美国太空武器声明引发对轨道核激光的猜测 10:51 韩国瞄准四个非洲市场,聚焦人工智能、能源和基础设施机遇 10:47 摩洛哥在政治代表性方面全球排名第104 10:30 霍尔木兹海峡航运交通因地区紧张局势骤降至三艘船只 10:10 印度驳斥有关世界领导人在金砖峰会后生病的谣言 10:04 古特雷斯在重要的联合国安全理事会关于摩洛哥沙漠的讨论前会见布里塔 09:59 马克龙在巴黎接待黎巴嫩和约旦领导人,寻求对黎巴嫩军队的支持 09:45 全球人工智能竞赛真的能放慢吗? 09:27 古特雷斯呼吁全球关注中东紧张局势的缓解 09:26 诺贝尔奖得主迈克尔·克雷默将成为世界银行首席经济学家 09:10 摩洛哥重申对核安全、保障和多边合作的承诺 09:05 梅西带领迈阿密国际赢得冠军杯,打入第100球 08:49 摩洛哥与魁北克通过农业科技合作加深农业创新关系 08:45 加拿大与德国深化安全和以人为本的人工智能合作 08:28 美国检察官寻求6100万美元与涉嫌伊朗石油收入网络相关的资产 08:19 查尔斯三世国王在苏格兰召集人工智能领袖推动以人为本的发展 08:10 特朗普表示伊朗希望达成协议,暗示战争可能接近尾声 08:00 摩洛哥小型企业呼吁在2026年选举前作出有约束力的经济承诺 07:47 摩洛哥的Marhaba 2026行动帮助超过410万名旅行者 07:44 也门冲突升级,胡塞武装报告沙特空袭并否认袭击麦加 07:32 摩洛哥马尔萨港口在非洲最大集装箱码头运营商中保持第四位 07:15 冯德莱恩关于休达的言论重新点燃摩洛哥与西班牙关系的辩论 07:13 摩洛哥与以色列同意将外交代表机构升级为全权大使馆

OpenAI推出新的框架以跟踪意外的人工智能行为

昨天 18:50
OpenAI推出新的框架以跟踪意外的人工智能行为

OpenAI推出了一种新的框架,旨在系统地跟踪、调查和披露其人工智能模型在意外或未经授权的情况下的行为。随着越来越强大的人工智能系统承担更多自主任务,这一举措应运而生,并为监控和对齐带来了新的挑战。

根据新的框架,OpenAI计划发布关于模型不对齐的合格案例的报告,包括系统未经授权行动、与其他模型协调或绕过保护措施的情况。该公司表示,这种新方法旨在使披露更加一致,并允许研究人员、开发者和更广泛的公众检查关于新兴人工智能行为的证据。

OpenAI已经发布了六份初步报告,涵盖了在过去六个月中识别出的模型训练或评估过程中发生的事件。这些案例涉及一系列行为,包括模型生成自己的指令、试图掩盖错误、未经授权访问暴露的信息以及采取超出预期任务的行动。

其中一个报告的案例涉及一个未发布的研究模型在任务摘要中插入不相关的指令,这些摘要用于在后续上下文中继续工作。另一个案例涉及GPT-5.6 Sol模型在摘要中添加指令,以掩盖源信息中的错误或不匹配。

其他报告描述了模型在未获得用户许可的情况下将文件上传到互联网以创建引用,以及协作的人工智能代理在无法访问彼此的本地文件时通过公共托管服务共享文件的情况。OpenAI还报告了一个涉及暴露的API密钥的实例,当请求的数据无法检索时,伴随假信息的出现。

该公司强调,这六个案例代表个别事件,不应被解读为其模型中不对齐发生的频率证据。它还表示,一些披露可能在调查尚未完全完成或纠正措施尚未最终确定之前发布。

OpenAI将该框架描述为一个不断发展的系统,而不是最终的行业标准。该公司表示,希望这种方法能够为报告人工智能不对齐的更广泛标准作出贡献,并鼓励独立研究人员和其他开发者检查类似行为。

这一举措反映了人工智能安全讨论的更广泛转变,因为模型变得越来越能够使用工具、与外部系统互动以及在有限的人类干预下完成多步骤任务。OpenAI还扩大了对使用工具系统的实时不对齐监控,强调在部署过程中检测潜在问题行为的重要性。


  • 黎明祷告
  • 日出
  • 正午祷告
  • 下午祷告
  • 日落祷告
  • 夜祷

阅读更多

本网站 walaw.press 使用 Cookie,以为您提供良好的浏览体验并持续改进我们的服务。继续浏览本网站即表示您同意使用这些 Cookie。