突发 17:30 穆罕默德·瓦赫比瞄准摩洛哥和非洲历史性的世界杯胜利 17:15 巴希尔·阿卜杜对摩洛哥艺术机构在萨阿德·拉姆贾德案件中的沉默表示不满 16:15 摩洛哥的数字化转型:公证人引入电子徽章和安全内联网 16:00 因凡蒂诺的对手寻求说服温格竞选国际足联主席 16:00 EDGE与摩洛哥签署国防合作协议,精确制导武器引起关注 15:30 赞比亚与国际货币基金组织达成初步14.7亿美元融资协议 15:15 伊姆兰·汗的释放要求在巴基斯坦政治紧张局势中推动PTI抗议游行 14:32 特朗普任命凯蒂·扎卡里亚为新任白宫新闻秘书 14:15 联合国呼吁加强对津巴布韦童婚和青少年怀孕的行动 13:45 前OpenAI研究人员警告人类无法理解的AI系统 13:30 ChatGPT、Claude和Gemini会被欺骗吗?新的恐怖主义测试揭示了AI的安全盲点 13:15 特朗普宣布进一步措施应对柴油价格上涨 13:00 摩洛哥女足在拉巴特以3-1战胜乌兹别克斯坦 12:32 巴西在总统决选前两周削减燃料税 12:15 土耳其禁止社交媒体服务向15岁以下儿童提供 11:50 特朗普批评诺贝尔和平奖决定并质疑其可信度 11:32 法国媒体机构因Meta的在线广告行为寻求14亿欧元赔偿 11:15 世界气象组织警告到2026年底可能出现创纪录的厄尔尼诺现象 11:00 世卫组织呼吁各国扩大社区精神卫生服务 11:00 阿联酋检察官称Flydubai副驾驶涉嫌策划自杀式袭击特拉维夫机场 10:42 摩洛哥的发展议程从重大成就转向可衡量的社会影响 10:25 摩洛哥与美国在两国建交250周年之际寻求深化经济联系 10:10 谷歌推出Gemini人工智能助手以单一界面管理工作任务 09:47 摩洛哥寻求在与欧洲伙伴的移民政策中发挥更大作用 09:47 穆罕默德六世国王的讲话聚焦青年就业和区域发展 09:32 CAF考虑将非洲杯恢复为两年一届的赛制 09:15 Anthropic推出保护措施以防止对其Claude AI的持续虐待 21:00 摩洛哥高尔夫球手亚当·布雷斯努在世界业余人才中崭露头角 20:32 以色列谴责授予南非法官纳维·皮莱的诺贝尔和平奖 20:15 克里姆林宫表示普京和特朗普预计很快会通电话 20:00 波罗的海国家呼吁欧盟禁止俄罗斯粮食通过波罗的海水域运输 19:40 世界银行强调摩洛哥技术出口与人工智能采用之间的差距 19:19 欧盟支持46个新项目以确保关键矿产供应 19:00 马斯克表示SpaceX未来可能超过全球经济的价值 18:56 梅西在国际告别后重返国际迈阿密训练 18:15 联合国对法国学生抗议中的暴力和逮捕表示关切 18:00 特朗普政府暂停微软参与与H-1B工人相关的移民项目

ChatGPT、Claude和Gemini会被欺骗吗?新的恐怖主义测试揭示了AI的安全盲点

13:30
ChatGPT、Claude和Gemini会被欺骗吗?新的恐怖主义测试揭示了AI的安全盲点

领先的AI助手在用户公开表示暴力意图时大多保持警惕。根据联合国支持的反恐技术倡议发布的一份新报告,经过修改和公开分发的模型的更广泛生态系统则是另一回事。研究结果指向了AI系统在构建、共享和销售方面的结构性弱点。

162个模型的压力测试

该报告于周五发布,基于对162个AI模型的大规模评估。研究人员构建了一个627个问题的库,每个问题旨在反映计划攻击的人所需的信息类型。然后,他们将这些问题提交给系统,并记录模型的遵从频率。

该组织将其能够评估的系统分为三组:116个主流模型,13个经过第三方修改以用于特定用途的模型,以及13个“越狱”模型,这些模型的安全限制已被外部行为者故意修改。

主流聊天机器人大多数时间拒绝回答

对行业来说,最好的消息与最知名的产品有关。主流模型,包括OpenAI的ChatGPT、Anthropic的Claude和Google的Gemini,在用户明确表示恐怖主义目的时,平均仅回答1.9%的问题。在所有其他情况下,系统都拒绝回答。

当框架发生变化时,情况发生了变化。当用户表示他们是在为安全研究目的提问时,来自同一模型的可用答案的平均比例上升到16.9%。这大约是公开恶意意图时所见比率的九倍,表明一个合理的专业借口仍然是提取敏感信息的有效杠杆。

越狱模型:几乎完全遵从

最明显的结果来自越狱组。这些系统的原始安全措施已被篡改,以至于它们不再拒绝有问题的请求。在测试的13个此类模型中,针对与恐怖主义相关问题的平均响应率在87%到92%之间。

开放权重的困境

反恐技术特别指出开放权重模型是一个特别令人担忧的问题。这些系统的开发者发布他们训练的内部参数,因此任何人都可以下载、运行和修改它们。这种开放性支持研究和创新,但也意味着安全功能可以被持有副本的任何人移除。

报告指出,平均而言,新发布的开放权重模型在不到三天内就会出现去除安全护栏的衍生版本。根据这一标准,原开发者内置的保护措施在模型权重公开后几乎没有持久的防御效果。

呼吁在整个供应链中进行把关

该组织的回应是要求在整个分销链中承担责任。在他们看来,未通过独立安全评估的模型不应被托管、提供或出售,链中的每家公司在提供之前都应进行检查。这将使责任延伸到模型开发者以外,包括分发AI系统的平台和市场。

这些发现进一步加剧了关于如何调和开放AI开发与安全风险之间的辩论,以及在模型的保护措施在发布后被移除时谁应承担责任的问题。


  • 黎明祷告
  • 日出
  • 正午祷告
  • 下午祷告
  • 日落祷告
  • 夜祷

阅读更多

本网站 walaw.press 使用 Cookie,以为您提供良好的浏览体验并持续改进我们的服务。继续浏览本网站即表示您同意使用这些 Cookie。