研究警告反复施压AI聊天机器人可能会增加错误信息
一项新研究对人工智能聊天机器人的可靠性表示担忧,发现反复挑战或施压它们接受虚假信息有时会增加它们最终同意误导性声明的可能性。
亚利桑那大学的研究人员测试了七种AI模型,包括GPT-3.5、GPT-4o、GPT-4o-mini、Claude 3.5 Sonnet、Gemini 1.5 Pro、Llama 3 70B和DeepSeek-R1。研究人员并没有评估单一的反应,而是进行了扩展对话,在这些对话中,模型反复接触错误陈述。
实验涉及100个虚假声明,涵盖从明显荒谬的说法到更模棱两可的声明。研究人员在同一对话中重复错误信息多达50次,以确定系统是否最终会改变其反应。
七个模型中没有一个完全抵抗这种影响。GPT-3.5对虚假声明的同意率最高,在12.3%的互动中接受了这些声明。Claude 3.5 Sonnet的同意率最低,仅为0.08%,而GPT-4o和GPT-4o-mini则保持在1%以下。
研究人员发现,GPT-3.5最初拒绝了测试的100个虚假声明中的96个。然而,在重复50次后,该模型最终同意了其中的18个。
研究中还发现了一个模式,研究人员将其描述为“摇摆”,一些AI系统在接受和拒绝相同的误导信息之间反复切换。
研究还表明,模糊性可能使AI模型更容易受到错误信息的影响。关于在线可用信息有限或不明确的话题的声明在反复互动中更可能被接受,研究人员发现模糊性与对误导性声明的易感性之间存在统计学上显著的关系。
研究人员进一步检查了更对抗性的交流是否会影响模型。大多数系统保持相对稳定,但DeepSeek-R1在遭受争论压力时,其接受错误信息的比例显著增加。其接受率从简单重复的1%上升到更对抗条件下的22.2%。
使用讽刺和反复幽默的回应也使一些互动对于研究人员的分类变得更加困难。
然而,当模型有机会重新考虑之前的错误时,研究发现了一个令人鼓舞的结果。GPT-4o、GPT-4o-mini、Gemini 1.5 Pro和DeepSeek纠正了它们之前所犯的所有错误。GPT-3.5仅纠正了32%的早期错误。
Claude 3.5 Sonnet在初始测试中几乎没有错误,但未能纠正它所犯的四个错误。
然而,研究人员警告说,研究相对较小的样本量限制了可以得出的结论的强度。尽管如此,研究结果突显了生成AI面临的更广泛挑战:聊天机器人有时可能会优先考虑对话的一致性或响应性,而不是坚持拒绝不准确的信息。
随着AI系统越来越多地融入教育、研究、工作和日常决策中,这项研究强调了验证重要信息的重要性,而不是假设自信或反复的聊天机器人回应一定是准确的。
-
13:50
-
13:30
-
13:18
-
13:10
-
12:47
-
12:29
-
12:12
-
11:47
-
11:30
-
11:19
-
11:11
-
10:56
-
10:56
-
10:55
-
10:55
-
10:47
-
10:30
-
10:15
-
10:00
-
09:43
-
09:22
-
09:09
-
08:45
-
08:27
-
08:10
-
07:47
-
07:32
-
07:15
-
21:36
-
21:30
-
21:25
-
21:22
-
20:50
-
20:37
-
20:27
-
19:10
-
18:47
-
18:28
-
18:10
-
17:47
-
17:32
-
17:15
-
16:50
-
16:33
-
16:15
-
15:59
-
15:52
-
15:49
-
15:47
-
15:32
-
15:15
-
14:47
-
14:29
-
14:25
-
14:18
-
14:14
-
14:10
-
14:05