【科技Talk】和AI聊得越久,越会迷失自我?


每次跟AI聊天机器人聊天时,一开始会对答如流和有亮点。不过,随着对话次数越来越多,AI会变得有些迟钝,甚至出现前后矛盾。这不是错觉,而是一种系统的缺陷。
去年,微软研究院和Salesforce联合发表一项研究,分析超过20万条与AI模型的对话,当中包括主流的GPT-4.1、Gemini 2.5 Pro、Claude 3.7 Sonnet、o3、DeepSeek R1和Llama 4。结果研究显示,AI聊得越久,越会在对话中出错。
ADVERTISEMENT
以GPT-4.1和Gemini 2.5 Pro为例,这两个AI模型在处理单次提问时,成功率高达90%。然而,当研究人员刻意多次来回对话,AI的对话表现会下降到65%。


研究人员称,在多次对话的情况下,不管AI模型的能力有多高,大家都表现失准。“我们将它称为‘对话迷失’(lost in conversation)现象。即当模型在多轮对话中出现偏差,它们会彻底迷失方向,且无法自我修复。”
经测试,AI模型的能力并没有变差,只是平均能力水平(Aptitude)下滑了15%。然而,出错率却高达112%。即使是顶尖的AI模型,在多次对话时也会出现“断片”,忘记前后文本脉络。
为什么会发生这种事?研究人员找到4个问题根源:第一、AI盲目抢答。当用户还没把问题解释清楚,AI便急着给答案,造成认知偏差。
第二、即使用户事后修正了一些资料,可是,AI模型会依据自己最初的错误回答,再延伸下去,最后造成逻辑混乱,给出错误答案。
第三、AI太过关注对话的开头和结尾,想要有前后呼应,而忽略了中间的内容细节和逻辑思路,最后出现讯息断层。
第四、回答膨胀(answer bloat)。研究发现,在多轮对话时,AI模型的回答长度会增加20%至300%。一旦回复变长,就会有更多的假设和幻觉。当AI继续推理时,这些假设和幻觉会被当成上下文内容,最后导致自己无法捕捉到用户真正想要问的问题。
研究称,即使像OpenAI的o3和DeepSeek R1有额外的“思考型”模型,在多次对话里面,它们也一样沦陷,无能为力。
毫无疑问,AI模型可以迅速筛检各种内容,给出用户想要的答案。可是,当用户过于依赖AI生成的内容,尤其是谷歌的AI Overviews,就会有一个潜在风险。因为用户通常直接采纳,不会去查证资讯真伪。
更多文章: 【科技简讯】自动手推车来了 Mobi让购物轻松又智能 【科技简讯】Uber Eats购物车助手上线 AI直接帮你把菜买好 【科技Talk】IG悄悄测试新功能 Meta打算进军微短剧?
ADVERTISEMENT
热门新闻
百格视频
ADVERTISEMENT


