Newswire
Newswire
Newswire 登入
Newsletter|Newswire Newsletter 联络我们|Newswire 联络我们 登广告|Newswire 登广告 关于我们|Newswire 关于我们 活动|Newswire 活动
快讯
Newswirer 登广告 互动区 |
下载APP
|

ADVERTISEMENT

ADVERTISEMENT

对话迷失

每次跟AI聊天机器人聊天时,一开始会对答如流和有亮点。不过,随着对话次数越来越多,AI会变得有些迟钝,甚至出现前后矛盾。这不是错觉,而是一种系统的缺陷。 去年,微软研究院和Salesforce联合发表一项研究,分析超过20万条与AI模型的对话,当中包括主流的GPT-4.1、Gemini 2.5 Pro、Claude 3.7 Sonnet、o3、DeepSeek R1和Llama 4。结果研究显示,AI聊得越久,越会在对话中出错。 以GPT-4.1和Gemini 2.5 Pro为例,这两个AI模型在处理单次提问时,成功率高达90%。然而,当研究人员刻意多次来回对话,AI的对话表现会下降到65%。 研究人员称,在多次对话的情况下,不管AI模型的能力有多高,大家都表现失准。“我们将它称为‘对话迷失’(lost in conversation)现象。即当模型在多轮对话中出现偏差,它们会彻底迷失方向,且无法自我修复。” 经测试,AI模型的能力并没有变差,只是平均能力水平(Aptitude)下滑了15%。然而,出错率却高达112%。即使是顶尖的AI模型,在多次对话时也会出现“断片”,忘记前后文本脉络。 为什么会发生这种事?研究人员找到4个问题根源:第一、AI盲目抢答。当用户还没把问题解释清楚,AI便急着给答案,造成认知偏差。 第二、即使用户事后修正了一些资料,可是,AI模型会依据自己最初的错误回答,再延伸下去,最后造成逻辑混乱,给出错误答案。 第三、AI太过关注对话的开头和结尾,想要有前后呼应,而忽略了中间的内容细节和逻辑思路,最后出现讯息断层。 第四、回答膨胀(answer bloat)。研究发现,在多轮对话时,AI模型的回答长度会增加20%至300%。一旦回复变长,就会有更多的假设和幻觉。当AI继续推理时,这些假设和幻觉会被当成上下文内容,最后导致自己无法捕捉到用户真正想要问的问题。 研究称,即使像OpenAI的o3和DeepSeek R1有额外的“思考型”模型,在多次对话里面,它们也一样沦陷,无能为力。 毫无疑问,AI模型可以迅速筛检各种内容,给出用户想要的答案。可是,当用户过于依赖AI生成的内容,尤其是谷歌的AI Overviews,就会有一个潜在风险。因为用户通常直接采纳,不会去查证资讯真伪。 更多文章: 【科技简讯】自动手推车来了 Mobi让购物轻松又智能 【科技简讯】Uber Eats购物车助手上线 AI直接帮你把菜买好 【科技Talk】IG悄悄测试新功能 Meta打算进军微短剧?
5月前