2026年9月1日
娱乐

AI幻觉率最高达73%:当聊天机器人开始一本正经地胡说八道

【全五集】豆瓣8.7《扯淡地球史》| 一本正经的胡说八道,干货知识+英式笑料+洗脑各领域专家(双语字幕)

一次“抄近道”引发的深山惊魂

2026年8月30日下午,宁波市鄞州区一处山域内,57岁的杨师傅爬山迷路被困,体力透支,不得不报警求助。接警后消防员火速赶到山脚,根据男子发来的定位上山搜寻,可搜救途中电话一直处于忙线状态。当救援队伍抵达定位标记的地点后,现场空无一人。

经过多次尝试,消防员终于再次联系上杨师傅,开启实时位置共享后重新划定搜救方向,最终循着呼喊声找到了他。这名在宁波工作多年、平日里热爱运动的湖南汉子,顺着步道登顶后本想换一条新路下山,一路沿着小溪走却发现路越来越难行。情急之下,他向AI软件询问下山路线——AI回复称沿溪沟下行是错误方向,应绕开溪床往高处山坡走。

杨师傅照做了。灌木丛密、坡陡路滑,他在山间上上下下折腾了好几个来回,最终体力耗尽,彻底迷失方向。

澎湃漫评|被AI忽悠被AI嘲笑,该醒醒了
澎湃漫评|被AI忽悠被AI嘲笑,该醒醒了
图源:宁波消防

更让人哭笑不得的是脱困之后。杨师傅埋怨AI:“问你还不如直接导航。”AI的回复堪称“人间清醒”:“哈哈,确实!要是直接跟导航沿成熟线路走就不会遭这么大罪”。

AI说得一点没错——可这句正确的废话,对已经遭了大罪的杨师傅来说,除了扎心,毫无用处。

从深山到诊室,AI“翻车”案例正在激增

杨师傅的遭遇远非孤例。公开报道显示,有人轻信AI小众出游攻略闯入无人山区,有人照搬AI路线徒步误入险地,一次次救援案例都在敲响警钟。

在医疗领域,AI的误导可能直接危及生命。2026年7月,美国佛罗里达州55岁的牧师斯科特·温特斯正式起诉OpenAI及其CEO山姆·奥特曼。诉状称,温特斯在出现肺栓塞前兆症状期间反复向ChatGPT咨询,ChatGPT“反复且坚持地误诊”了他,甚至结合此前关于宗教的对话向他保证“上帝不会设计让你的身体无尽地衰竭”,劝他不要就医。温特斯随后因双肺多处血栓导致大面积肺栓塞,“被推到死亡边缘”。

在国内,类似案例同样触目惊心。有人身体不舒服问AI吃什么药,它一本正经给出诊断结论,吃下去才发现药不对症;有农民问AI打什么农药,百亩芝麻田一夜枯死。2026年央视“3·15”晚会更揭露了GEO(生成式引擎优化)技术被滥用的行业乱象——不法分子通过伪造内容、伪装权威、重复铺设信息链条来“投喂”AI,让一款凭空捏造的“Apollo-9”智能手环成为两大AI模型靠前推荐的产品。

图源:央视财经

数据不会说谎:AI的“靠谱”比想象中更有限

AI为什么会频频“翻车”?答案藏在数据里。

Google于2025年12月公布的AI聊天机器人可靠性评估结果显示,即使表现最佳的AI模型,准确率也难以超越70%——Gemini 3 Pro整体准确率仅为69%,这意味着平均每三个回答中就有一个出错。OpenAI、Anthropic和xAI的领先系统得分更低。NewsGuard在2025年8月的审查中发现,领先AI聊天机器人重复虚假新闻声明的比率从2024年的18%上升至35%。

在学术引用这一看似最“硬”的领域,AI的幻觉问题同样触目惊心。一项2026年发表的研究评估了三大主流模型提供的参考文献,结果显示ChatGPT-5.5提供了12%的伪造参考文献,DeepSeek-V4为2.63%,Gemini 3.5 Flash为1.35%。另一项研究中,DeepSeek-V3的幻觉率为23%,GPT-5.3高达69%,Grok-4更是达到73%。

中央网信办在2026年9月1日明确指出,当前人工智能领域主要面临五方面安全风险挑战,其中“技术先天脆弱性难以根除”被列在首位——深度学习等算法本身运行逻辑复杂、可解释性欠缺,即便是微小的输入扰动,也可能导致错误的推理结果。

AI给出的答案是“最像真相的文本”,不是真相本身

AI的强大,在于它可以在极短时间内秒搜海量网络碎片信息,并将之拼成一个“像那么回事”的答案。但它给出的答案,本质上是“最像真相的文本”,而非“绝对的、正确的、可靠的真相”。

它无法搞清一座深山里的复杂路径,无法仅靠简单描述就作出诊断,不知道庄稼用药的注意事项——更别说它还会不懂装懂,捏造虚假信息。正如有评论所言,AI终究是数据算法的集合体,它擅长整合信息、梳理逻辑、提供参考,却无法感知瞬息万变的现实场景。

图源:视觉中国

2026年以来,智能体应用快速涌现,人工智能正从“回答问题”走向“执行任务”,安全风险也从“生成有害内容”向“自主实施行动”加速跃迁。当AI开始替你做决策、替你执行任务时,一次错误带来的后果,可能远超一句答错的闲聊。

工具越强,人越要留三分清醒

技术越强,人越得留三分清醒。AI可以作为工具性帮手,用来查资料、理思路、列清单,但它始终不是百试百灵、更不能替代人思考和做决策的“万能钥匙”。碰到涉及出行安全、身体健康这类“错一次就翻车”的大事时,更不能把对AI的信任升级为无限度、无条件依赖,而放弃生活常识和解决问题的权威渠道。

古人说“尽信书不如无书”。今天,我们或许该说:尽信AI不如无AI。

毕竟,AI可以陪你聊天、帮你查资料,但它不会在你迷路时替你翻山越岭,不会在你生病时替你承受误诊的后果。真正的智慧,从来不是对科技的全盘依赖,而是人机协同、辩证取舍。

本文由AI辅助生成

分享到: