AI 幻觉已在应用端形成多重危机。
1. 大语言模型中 AI 幻觉现象引发关注
当前主流大语言模型的幻觉发生率呈现显著分化特征,头部商业模型已实现超低 幻觉率。根据 Vectara 基于 HHEM-2.1 模型的评估数据(截至 2025 年 4 月 29 日), 谷歌 Gemini-2.0-Flash-001 以 0.7%的幻觉率位列榜首,OpenAI、谷歌及智谱 AI 等 企业旗下共9款模型的幻觉率均低于1.5%,其中GPT-4o(1.5%)、GLM-4-9B(1.3%) 等模型在保持高事实一致性(98.5%-99.3%)的同时,平均摘要长度稳定在 60-90 词区间。这标志着通过模型架构优化和强化对齐训练,头部厂商已能在文本摘要 场景中将幻觉风险控制在工业级应用可接受范围内,已满足金融、医疗等敏感场 景的应用标准。技术突破主要源于两大创新:谷歌通过实时连接知识库验证信息真伪,OpenAI 则开发了智能检测系统自动过滤矛盾信息。测试显示,在处理复杂 文档时,顶级模型的错误率较两年前下降超过 80%,关键信息遗漏问题从 17.6% 降至 3.2%。 值得注意的是,这些成果是在严格测试条件下取得的。Vectara 评估要求 AI 必须 完整还原文档核心要素,包括事件经过、人物关系和因果关系链。即便面对需要 跨段落分析的复杂资料,顶尖系统的表现波动始终控制在 0.2%以内。这种稳定性 得益于特殊的"固定生成模式",使得 AI 在输出关键信息时几乎不会随机变动。目 前,这些先进技术已在上市公司财报解析、电子病历整理等高风险领域投入实用, 为行业树立了可靠性标杆。

2. 技术原理造成 AI 幻觉难以避免
大型语言模型的技术架构和训练方法在本质上创造了幻觉不可避免的条件。这些 模型的核心功能并非通过真正的理解来实现,而是通过复杂的模式匹配和统计预 测。当用户输入一个问题时,人工智能并不会访问一个经过验证的结构化数据库; 相反,它会根据训练期间观察到的模式,预测统计上最有可能的词语序列。这种 基本设计使得幻觉成为不可避免的漏洞。在训练过程中,这些模型会吸收大量的 文本语料库,压缩并编码词语和概念之间的统计关系,但这种压缩本质上会导致 信息丢失和不一致性。训练数据本身也带来了进一步的复杂性,它可能包含偏见、 错误、过时的信息或对某些主题的不完整表述。由于缺乏真正的理解能力,模型 无法区分训练数据中的事实与虚构,两者都会被同等内化。
此外,大型语言模型缺乏外部验证机制。它们无法对自己的输出进行事实核查, 也无法识别何时超出了自己的知识边界。推理过程本身通过其固有的随机性引入 了另一个漏洞,为错误的累积创造了机会。像过拟合这样的模型架构问题进一步 加剧了幻觉,因为系统可能过于紧密地校准到训练数据的特殊性,而不是发展出 可推广的理解能力。这些技术限制共同构成了一个闭环,使得 AI 幻觉不仅可能发生,而且不可避免。 理论研究表明,幻觉是大语言模型不可避免的局限性,而非一个暂时的技术挑战。 新加坡国立大学计算学院一项研究表明,大语言模型的幻觉是计算复杂性约束下 的必然结果:由于模型无法穷举所有可计算函数,其生成内容必然存在与真实世 界的不一致,这使得幻觉的发生在数学上是不可避免的。问题的根源在于模型处 理和生成语言的基本方式:它们通过预测词语之间的统计可能性来生成文本,而 没有发展出真正的语义理解能力。一个恰当的类比是,一个学者记住了大量的文 本,却没有真正理解其中的核心概念,也没有发展出独立验证信息的能力。这种 局限性在统计模式识别和真正的知识表示之间创造了一道无法逾越的鸿沟。这些 模型缺乏对世界的因果理解,而是通过训练数据中识别的相关性模式进行操作。 当面对需要超越这些统计模式进行推理的问题或场景时,模型别无选择,只能基 于松散的关联而非事实知识来“幻觉”出回答。这一理论局限性解释了为什么尽管 在模型规模、训练方法和对齐技术方面取得了显著进展,幻觉仍然是一个顽固的 问题。
幻觉现象源于数据、训练与推理的多维缺陷,本质是模型对事实关联与逻辑一致 性的建模不足。大型语言模型的幻觉现象核心机制来自数据、训练与推理三个阶 段。数据层面,预训练数据的质量问题,如错误信息、知识边界限制、社会偏见 等,会直接导致模型内化错误知识或过度依赖统计关联。数据中的虚假信息(如 过时事实、虚构实体)会被模型视为潜在“知识”,而长尾知识的稀疏性则限制了 模型对低频事实的准确召回。此外,多模态模型中视觉与文本数据的弱对齐(如 噪声描述、细节缺失)进一步加剧了跨模态幻觉。训练层面,模型在预训练阶段 通过自回归目标学习统计模式,但无法区分事实性关联与虚假相关性。例如,模 型可能将“美国总统”与“特朗普”高频共现的偏见固化为“知识”,而忽略拜登 作为现任总统的更新。对齐微调虽能优化指令跟随能力,但若超出预训练知识范 围,反而会因知识覆盖不足触发“自信型幻觉”。推理层面,自回归生成机制中的 局部注意力策略与随机采样放大了逻辑偏差。模型倾向于优先生成高频词汇或早 期错误假设,而非全局最优路径,导致错误累积与逻辑断层。举例来看,在复杂 推理任务中,模型可能因注意力机制忽略关键前提而生成矛盾结论。 从技术实现视角看,幻觉现象是模型表征能力与任务复杂度失衡的产物。当前主 流 Transformer 架构的注意力机制虽能捕捉局部语义关联,但对篇章级逻辑关系的 建模仍存在局限,导致生成内容易出现上下文断裂或意图误解,即 Transformer 对 长序列的注意力稀释问题导致其对细粒度事实关联的建模能力不足。例如在金融 风险分析场景中,模型可能将偶发性市场波动错误归因为系统性因素,形成因果 归因幻觉。此外,解码策略的随机性(如高温采样)放大了概率分布边缘区域的 错误选择可能,而有限的上下文窗口则限制了对长程依赖关系的捕捉能力,进一 步加剧信息缺失下的“创造性补充”行为。

DeepSeek R1 模型在推理能力上的表现令人瞩目,但却呈现出更高的幻觉率。 Vectara 公司开发了行业领先的评估框架,如 HHEM(Hallucination and Hard Error Metric),用于量化 AI 生成内容的可靠性。这些工具被用于其公开的幻觉率排行 榜,为开发者提供模型选型参考。2025 年 1 月 10 日,DeepSeek 发布了其推理模 型 Deepseek-R1。这一模型因其推理能力与 OpenAI-o1 模型相媲美而引发热议。 Vectara 通过两种方法评估 DeepSeek R1 模型生成摘要的可靠性,分别是 Vectara HHEM 2.1(专用于检测幻觉的判别模型)和 Google FACTS 框架(基于 GPT-4o、 Claude-3.5-Sonnet 和 Gemini-1.5-Pro 的综合评分)。在将 DeepSeek R1 纳入 Vectara 的幻觉率排行榜评估后的结果显示,,Deepseek-R1 的幻觉率高达 14.3%,显著高 于非推理优化的前代模型 Deepseek-V3(3.9%)。此外,R1 的 HHEM 评分均值(0.82 vs. 0.92)和标准差(0.23 vs. 0.06)均劣于 V3,表明其生成内容的一致性更低。
DeepSeek R1 模型的推理能力提升主要依赖于强化学习框架下长思维链(Chainof-Thought, CoT)数据的训练范式。具体而言,该模型采用四阶段训练流程:首 先通过收集数千条长 CoT 数据对基础模型进行监督微调,形成初始强化学习执行 者;随后通过迭代式强化学习训练增强复杂任务中的多步推理能力。这种训练策 略使模型在数学推理、编程等需要深度逻辑分析的场景中展现出接近 GPT-4-o1 的 性能,但在简单任务中呈现显著局限性——过长的思维链会引发任务复杂化偏差, 导致模型在摘要生成、事实核查等低复杂度任务中出现内容编造概率升高现象。 AI 幻觉现象源于 DeepSeek R1 训练机制的双重特性。一方面,强化学习过程中对 创造性生成的奖励倾斜使模型在文学创作等场景具备优势,但在事实性任务中易 产生过度推理;另一方面,语言一致性约束的不足导致思维链存在逻辑冗余和发 散倾向。若体验过 DeepSeek 的“深度思考(R1)”功能,不难发现,即使面对看 似简单的任务需求,模型仍会通过多维度拆解进行详尽解析。这种对基础任务的 过度延展,虽体现了深度思考能力,但同时也可能因过度发散而产生不实信息, 将简单任务复杂化,进而加剧生成内容中“重逻辑,轻事实”的 AI 幻觉现象。 Vectara 的实验数据显示,在摘要任务中,DeepSeek R1 的幻觉率相较基础模型 V3 提高 10.4 个百分比,这可能与其训练过程中未对简单任务进行特别优化的设计策 略直接相关。因此,研究建议采用任务适应性模型选择策略:在需要深度推理的 复杂场景使用 R1 模型,而在事实性要求高的场景切换至 DeepSeek V3 通用模型, 以减少幻觉现象发生,输出更稳定的结果。
3. AI 幻觉催生的风险事件频发
“80 后死亡率破 5.2%”信息广泛传播,造成恐慌式营销。2025 年 2 月,一组关 于 80 后死亡率的数据在网上引发广泛关注,号称“截至 2024 年末,80 后死亡率 突破 5.2%,相当于每 20 个 80 后中就有 1 人已经去世”,甚至提到,“80 后的死亡 率已经超过 70 后”。网络上有文章号称,这些骇人听闻的数据来自第七次全国人 口普查,是所谓的“权威数据”。 存在信源与专业性等明显漏洞,人口领域专家出场辟谣。根据央视新闻报道,长 期从事人口发展研究的中国人民大学人口与健康学院教授李婷表示,这一数据与 事实严重不符。经核查发现,大多数文章都号称该数据来自第七次全国人口普查的数据。然而第七次全国人口普查的时间是 2020 年,显然无法预测 2024 年的死 亡率。而且,人口普查数据只会公布上一年对应时期的死亡率(例如 2020 年的第 七次全国人口普查反映的是 2019 年 11 月 1 日到 2020 年 10 月 31 日的死亡率), 且并不针对特定群体,故不会有 80 后死亡率的统计结果。李婷教授还提到,专业 统计数据中关于死亡率用千分率表示,而不是百分率,故“5.2%死亡率”系错误 表达。此外,李婷教授表示,这一数据还混淆了“累计死亡比例”与“年死亡率” 的定义。死亡率数值比较小,通常只有千分之几,而“每 20 个 80 后中 1 人已离 世”描述的是累积的死亡比例。 AI 大模型训练语料偏差加剧数据污染风险。根据李婷教授溯源梳理,此错误数据 很可能是 AI 大模型在问题回答过程中出现错误导致。李婷教授在 AI 大模型中输 入了“50、60、70、80,这几代人的死亡率分别是多少”的问题,大模型显示, 根据网络信息得出了“80 后现存 2.12 亿,存活率 94.8%,死亡率 5.2%”的表述。 李婷教授解释,因为累计死亡概率等概念相对专业,是一个相对冷门的知识点, AI 模型可能由于训练语料不足,导致推算出现错误,从而导致形成"算法污染-流 量变现"的恶性循环。
AI 幻觉在法律领域近年来引发了多起职业风险事件。2023 年 2 月,美国纽约南 区联邦地区法院的“马塔诉阿维安卡公司案”(Mata v. Avianca,Inc.)中,两名律 师及其律所因提交了 ChatGPT 虚构的司法意见而受到法院制裁。2023 年 5 月,美 国科罗拉多州一名律师的动议因为引用了 ChatGPT 生成的虚假案件而被驳回。英 国《律师协会公报》(The Law Society Gazette)也在 2023 年 5 月报道了一起发生 在曼彻斯特法院的案例,法院在审理过程中发现民事诉讼当事人援引了四个虚假 案件支持其主张——这些案件均由 ChatGPT 提供。
AI 幻觉引发的专业领域应用危机在医疗行业已显现系统性风险。截止 2025 年 3 月,全国已有超过 400 家医院部署 DeepSeek 并实现场景化落地,数字背后是是医 疗行业对智能化、高效化、精准化医疗服务的迫切需求与积极探索。此外,社交 媒体平台近期有不少 DeepSeek 代替医生看病的主题报道,并一度有 AI 是否能代 替医生临床决策的讨论出现。上海某三甲医院主任医师发文称,对于非从业人士 而言,并没有甄别散在于多数正确答案中的少数错误的能力,提醒普通病人不能 轻信 AI,仍要从医生处得到最后的诊断。当前我国通过 NMPA 认证的 AI 医疗产 品主要集中在医学影像辅助诊断、慢性病管理等领域,且多数被归类为第三类医 疗器械(需严格监管的高风险产品),而 DeepSeek 等生成式 AI 尚未取得医疗器械 资质。
医疗领域 AI 幻觉现象突出表现为诊断偏差、责任归属模糊及监管滞后等核心矛 盾。据 2024 年 8 月发表在《Journal of Medicine, Surgery, and Public Health》杂志 上的一篇关于人工智能与非洲癌症治疗的研究文章表明,AI 影像系统在非洲病人 中的误诊率比欧洲整体高出 22%。上海某三甲医院放疗科医生指出,鉴于当前训 练大型 AI 模型所依赖的原始数据集及模型算法逻辑的局限性,直接依据 AI 提供 的医疗建议而绕过专业医生的审核与校对,仍存在较高的医疗风险,甚至可能引 发危及生命的严重后果。此外,政策层面呈现监管收紧态势,湖南省率先明确禁 止 AI 自动生成处方,呼应国家卫健委"AI 不得替代医师接诊"的底线原则,其本 质在于现行法律框架下 AI 无法承担医疗主体责任。
金融领域的幻觉风险引发系统性信任挑战。当前 AI 模型的预测能力高度依赖历 史数据质量与训练效果,若数据存在偏差或训练不充分,可能导致业务决策失误。 例如信贷审批场景中,若模型训练数据隐含对特定地区或人群的历史歧视,可能 错误设置更高的融资门槛;保险理赔环节若数据样本缺失合理理赔案例,可能引 发对服务公平性的舆论质疑。同时,算法"黑箱"特性使得错误决策难以追溯解释, 当客户因模型误判遭受损失时,极易升级为法律纠纷与声誉危机。