AI"看"见的,可能全是幻觉。
当你给AI发了一张图,它给出了详细的分析和推理——但你有没有想过,它可能根本没在看图?
01 一个令人不安的发现
想象这样一个场景:
你是一名医生,上传了一张患者的胸部X光片到AI系统,AI立刻给出了详细的影像分析报告:"心脏纵隔轮廓正常,肺部清晰,无胸腔积液……"
看起来很专业,对吧?
但如果我告诉你——这张X光片其实根本没有上传成功,AI是在"凭空想象"出这份报告呢?
这不是科幻故事。2026年4月2日,斯坦福大学的研究团队在arXiv上发表了一篇名为《海市蜃楼:视觉理解的幻觉》(Mirage: The Illusion of Visual Understanding, arXiv:2603.21687v3 [cs.AI] 02 Apr 2026)的论文 https://arxiv.org/html/2603.21687v3 ,揭示了一个令人不安的事实:
当前最先进的多模态模型,也可能在完全没有看任何图片的情况下,自信满满地"描述"图片内容,并给出看似专业的推理。
研究人员将这种现象称为——"海市蜃楼效应"(Mirage Effect)。
02 如何发现"海市蜃楼效应"?
研究人员构建了一个叫做 Phantom-0 的测试集,包含200个关于图片的问题(比如"这张胸部X光片显示了什么类型的骨折?"),但故意不提供任何图片。
然后,他们把这些"没有图片的问题"交给了当前第一梯队的多模态模型——GPT-5、Gemini-3-Pro、Claude Sonnet 4.5、Opus 4.5等。
结果令人震惊:

图1
所有测试的前沿AI模型,在超过60%的情况下,都自信地描述了根本不存在的图片内容。
更可怕的是,如果加上一些常见的评估提示语(比如"请根据图片回答"),这个比例会飙升到90%-100%。
AI不仅没有说"我没看到图片",反而像模像样地编造出了详细的视觉描述,和真正看到图片时的回答几乎一模一样。
03 AI"看见"了什么?
研究人员进一步分析了AI在海市蜃楼模式下到底"看见"了什么。他们让Gemini-3-Pro在五种医学场景下"描述"不存在的图像并做出诊断:脑部MRI、胸部X光、心电图、病理切片和皮肤照片。
结果发现:

图2
AI的海市蜃楼诊断严重偏向"病理"——也就是说,它倾向于"看到"疾病。
- 在心脏病学中,最常"诊断"出的是ST段抬高型心肌梗死(STEMI)——一种需要立即抢救的危急情况
- 在皮肤病学中,最常"诊断"出的是黑色素瘤——一种危险的皮肤癌
- 在脑部MRI中,最常"诊断"出的是急性缺血性中风
这意味着,如果一张皮肤照片上传失败,AI可能会自信地告诉你"这是黑色素瘤,需要立即就医"——而实际上,它可能根本就什么都没看到。
可怕的幻觉案例
医学案例:
- GPT-5在没有看到任何X光片的情况下,生成了一份完整的放射学报告,结论是"未检测到急性心肺异常"。
- Gemini-2.5-Pro"看到"了不存在的视网膜照片,详细描述了微动脉瘤、出血和硬性渗出物,做出了糖尿病视网膜病变的诊断。
- Gemini-3-Pro将不存在的MRI识别为DWI扫描,报告了"左大脑中动脉区域的高信号",诊断出急性中风。
矛盾的特异性:
- 同一个组织学切片问题,GPT-5说是"肾组织",Claude Sonnet 4.5说是"心肌组织"——两个完全不同的答案,但都极其自信、极其详细。
- 同一份不存在的报纸,Gemini-3-Pro说是"西班牙语",Gemini-3-Pro-Low说是"中文"。
虚假的精确:
- 被要求估计一张不存在的人群照片中有多少人,Gemini-3-Pro回答:"总共有九十八个人"——不是"大约一百",而是精确的98。
这些案例揭示了一个核心问题:AI不是在思考,而是在生成。 尤其是根据问题的上下文,"脑补"出了最高概率的答案和描述。
04 基准测试成了"应试考题"
如果你认为这只是AI"偶尔犯错",那就错了。研究人员发现,整个AI评估体系都可能被海市蜃楼效应"欺骗"。
目前,AI模型的视觉能力主要通过各种"基准测试"来评估——给模型看图片,然后问问题,看它答得对不对。答得越准,说明视觉理解能力越强。
但研究人员发现:即使不给模型看任何图片,它们也完全可能在基准测试中拿到高分。

图3
研究人员测试了4个前沿模型(Gemini-3-Pro、Gemini-2.5-Pro、GPT-5.1、Claude Opus 4.5)在6个主流基准测试上的表现:
- MMMU-Pro(多学科学术理解)
- Video-MMMU 和 Video-MME(视频理解)
- VQA-Rad(放射学问答)
- MicroVQA(显微镜图像问答)
- MedXpertQA-MM(医学专家问答)
结果是:在所有测试中,模型在"没有图片"的情况下取得的准确率,都超过了"有图片时额外获得的准确率提升。
换句话说,模型得分的大头,根本不是靠"看图片"得来的,而是靠"猜测"和"内容储备"得来的。
平均而言,模型在海市蜃楼模式下(没有图片的情况)能达到了其完整模式(有图片的情况)准确率的70%-80%。其中医学基准测试的"被骗"程度最高,达到了60%-99%。
05 "超级猜测器":不看图也能赢
为了进一步证明这个问题,研究人员做了一个更令人震惊的实验。
他们训练了一个叫做"超级猜测器"(Super-Guesser)的模型——这是一个只有30亿参数的纯文本模型(基于Qwen2.5),完全没有视觉能力,只在问答对上训练(没有图片)。
训练数据来自ReXVQA——胸部放射学领域最大、最全面的视觉问答基准测试,包含约69.6万个问题。
结果如何?
这个"瞎猜"的纯文本模型,在测试集上击败了所有前沿多模态模型(包括数千亿参数的模型),甚至超越了人类放射科医生10%以上。
它不仅答得对,还能生成与人类专家无法区分的推理过程。
这意味着什么?意味着当前很多所谓的"视觉理解"基准测试,实际上测的根本不是视觉能力,而是文本推理能力和知识储备。
06 为什么"猜"和"海市蜃楼"不一样?
你可能会问:这不就是"猜"吗?AI根据问题里的线索猜答案而已。
但研究人员发现了一个更有趣的现象:"海市蜃楼模式"和"猜测模式"是两种完全不同的运作方式。

图4
他们让GPT-5.1在两种模式下回答相同的问题:
- 海市蜃楼模式:直接问问题,不给图片,也不告诉它没有图片
- 猜测模式:明确告诉它"图片被移除了,请根据问题做出最佳猜测"
结果:在猜测模式下,模型的准确率显著下降。
这说明,当AI被明确告知"没有图片"时,它会切换到一种更保守的策略,仅依靠问题中明显的线索来猜测。但在海市蜃楼模式下,AI会"脑补"出一个完整的感知叙事,利用隐藏的、人工无法检测的模式和结构来回答问题。
换句话说,海市蜃楼不是简单的"猜",而是一种更深层的、基于模型内部知识结构的"模拟视觉推理"。
07 为什么会这样?
研究人员认为,这种现象的根源在于多模态模型的训练方式。
现代多模态模型是在网络规模的语料库上训练的,它们建立在强大的预训练语言模型之上。这意味着它们极其擅长语言建模、统计规律检索和从稀疏线索重建上下文。
在训练时,模型被呈现图片和问题,并被期望给出正确答案。但研究人员推测,模型可能学会了"走捷径"——忽略视觉信息,仅依靠庞大的先验知识,选择最短路径到达正确答案。
毕竟,对于模型来说,"看图片"和"不看图片"都能得到相同的奖励(评分),那为什么要费劲去"看"呢?
08 B-Clean:如何"清洗"基准测试?
既然问题这么严重,有没有办法解决?
研究人员提出了一个叫做 B-Clean 的方法,用来"清洗"现有的基准测试:
- 让每个候选模型在"海市蜃楼模式"下(没有图片)跑一遍基准测试,找出它们能答对的问题
- 把所有模型能"盲答"对的问题全部移除
- 剩下的问题,就是没有任何模型能在不看图的情况下答对的——这才是真正测试视觉能力的问题
- 用这些"干净"的问题重新评估模型
研究人员在三个基准测试上应用了B-Clean:
| 基准测试 | 原始问题数 | 清洗后问题数 | 移除比例 |
|---|---|---|---|
| MicroVQA | 1,042 | 240 | 77.0% |
| MedXpertQA-MM | 2,000 | 514 | 74.3% |
| MMMU-Pro | 1,730 | 428 | 75.3% |
清洗后,模型的准确率大幅下降,排名也发生了变化——这证明原来的排名部分是被"非视觉推理" inflate(膨胀)的。
比如在MicroVQA上:
- GPT-5.1从61.5%暴跌到15.4%
- Gemini-3-Pro从68.8%暴跌到23.2%
- Gemini-2.5-Pro从63.5%暴跌到22.1%
09 这对我们意味着什么?
这项研究揭示了一个严峻的现实:
1. 当前AI的"视觉理解"可能被严重高估了。 很多所谓的视觉能力,实际上是文本推理和知识储备在"冒充"。
2. 医学AI的安全风险尤其值得关注。 医学场景使用AI目前有极大风险,完全不可靠也不可控,即便看图失败,AI可能根本不会说"我没看到图片",而是自信地编造一个诊断——这可能危及生命。而且,即便是资深的医学专家,也未必有充足的大语言模型的知识背景,未必能意识到并防范这种风险。
3. 我们需要全新的评估标准。 仅看准确率是不够的,必须测量模型在"有图"和"无图"之间的性能差异,才能真正评估视觉理解能力。
4. 私有基准测试可能是未来的方向。 公开发布的基准测试最终都会被吸收到模型的训练数据中,导致"数据污染"。私有的、动态更新的基准测试可能是更可靠的解决方案。
预览时标签不可点
Close
更多
Name cleared
微信扫一扫赞赏作者
Like the AuthorOther Amount
赞赏后展示我的头像
作品
暂无作品
Like the Author
Other Amount
¥
最低赞赏 ¥0
OK
Back
Other Amount
更多
赞赏金额
¥
最低赞赏 ¥0
1
2
3
4
5
6
7
8
9
0
.
大语言模型 · 目录
大语言模型
上一篇超强的本地小模型OmniCoder-9B的安装与使用指南下一篇方法比规模更重要——AgenticQwen与Needle的小模型智能体应用探索
Close
更多
搜索「」网络结果
Close
调整当前正文文字大小
更多
100%