产业 / 媒体
顶级AI模型视觉感知能力仍严重不足
Moonshot AI(Kimi背后的团队)发布了一项名为PerceptionBench的新基准测试,专门用于评估多模态大语言模型的纯视觉感知能力,将其与逻辑推理和外部知识完全剥离。测试将视觉能力拆解为十个原子子技能,所有题目仅凭观察图像即可作答,无需任何推理或背景知识。在16个前沿模型的测试中,排名最高的GPT-5.6 Sol准确率仅为59.7%,Kimi K3以58.5%紧随其后,Claude Fable 5和Gemini 3.1 Pro分别为57.2%和56.2%,没有任何模型突破60%大关。研究团队指出,许多此前被归因于「推理错误」的模型失败,实际上在图像读取阶段就已经出错,这一发现对当前多模态AI的评估方式提出了根本性挑战。
Moonshot AI研究团队推出PerceptionBench,其核心设计理念在于将视觉感知从多模态任务中单独抽离出来进行评测。现有主流基准测试往往将感知、知识和推理混合在同一任务中,导致难以判断模型究竟在哪个环节出现了问题。PerceptionBench则要求每道题目仅凭图像本身即可作答,彻底排除外部知识和逻辑推理的干扰,从而实现对纯视觉能力的精准测量。
研究团队并未预先设定分类框架,而是从真实的模型错误出发,逆向追溯每个错误在现有基准中最早失败的步骤,最终归纳出十个「技能域」:视觉关系、计数、属性识别、深度与三维感知、定位、比较、细粒度识别、上下文整合、OCR以及幻觉检测。团队分析了42个开源基准测试,发现它们在错误覆盖范围上几乎没有重叠,单一测试无法全面反映视觉感知能力的整体水平。
PerceptionBench从超过17000道经过验证的题目中筛选发布了3000道任务,其中60%来源于有据可查的模型错误,40%通过图像增强方式重新生成。这些题目表面看似简单,例如判断符号在钟面上的位置、数出红框内的花朵数量,或区分两个笔筒中哪个是灰粉色组合、哪个是带卡通图案的纯粉色——但正是这类基础任务暴露出了模型最深层的视觉缺陷。
分类层面的结果比总体排名更能说明问题。总分相近的模型在各子类别上的表现可能大相径庭。以「幻觉」检测为例,这是所有模型平均表现最差的类别:总分第一的GPT-5.6 Sol在此项仅得26.9%,而整体表现较弱的Gemini 3.5 Flash却以50.6%跻身该类别前列。这一子测试专门考察模型是否会在正确答案为「零」时凭空捏造不存在的物体。
研究团队提出了一个重要论断:多模态模型在复杂任务中的大量失败,并非源于推理能力不足,而是在第一步——正确读取图像——就已经出错。PerceptionBench通过将多步骤任务拆解为纯感知子问题,使研究者能够精确定位具体是哪项视觉能力在失效。这一发现与此前多项研究相互印证,包括WorldVQA和BabyVision基准测试均显示,前沿模型在儿童早期发育水平的基础视觉任务上,准确率远低于普通人类。
研究人员将人机差距归因于「语言化瓶颈」:视觉信息在转化为语言表征的过程中会损失大量细节,导致模型对图像的理解从根本上就存在失真。Kimi K3在本次测试中与西方竞争对手基本持平,但在进攻性网络安全和复杂数学等专项领域仍有明显差距。PerceptionBench的数据集和评测代码已在GitHub上开源,为后续研究提供了可复现的评估基础。
要点
- 所有被测前沿模型的视觉感知准确率均未突破60%,GPT-5.6 Sol以59.7%领先,但前五名之间差距不足4个百分点,整体表现高度集中。
- 「幻觉」是所有模型平均最弱的子技能,总分最高的GPT-5.6 Sol在该项仅得26.9%,说明总体排名无法反映各维度的真实能力差异。
- 研究发现许多被归类为「推理错误」的模型失败,实际上在图像读取阶段就已出错,这对现有多模态AI的评估框架提出了根本性质疑。
- 视觉信息转化为语言表征时存在「语言化瓶颈」,是导致AI视觉感知能力系统性落后于人类的深层原因之一。
- PerceptionBench已开源,其从真实错误出发构建分类体系的方法论,为多模态模型评估提供了新的参考范式。
原始标题:New benchmark confirms AI models still perform poorly at visual perception
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。