AI资讯 / 研究

研究 / 官方

自动发现视觉模型在实例级任务中的系统性失败模式

Apple Machine Learning

视觉模型在语义连贯子集上的系统性失败被称为「错误切片」,是评估模型鲁棒性的重要线索。然而现有切片发现方法主要针对图像级分类任务,对目标检测和实例分割等任务中由上下文关系和空间位置引发的失败模式束手无策。苹果机器学习研究团队在ECCV 2026上发表论文,提出GH-ESD(基于接地假设驱动的错误切片发现)框架,将切片发现重新定义为假设生成与统计验证的联合过程。该框架借助大语言模型生成关系型失败假设,通过视觉语言模型在实例级别定位切片,再经统计趋势分析加以验证。团队同步发布了专用基准数据集GESD,在检测任务上Precision@10达到0.73,较基线提升0.10,为实例级视觉模型评估提供了新的方法论参考。

视觉模型在实际部署中往往会在某些特定场景下集中出错,这类系统性失败模式被研究者称为「错误切片」。识别这些切片对于理解模型局限性、指导针对性改进至关重要。然而,现有方法大多将切片建模为表示空间中的聚类或预定义属性的组合,这种方式在图像级分类任务中尚可奏效,却难以捕捉目标检测和实例分割中更为复杂的失败原因。

苹果研究团队提出的GH-ESD框架采用「生成-验证」的两阶段范式。第一阶段,框架利用大语言模型的先验知识,结合视觉接地证据,自动生成描述模型可能失败场景的关系型假设,例如「小目标被遮挡时检测率下降」或「密集排列物体导致分割边界混淆」等具有语义可解释性的假设条件。

第二阶段,GH-ESD通过视觉语言模型在实例级别对上述假设进行空间定位,将抽象假设映射到具体图像区域和目标实例上,形成可操作的切片集合。随后,框架对这些切片内的实例级错误进行统计趋势分析,筛选出具有统计显著性的真实失败模式,从而避免将随机噪声误判为系统性问题。

为支撑该方向的研究,团队同步构建并发布了GESD(接地错误切片数据集)基准,这是首个专为实例级错误切片发现设计的评估基准。GESD包含由领域专家定义、具备空间接地标注的切片,涵盖检测和分割两类任务的失败场景,为后续方法的横向比较提供了统一标准。

实验结果显示,GH-ESD在GESD基准的检测任务上Precision@10达到0.73,相比基线方法的0.63提升了0.10,同时在分割场景中也展现出良好的泛化能力。更重要的是,该框架发现的错误切片具有清晰的语义可解释性,能够直接指导数据增强策略或模型结构调整,将评估结果转化为可落地的改进行动。

GH-ESD的提出标志着视觉模型评估方法论的一次重要演进——从被动统计整体指标,转向主动挖掘结构性失败根因。随着目标检测和实例分割模型在自动驾驶、医疗影像等高风险领域的广泛应用,这类能够系统性定位模型薄弱环节的工具将在模型审计和安全评估中发挥越来越关键的作用。

要点

  • GH-ESD将错误切片发现重新定义为假设生成与统计验证的联合流程,突破了现有方法仅适用于图像级分类的局限
  • 框架结合大语言模型与视觉语言模型,实现了从语义假设到空间实例的端到端错误定位,发现的切片具有可解释性
  • 配套发布的GESD基准填补了实例级错误切片评估领域的空白,为目标检测和分割任务提供了专用评测标准
  • 在GESD检测任务上Precision@10达0.73,较基线提升0.10,验证了假设驱动范式在实例级任务中的有效性
  • 该方法产出的错误切片可直接指导数据增强和模型改进,将评估环节与迭代优化形成闭环
查看原始来源

原始标题:GH-ESD: Grounded Hypothesis-Driven Error Slice Discovery for Instance-Level Vision Tasks

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。