AI资讯 / 研究

研究 / 官方

专门测试大模型在模糊多跳问题上的答案完整性

Apple Machine Learning

苹果机器学习研究团队联合加州大学圣塔芭芭拉分校发布论文,提出DeepAmbigQA基准数据集及其自动生成流水线DeepAmbigQAGen,专门用于评估大语言模型在复杂问答场景下的答案完整性。该数据集包含3600道问题,其中一半涉及显式名称歧义消解,另一半需要多跳推理。研究动机源于一个典型难题:当被问及「电影《Heat》中哪位演员至少获得过一项奥斯卡奖」时,模型不仅需要区分同名电影,还需对大量演员逐一推理并整合证据。实验结果显示,即便是当前最先进的GPT-5,在模糊问题上的精确匹配得分仅为0.13,在非模糊问题上也只有0.21,远未达到实用水平。这一发现表明,现有问答系统在信息收集与答案完整性方面仍存在显著短板,亟需更鲁棒的解决方案。

苹果机器学习研究团队于2026年8月发布论文,正式推出DeepAmbigQA数据集与配套的自动化数据生成流水线DeepAmbigQAGen。该研究聚焦于一个长期被忽视的评估盲区:当问题同时包含名称歧义和多步推理需求时,大语言模型能否给出完整且准确的答案。研究团队认为,现有主流问答基准几乎从未将这两类挑战放在同一测试框架下进行联合评估,导致模型能力被高估。

DeepAmbigQAGen流水线的核心设计思路是将文本语料库与链接知识图谱相结合,自动生成自然语言问题,并在问题中系统性地嵌入名称歧义与多步推理要求。生成的问题具备可验证性,答案可通过知识图谱进行核查,从而保证数据集的质量与可靠性。这种将非结构化文本与结构化知识图谱融合的方式,使得生成的问题更贴近真实用户在搜索场景中的提问习惯。

最终构建的DeepAmbigQA数据集共包含3600道问题,其中约1800道涉及显式名称歧义消解,要求模型识别并区分同名实体;另外1800道则侧重多跳推理,需要模型跨多个知识节点收集并整合信息。两类问题的设计均旨在模拟真实世界中信息检索任务的复杂性,而非简单的单跳事实查询。

实验部分对多个主流大语言模型进行了系统评测,结果令人警醒。即便是目前能力最强的GPT-5,在模糊问题上的精确匹配得分也仅为0.13,在非模糊多跳问题上也只达到0.21。这意味着模型在面对需要全面枚举答案的复杂问题时,往往只能给出部分正确答案,而非完整的答案集合,答案遗漏问题相当突出。

研究团队指出,这一评测结果揭示了当前大语言模型与搜索工具集成方案的核心局限:模型擅长找到某个正确答案,但难以保证找到所有正确答案。在实际应用场景中,答案不完整往往与答案错误同样有害,尤其是在法律、医疗、学术研究等对信息完整性要求较高的领域。DeepAmbigQA的发布为社区提供了一个更严格的评估工具,有助于推动更鲁棒的问答系统研发。

要点

  • 苹果研究团队推出DeepAmbigQA,这是首个同时系统评估名称歧义消解与多跳推理能力的问答基准数据集,共含3600道问题
  • 即便是GPT-5,在模糊问题上的精确匹配得分仅为0.13,在非模糊问题上也只有0.21,表明顶尖模型的答案完整性仍严重不足
  • DeepAmbigQAGen流水线融合文本语料库与知识图谱,可自动生成自然、可验证且系统性嵌入歧义的问答任务,具备较强的可扩展性
  • 答案不完整性是当前大模型在开放域问答中的核心短板,现有基准测试对此评估不足,DeepAmbigQA填补了这一空白
查看原始来源

原始标题:DeepAmbigQA: Ambiguous Multi-hop Questions for Benchmarking LLM Answer Completeness

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。