AI资讯 / Agent

Agent / 官方

面向复杂跨领域任务的开源大模型评测套件

inclusionAI GitHub

inclusionAI 在 GitHub 上开源了 ABench,这是一套专为严格评测大语言模型(LLM)而设计的跨领域基准测试套件。与通用评测集不同,ABench 聚焦于当前模型表现薄弱的高难度专业领域,涵盖物理学、精算科学、逻辑推理、法律、心理学和历史研究六个方向,每个领域均配备经过专业设计的高区分度题目。目前六大数据集已全部发布,其中历史方向的 ProHist-Bench 基于中国历史学科考试构建,包含 400 道核心题目、10891 条由历史学家撰写的评分细则,并从 9 个能力维度进行评估。ABench 的核心目标是填补现有评测空白、建立统一的多领域比较标准,并通过持续引入创新性难题推动模型知识体系与推理机制的优化。项目采用 Apache-2.0 协议开源,当前已获得 28 个 Star。

ABench 是 inclusionAI 团队推出的一套持续演进的开源基准测试套件,专门用于评测大语言模型在复杂跨领域任务上的表现。该项目的核心出发点在于:现有主流评测集往往难以有效区分顶尖模型之间的能力差异,而 ABench 通过针对模型薄弱环节设计高区分度题目,力图更精准地揭示模型的真实能力上限。

在领域覆盖方面,ABench 目前已发布六个专业数据集。物理方向包含 500 道大学及竞赛级别题目,涵盖从经典力学到现代物理的 10 余个子领域,其中 100 道为动态参数变体题,可有效防止模型通过记忆答案作弊。精算方向则精选自专业精算师考试,覆盖概率统计、金融数学、寿险与非寿险、精算模型及风险管理等核心主题。

逻辑推理数据集汇聚了来自 LSAT、GMAT、GRE、SBI 及中国国家公务员考试等权威测试的高区分度题目,旨在全面考察模型的形式推理与批判性思维能力。心理学数据集则通过案例研究与研究性问题(含客观题与主观题)评估模型对人类行为及心理学理论的理解深度。法律数据集来源于权威司法考试材料,覆盖刑法、民法、行政法、程序法及国际法等核心法律领域。

历史方向的 ProHist-Bench 是 ABench 中设计最为精细的子集之一。该数据集以中国历史学科考试为基础构建,核心版本包含 400 道题目,分为 4 种任务类型,并附有 10891 条由专业历史学家撰写的评分细则,从 9 个能力维度对模型输出进行多粒度评估。此外还提供包含 504 道题目的扩展版本,以满足更大规模的评测需求。

ABench 的三大核心目标清晰定位了其在 LLM 评测生态中的价值:一是填补评测空白,针对现有基准集中表现不佳的题型设计高区分度任务;二是建立统一标准,为多领域 LLM 评测提供可靠、可比较的基准参照;三是拓展能力边界,通过持续引入具有挑战性的创新题目,驱动模型知识体系与推理机制的持续优化。项目采用 Apache-2.0 协议开源,欢迎社区贡献与扩展。

要点

  • ABench 覆盖物理、精算、逻辑、法律、心理学、历史六大专业领域,六个数据集均已全部开源发布。
  • 物理数据集引入动态参数变体题,有效规避模型通过记忆答案获得虚高分数的问题。
  • 历史子集 ProHist-Bench 配备 10891 条专家级评分细则,从 9 个维度对模型输出进行精细化评估。
  • 项目定位于填补现有评测集的区分度不足问题,为顶尖模型之间的横向比较提供更可靠的参照标准。
  • ABench 采用 Apache-2.0 协议开源,支持社区持续扩展新领域与新题型。
查看原始来源

原始标题:inclusionAI/ABench — ABench is an evolving open-source benchmark suite designed to rigorously evaluate and enhance Large Language Models (LLMs) on complex cross-domain tasks.

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。