大模型评测研究员
岗位摘要
定义下一代评测范式:设计并建立一套能系统性地衡量大模型在开放、真实、复杂场景下真实能力的评测体系,涵盖Agent、Tool Use、Code、Search等领域;科学地探索并定义模型的认知边界
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 定义下一代评测范式:设计并建立一套能系统性地衡量大模型在开放、真实、复杂场景下真实能力的评测体系,涵盖Agent、Tool Use、Code、Search等领域
- 科学地探索并定义模型的认知边界
- 构建严谨、高效的评测数据体系:将对模型能力的理解转化为科学、严谨的数据设计与标注规范
- 构建自动化评测数据合成算法,为整个评测体系提供高质量的数据基石
- 进行评测算法研究:研究实现高效、精准的模型性能归因分析算法
- 准确定位模型的薄弱区间
任职要求
- 具备定义系统性评测体系的能力,特别是在开放、真实、复杂场景下
- 能够将对模型能力的理解转化为科学、严谨的数据设计与标注规范
- 具备构建自动化评测数据合成算法的能力
- 具备研究高效、精准的模型性能归因分析算法的能力
- 能够准确定位模型的薄弱环节
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。