返回岗位列表

阶跃星辰

大模型评测工程师

地点:北京 薪资:薪资未公开 日期:2026-07-20

岗位摘要

跟进学术界和企业界前沿的评测基准,持续健全世界级SOTA模型的观测榜单,例如AIME、GPQA、HLE、Codeforces、SWE、MultiChallenge、BrowseComp、Tau-Bench、Aider、MMMU、MathVista等

岗位职责

  • 跟进学术界和企业界前沿的评测基准,持续健全世界级SOTA模型的观测榜单,例如AIME、GPQA、HLE、Codeforces、SWE、MultiChallenge、BrowseComp、Tau-Bench、Aider、MMMU、MathVista等
  • 开发评测基建,联合模型训练框架共同开发评测体系,确保与开源社区和头部闭源模型可对比,具备完善的对点机制,保障评测结果的可靠性
  • 日常维护评测榜单,健全评测工程体系,提高评测效率
  • 发现模型迭代中在榜单中所反映的能力欠缺问题,分析主流SOTA模型间在评测中体现的差异点

任职要求

  • 熟悉大模型相关研究前沿进展,了解市面主流benchmarks,具备大模型评测经验
  • 对数据有一定敏感度,熟知开源社区各数据渠道源,有数据处理的经验和认知
  • 具有大模型各流程或全流程的研发、客观指标评测或Agent指标评测经验,有模型训练或推理框架工程经验者优先
  • 具备扎实的编程基础和优秀的工程能力,有NOI、ACM/ICPC等编程竞赛金牌获奖者优先
  • 有一定的相关研究经历,发表过顶级会议论文者优先