返回岗位列表

阶跃星辰

大模型评测工程师

地点:北京 薪资:30-60K 日期:2026-05-22

岗位摘要

跟进学术界和企业界前沿的评测基准,持续健全级SOTA模型观测榜单,如AIME、GPQA、HLE、Codeforces、SWE、MultiChallenge等;开发评测基建,联合模型训练框架共同开发评测体系,保证评测体系与开源社区和头部闭源模型可对比,具备完善的对点机制,保障评测结果的可靠性

岗位职责

  • 跟进学术界和企业界前沿的评测基准,持续健全级SOTA模型观测榜单,如AIME、GPQA、HLE、Codeforces、SWE、MultiChallenge等
  • 开发评测基建,联合模型训练框架共同开发评测体系,保证评测体系与开源社区和头部闭源模型可对比,具备完善的对点机制,保障评测结果的可靠性
  • 日常维护评测榜单,健全评测工程体系,提高评测效率
  • 发现模型迭代中在榜单中所反映的能力欠缺点,分析主流SOTA模型间在评测中体现的差异点

任职要求

  • 熟悉大模型相关研究前沿进展,了解市面主流benchmarks,具备大模型评测经验
  • 对数据有敏感度,熟知开源社区各数据渠道源,有数据处理的经验和认知
  • 具有大模型各流程或全流程的研发/客观指标评测/Agent指标评测经验、模型训练/推理框架工程经验优先
  • 具备扎实的编程基础,有优秀的工程能力,具有NOI、ACM/ICPC等编程竞赛金牌获奖者优先
  • 有一定的相关研究经历,发表过顶级会议论文者优先

福利待遇

  • 30-60K·16薪,具有竞争力的薪酬待遇
  • 硕士学历要求,1-3年经验,成长空间大
  • 参与前沿大模型评测工作,紧跟AI领域最新进展

工作地址

北京海淀区大恒科技大厦-南座中关村大恒科技大厦南座12F