大模型评测/数据算法工程师
岗位摘要
跟进学术和业界前沿的评测基准,持续维护SOTA模型观测榜单(如OpenAI、Anthropic等发布的模型主要在AIME、GPQA、Codeforces等榜单上的表现);保证建设的评测体系与开源社区和头部闭源模型可对比,具备完善的对点机制,保障评测结果的可靠性
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 跟进学术和业界前沿的评测基准,持续维护SOTA模型观测榜单(如OpenAI、Anthropic等发布的模型主要在AIME、GPQA、Codeforces等榜单上的表现)
- 保证建设的评测体系与开源社区和头部闭源模型可对比,具备完善的对点机制,保障评测结果的可靠性
- 日常维护评测榜单,健全评测工程体系,提高评测效率
- 发现模型迭代中在榜单所反映的能力欠缺问题,分析主流SOTA模型在评测中的差异点
- 发表算法相关优秀论文
任职要求
- 熟悉大模型相关研究前沿进展,了解市面主流benchmarks,具备大模型评测经验
- 对数据有较高敏感度,熟知开源社区各数据渠道源,有数据处理的经验和认知
- 具有大模型后训练研发经验或模型训练/推理框架工程经验者优先
- 具备扎实的编程基础,有优秀的工程能力,具有NOI、ACM/ICPC等编程竞赛金牌获奖者优先
- 有一定的相关研究经历,发表过顶级会议论文者优先
- 具备基础的团队协作能力和沟通能力,做事极致、自驱
福利待遇
- 具有竞争力的薪酬待遇(40-60K·16薪)
- 参与前沿大模型评测体系建设,与行业顶尖模型对标
- 浓厚的学术与技术氛围,鼓励发表顶级会议论文
- 专业培训与导师指导,助力职业快速成长
- 开放创新、自驱的工作环境,扁平化管理
- 丰富的团队协作与跨领域学习机会
工作地址
北京海淀区大恒科技大厦9楼
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。