大模型评测算法工程师
岗位摘要
设计、搭建并维护可扩展的模型评测基准与平台;对文本模型、多模态模型以及相关应用场景的效果进行定量分析与评测;基于评测数据精准定位模型瓶颈,提出切实可行的改进建议;实现评测工具与流程的自动化,打造业内领先的评测标准与方法论
岗位职责
- 设计、搭建并维护可扩展的模型评测基准与平台
- 对文本模型、多模态模型以及相关应用场景的效果进行定量分析与评测
- 基于评测数据精准定位模型瓶颈,提出切实可行的改进建议
- 实现评测工具与流程的自动化,打造业内领先的评测标准与方法论
任职要求
- 计算机、人工智能或相关专业本科及以上学历
- 扎实的机器学习/深度学习基础,熟悉自然语言处理或多模态相关任务
- 熟练掌握OpenCompass、VLMEvalKit等评测框架,熟悉代码、Agent相关评测(如SWE-Bench、GAIA等)
- 有模型训练、评测框架搭建或大模型应用落地的实践经验
- 具备优秀的数据分析能力和严谨的系统性思维,对技术趋势有敏锐度
- 在顶级会议(NeurIPS、ACL、CVPR等)发表过相关论文者优先
福利待遇
- 薪资35-65K,15薪
- 工作地点位于北京海淀区科建大厦
工作地址
北京海淀区科建大厦4层