大模型评测算法工程师
岗位摘要
设计、搭建并维护可扩展的模型评测基准与平台;对文本模型、多模态模型以及相关应用场景的效果进行定量分析与评测;基于评测数据精准定位模型瓶颈,提出切实可行的改进建议;实现评测工具与流程的自动化,打造业内领先的评测标准与方法论
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 设计、搭建并维护可扩展的模型评测基准与平台
- 对文本模型、多模态模型以及相关应用场景的效果进行定量分析与评测
- 基于评测数据精准定位模型瓶颈,提出切实可行的改进建议
- 实现评测工具与流程的自动化,打造业内领先的评测标准与方法论
任职要求
- 计算机、人工智能或相关专业本科及以上学历
- 扎实的机器学习/深度学习基础,熟悉自然语言处理或多模态相关任务
- 熟练掌握OpenCompass、VLMEvalKit等评测框架,熟悉代码、Agent相关评测(如SWE-Bench、GAIA等)
- 有模型训练、评测框架搭建或大模型应用落地的实践经验
- 具备优秀的数据分析能力和严谨的系统性思维,对技术趋势有敏锐度
- 在顶级会议(NeurIPS、ACL、CVPR等)发表过相关论文
工作地址
北京海淀区科建大厦4层
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。