AI评测开发工程师
岗位摘要
参与多模态大模型评测体系建设,涵盖文本、语音、图片、视频生成等多模态模型及Agent;制定评测方案、评测指标,构建评测集,形成行业基准;开发自动化、可扩展、可靠的评测系统,提高自动评估占比,缩短评测周期
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 参与多模态大模型评测体系建设,涵盖文本、语音、图片、视频生成等多模态模型及Agent
- 制定评测方案、评测指标,构建评测集,形成行业基准
- 开发自动化、可扩展、可靠的评测系统,提高自动评估占比,缩短评测周期
- 针对阶段性迭代重点及行业变化,构建和动态调整评测集,持续探索模型及Agent能力边界
- 对模型及Agent能力进行深度分析,明确优势与缺陷,拦截能力下限问题
- 持续追踪大模型行业发展,对重点版本模型及Agent进行横向对比评测,量化行业能力水平
任职要求
- 本科及以上学历,计算机、数学等相关专业优先
- 熟悉Python、Go等编程语言,有较强的工程能力
- 具有出色的分析、解决问题的能力,有自主探索解决方案的能力
- 有模型、Agent、AI产品评测经验者优先
- 对模型评测充满兴趣,对开源benchmark数据集有研究经验者优先
- 具备Hive、PyTorch、Docker、Pandas、MySQL、Redis、Numpy、Flask等技术栈经验
福利待遇
- 薪资范围40-60K,16薪
- 工作地点位于北京海淀区蓟门壹号
工作地址
北京海淀区蓟门壹号8层
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。