大模型评测工程师
岗位摘要
参与大模型基模评测体系建设,主攻文本方向,建设包括但不限于code、agent、cowork等多场景评测集合,统筹全方位评测集合建设,公正正确科学地观测模型能力;主导开发自动化、可扩展、可靠的评测系统和benchmark搭建流程,提高自动评估的占比,缩短评测周期
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 参与大模型基模评测体系建设,主攻文本方向,建设包括但不限于code、agent、cowork等多场景评测集合,统筹全方位评测集合建设,公正正确科学地观测模型能力
- 主导开发自动化、可扩展、可靠的评测系统和benchmark搭建流程,提高自动评估的占比,缩短评测周期
- 针对阶段性迭代重点、行业变化,构建和动态调整评测集,持续探索模型/Agent能力边界
- 对模型/Agent能力深度分析,明确当前版本的优势与缺陷,拦截能力下限问题
- 持续追踪大模型行业发展,对重点版本模型/Agent进行横向对比评测,量化行业能力水平
任职要求
- 本科及以上学历,计算机、数学等相关专业优先
- 熟悉python、go等编程语言,有较强的工程能力
- 具有出色的分析、解决问题的能力,有自主探索解决方案的能力者
- 有模型、Agent、AI产品评测经验者优先
- 对模型评测充满兴趣,对开源benchmark数据集有研究经验者优先
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。