高级研究科学家,模型评估
岗位摘要
创建雄心勃勃的新评估基准,以突破我们模型能力的极限;在高度跨职能的团队中工作,将模型反馈转化为可信赖、可重复的评估;进行研究以推进LLM评估方法的最新技术,包括训练LLM评判员;改进基于LLM的数据合成流程;以及提高评估效率
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 创建雄心勃勃的新评估基准,以突破我们模型能力的极限
- 在高度跨职能的团队中工作,将模型反馈转化为可信赖、可重复的评估
- 进行研究以推进LLM评估方法的最新技术,包括训练LLM评判员;改进基于LLM的数据合成流程;以及提高评估效率
- 构建可扩展且可重复使用的工具,用于深入分析模型性能
任职要求
- 热衷于快速构建原型,以展示LLM能力的边界,并已开发出衡量这些能力的资源
- 花费数十小时审查复杂数据和LLM输出,以确保高质量的数据
- 对严格衡量AI能力充满热情,并确保您的测量结果与您关心的能力实际相符
- 具备强大的软件工程技能
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。