高级研究科学家,模型评估
岗位摘要
创建雄心勃勃的新评估基准,以突破我们模型能力的极限;在高度跨职能的团队中工作,将模型反馈转化为可信赖、可重复的评估;进行研究以推进LLM评估方法的最新技术,包括训练LLM评判员;改进基于LLM的数据合成流程;以及提高评估效率
岗位职责
- 创建雄心勃勃的新评估基准,以突破我们模型能力的极限
- 在高度跨职能的团队中工作,将模型反馈转化为可信赖、可重复的评估
- 进行研究以推进LLM评估方法的最新技术,包括训练LLM评判员;改进基于LLM的数据合成流程;以及提高评估效率
- 构建可扩展且可重复使用的工具,用于深入分析模型性能
任职要求
- 热衷于快速构建原型,以展示LLM能力的边界,并已开发出衡量这些能力的资源
- 花费数十小时审查复杂数据和LLM输出,以确保高质量的数据
- 对严格衡量AI能力充满热情,并确保您的测量结果与您关心的能力实际相符
- 具备强大的软件工程技能