高级研究工程师,模型评估
岗位摘要
开发用于衡量模型最前沿能力的评估基准、数据集和环境;进行研究以推动LLM评估方法(包括训练LLM评判器、提高评估效率以及可扩展地构建高质量数据集)的技术发展;构建可扩展的工具,用于调查和理解评估结果,供Cohere的所有技术人员、领导层及CEO使用
岗位职责
- 开发用于衡量模型最前沿能力的评估基准、数据集和环境
- 进行研究以推动LLM评估方法(包括训练LLM评判器、提高评估效率以及可扩展地构建高质量数据集)的技术发展
- 构建可扩展的工具,用于调查和理解评估结果,供Cohere的所有技术人员、领导层及CEO使用
- 向该领域最优秀的研究人员和工程师学习并与之合作
任职要求
- 热衷于突破LLM的能力极限,并曾构建高质量的评估资源(如数据集、模拟器、环境等)来衡量这些能力
- 在开发评估LLM的新方法和/或数据方面有良好记录,例如在顶级会议上发表论文、创建流行基准等
- 在围绕LLM进行构建方面拥有深厚经验,并曾构建用于分析和理解其性能的工具
- 拥有强大的软件工程技能