返回岗位列表

Anthropic

高级研究科学家(奖励模型团队)

地点:远程 薪资:$350,000-$500,000 日期:2026-01-29

岗位摘要

领导关于RLHF(基于人类反馈的强化学习)的新型奖励模型架构和训练方法的研究;开发和评估基于LLM(大语言模型)的评分与评估方法,包括提高一致性和可解释性的基于量规的方法;研究检测、表征和缓解奖励黑客攻击及规范博弈的技术

岗位职责

  • 领导关于RLHF(基于人类反馈的强化学习)的新型奖励模型架构和训练方法的研究
  • 开发和评估基于LLM(大语言模型)的评分与评估方法,包括提高一致性和可解释性的基于量规的方法
  • 研究检测、表征和缓解奖励黑客攻击及规范博弈的技术
  • 设计实验以理解奖励模型的泛化能力、鲁棒性和失效模式
  • 与微调团队合作,将研究见解转化为对生产训练流程的改进
  • 为研究出版物、博客文章和内部文档做出贡献
  • 指导其他研究人员,并帮助建立关于奖励建模的机构知识

任职要求

  • 在奖励建模、RLHF或密切相关的机器学习领域拥有研究贡献记录
  • 拥有训练和评估大语言模型奖励模型的经验
  • 能够熟练设计和运行需要大量计算资源的大规模实验
  • 能够有效跨越研究和工程领域工作,在保持科学严谨性的同时快速迭代
  • 喜欢协作研究,并能向不同受众清晰地传达复杂想法
  • 深切关注构建既能力强大又安全的人工智能系统
  • 在奖励建模、偏好学习或RLHF方面发表过研究(加分项)
  • 拥有LLM-as-judge(大语言模型作为评判者)方法的经验,包括校准和可靠性挑战(加分项)
  • 从事过奖励黑客攻击、规范博弈或相关鲁棒性问题的工作(加分项)
  • 拥有宪法AI、辩论或其他可扩展监督方法的经验(加分项)
  • 为大规模生产级机器学习系统做出过贡献(加分项)
  • 熟悉应用于理解奖励模型行为的可解释性技术(加分项)