高级研究科学家(奖励模型团队)
岗位摘要
领导关于RLHF(基于人类反馈的强化学习)的新型奖励模型架构和训练方法的研究;开发和评估基于LLM(大语言模型)的评分与评估方法,包括提高一致性和可解释性的基于量规的方法;研究检测、表征和缓解奖励黑客攻击及规范博弈的技术
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 领导关于RLHF(基于人类反馈的强化学习)的新型奖励模型架构和训练方法的研究
- 开发和评估基于LLM(大语言模型)的评分与评估方法,包括提高一致性和可解释性的基于量规的方法
- 研究检测、表征和缓解奖励黑客攻击及规范博弈的技术
- 设计实验以理解奖励模型的泛化能力、鲁棒性和失效模式
- 与微调团队合作,将研究见解转化为对生产训练流程的改进
- 为研究出版物、博客文章和内部文档做出贡献
- 指导其他研究人员,并帮助建立关于奖励建模的机构知识
任职要求
- 在奖励建模、RLHF或密切相关的机器学习领域拥有研究贡献记录
- 拥有训练和评估大语言模型奖励模型的经验
- 能够熟练设计和运行需要大量计算资源的大规模实验
- 能够有效跨越研究和工程领域工作,在保持科学严谨性的同时快速迭代
- 喜欢协作研究,并能向不同受众清晰地传达复杂想法
- 深切关注构建既能力强大又安全的人工智能系统
- 在奖励建模、偏好学习或RLHF方面发表过研究(加分项)
- 拥有LLM-as-judge(大语言模型作为评判者)方法的经验,包括校准和可靠性挑战(加分项)
- 从事过奖励黑客攻击、规范博弈或相关鲁棒性问题的工作(加分项)
- 拥有宪法AI、辩论或其他可扩展监督方法的经验(加分项)
- 为大规模生产级机器学习系统做出过贡献(加分项)
- 熟悉应用于理解奖励模型行为的可解释性技术(加分项)
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。