研究科学家(强化学习与协作式LLM)
岗位摘要
设计和实现新颖的多轮强化学习算法,用于训练协作式大语言模型,探索信用分配、模型鲁棒性和探索/利用策略等高级方法;开发和扩展训练基础设施,基于现有的状态化用户模拟器训练框架进行构建;通过创建新的指标、环境和评估方法来形式化“协作性”问题,以捕捉长期用户满意度和偏好对齐
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 设计和实现新颖的多轮强化学习算法,用于训练协作式大语言模型,探索信用分配、模型鲁棒性和探索/利用策略等高级方法
- 开发和扩展训练基础设施,基于现有的状态化用户模拟器训练框架进行构建
- 通过创建新的指标、环境和评估方法来形式化“协作性”问题,以捕捉长期用户满意度和偏好对齐
- 进行前沿研究,突破智能体如何从与用户、用户模拟器及其他具有不同模型行为的智能体的交互中学习的边界
- 与研究及产品团队合作,将这些能力集成到核心Gemini产品中,改进需要持续交互和用户理解的任务
任职要求
- 拥有机器学习、强化学习、自然语言处理或相关领域的博士学位
- 具备强大的数据分析和合成数据生成技能
- 拥有扎实的Python开发技能,并具有使用JAX、PyTorch或TensorFlow等深度学习框架的经验
- 具有构建和使用大规模机器学习训练系统的经验
- 在强化学习领域具有深厚的理论和实践经验(例如,策略梯度方法、基于价值的方法、基于模型的强化学习、信用分配、鲁棒性)
- 具有开发和训练大型生成模型(大语言模型)的经验
- 在顶级会议(如NeurIPS、ICML、ICLR、AAAI)上有良好的学术发表记录
- 熟悉博弈论、多智能体系统或从人类反馈中学习(RLHF/RLAIF)的研究
- 具有构建或使用(用户)模拟环境的经验
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。