研究科学家/工程师 - 后训练前沿模型
岗位摘要
前沿方法开发:为无‘教师’模型的前沿模型设计和验证新颖的后训练流程(如SFT、RLHF、RLAIF);推进奖励建模:领导下一代奖励模型的研究,包括探索新架构、减少奖励攻击以及提升偏好数据中的信噪比
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 前沿方法开发:为无‘教师’模型的前沿模型设计和验证新颖的后训练流程(如SFT、RLHF、RLAIF)
- 推进奖励建模:领导下一代奖励模型的研究,包括探索新架构、减少奖励攻击以及提升偏好数据中的信噪比
- 解锁‘思考’能力:创新方法以改进模型的内部推理(思维链),专注于多步骤任务中的正确性、逻辑性和自我纠正
- 革新强化学习范式:批判性地重新评估和优化强化学习提示与反馈机制,以从基础模型中提取最大性能
- 解决‘飞轮’挑战:创建稳健的机制,将用户信号和互动转化为训练数据,使模型持续改进而不引入回归或偏见
- 横向影响:跨团队协作,将这些先进方法应用于不同模型规模和模态(如音频),确保一致的高质量行为
任职要求
- 拥有机器学习、人工智能或计算机科学博士学位(或具备同等实践经验)
- 在大型语言模型、强化学习或偏好学习方面有深厚背景
- 对将人工智能系统与人类反馈和效用对齐有研究兴趣
- 熟悉实验设计和大规模用户数据分析
- 具备强化学习人类反馈或直接偏好优化经验者优先
- 具备构建或改进奖励模型经验者优先
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。