强化学习算法研究员(多模态方向)
岗位摘要
负责多模态强化学习算法研发,包括图文、视频、音频、音乐生成场景的偏好对齐、质量强化、时序一致性强化、物理合理性强化;研究并落地多模态RLHF、DPO、GRPO、RLAIF、奖励模型训练等对齐算法,构建适配多模态生成的自主进化训练体系
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 负责多模态强化学习算法研发,包括图文、视频、音频、音乐生成场景的偏好对齐、质量强化、时序一致性强化、物理合理性强化
- 研究并落地多模态RLHF、DPO、GRPO、RLAIF、奖励模型训练等对齐算法,构建适配多模态生成的自主进化训练体系
- 针对视频生成、音频生成、可控生成场景,设计多维度奖励函数(画质、时序稳定、物理规则、韵律、语义匹配),解决生成模型抖动、失真、逻辑错乱、时序不一致等核心问题
- 搭建多模态强化学习训练、评测、迭代闭环,负责数据集筛选、偏好样本构建、奖励模型迭代、强化训练调优与效果验证
- 跟进世界模型、物理AI、生成式强化学习前沿,输出创新算法、顶会成果与技术专利,推动团队技术壁垒建设
- 与视觉、音频、基座大模型团队协同,完成多模态生成模型的工业化强化落地与版本迭代
任职要求
- 硕士及以上学历,计算机、人工智能、自动化、统计数学等相关专业,扎实的强化学习与深度学习理论基础
- 熟悉大模型对齐与强化学习体系,掌握RLHF、DPO、IPO、GRPO、PRM等主流LLM/多模态对齐算法
- 具备多模态场景强化学习实战经验,有视频生成、图像生成、音频/音乐生成、多模态对齐任意方向落地经历优先
- 熟悉扩散模型、Transformer多模态架构,理解时序建模、视觉/音频表征、多模态语义匹配机制
- 具备奖励模型设计、多模态偏好建模、强化训练稳定性调优实战经验,能独立完成算法迭代与ablation验证
- 熟练使用PyTorch,熟悉大规模模型训练、分布式训练、模型微调与推理优化
- 有NeurIPS/ICML/ICLR/CVPR等顶会论文、开源项目、工业级模型落地经验者优先
福利待遇
- 薪资范围100-200K
- 工作地点北京东城区明阳国际中心B座
- 经验不限,硕士学历即可
- 有机会参与前沿多模态强化学习研究
- 与视觉、音频、基座大模型团队协同工作
- 可输出创新算法、顶会成果与技术专利
工作地址
北京东城区明阳国际中心B座
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。