返回岗位列表

昆仑万维

强化学习算法研究员(多模态方向)

地点:北京 薪资:100-200K 日期:2026-06-26

岗位摘要

负责多模态强化学习算法研发,包括图文、视频、音频、音乐生成场景的偏好对齐、质量强化、时序一致性强化、物理合理性强化;研究并落地多模态RLHF、DPO、GRPO、RLAIF、奖励模型训练等对齐算法,构建适配多模态生成的自主进化训练体系

岗位职责

  • 负责多模态强化学习算法研发,包括图文、视频、音频、音乐生成场景的偏好对齐、质量强化、时序一致性强化、物理合理性强化
  • 研究并落地多模态RLHF、DPO、GRPO、RLAIF、奖励模型训练等对齐算法,构建适配多模态生成的自主进化训练体系
  • 针对视频生成、音频生成、可控生成场景,设计多维度奖励函数(画质、时序稳定、物理规则、韵律、语义匹配),解决生成模型抖动、失真、逻辑错乱、时序不一致等核心问题
  • 搭建多模态强化学习训练、评测、迭代闭环,负责数据集筛选、偏好样本构建、奖励模型迭代、强化训练调优与效果验证
  • 跟进世界模型、物理AI、生成式强化学习前沿,输出创新算法、顶会成果与技术专利,推动团队技术壁垒建设
  • 与视觉、音频、基座大模型团队协同,完成多模态生成模型的工业化强化落地与版本迭代

任职要求

  • 硕士及以上学历,计算机、人工智能、自动化、统计数学等相关专业,扎实的强化学习与深度学习理论基础
  • 熟悉大模型对齐与强化学习体系,掌握RLHF、DPO、IPO、GRPO、PRM等主流LLM/多模态对齐算法
  • 具备多模态场景强化学习实战经验,有视频生成、图像生成、音频/音乐生成、多模态对齐任意方向落地经历优先
  • 熟悉扩散模型、Transformer多模态架构,理解时序建模、视觉/音频表征、多模态语义匹配机制
  • 具备奖励模型设计、多模态偏好建模、强化训练稳定性调优实战经验,能独立完成算法迭代与ablation验证
  • 熟练使用PyTorch,熟悉大规模模型训练、分布式训练、模型微调与推理优化
  • 有NeurIPS/ICML/ICLR/CVPR等顶会论文、开源项目、工业级模型落地经验者优先

福利待遇

  • 薪资范围100-200K
  • 工作地点北京东城区明阳国际中心B座
  • 经验不限,硕士学历即可
  • 有机会参与前沿多模态强化学习研究
  • 与视觉、音频、基座大模型团队协同工作
  • 可输出创新算法、顶会成果与技术专利

工作地址

北京东城区明阳国际中心B座