视觉生成大模型RLHF算法研究员
岗位摘要
研发适用于视觉生成任务的文生图基座大模型和图像编辑大模型的后训练算法RLHF,目标性能超越主流开源基座模型;设计并研发基于数据驱动的RLHF奖赏模型,涵盖美学评分、指令遵循、文字渲染及肢体优化等多个维度,以提升生成模型后训练的上限
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 研发适用于视觉生成任务的文生图基座大模型和图像编辑大模型的后训练算法RLHF,目标性能超越主流开源基座模型
- 设计并研发基于数据驱动的RLHF奖赏模型,涵盖美学评分、指令遵循、文字渲染及肢体优化等多个维度,以提升生成模型后训练的上限
- 研发RLHF强化学习算法,基于Diffusion/AR生成模型构建更高效、稳定的强化学习系统,并探索视觉生成领域的扩展规律
任职要求
- 拥有约两年视觉生成领域工作经验
- 了解自然语言/多模态大模型基本原理,并对视觉生成领域的流行算法(如GAN系列、VQ-VAE、Diffusion Model、AutoRegressive model等)有实践经验
- 具备优秀的编程能力,熟练使用PyTorch,熟悉Megatron分布式训练框架
- 有相关方向的顶会论文、知名开源项目或重要产品落地经验者优先
- 熟悉OpenRLHF、ROLL、VERL等开源RL框架者更优
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。