返回岗位列表

阶跃星辰

视觉生成大模型RLHF算法研究员

地点:北京 薪资:薪资未公开 日期:2026-01-29

岗位摘要

研发适用于视觉生成任务的文生图基座大模型和图像编辑大模型后训练算法RLHF,目标超越主流开源基座模型;以数据驱动的方式,设计并研发涵盖美学评分、指令遵循、文字渲染及肢体优化等多个维度的RLHF奖赏模型

岗位职责

  • 研发适用于视觉生成任务的文生图基座大模型和图像编辑大模型后训练算法RLHF,目标超越主流开源基座模型
  • 以数据驱动的方式,设计并研发涵盖美学评分、指令遵循、文字渲染及肢体优化等多个维度的RLHF奖赏模型
  • 基于Diffusion/AR生成模型过程,构建更高效和稳定的强化学习系统
  • 探索RLHF在视觉生成领域的扩展规律

任职要求

  • 拥有两年左右视觉生成领域工作经验
  • 了解自然语言/多模态大模型基本原理,对视觉生成领域流行算法(如GAN系列、VQ-VAE、Diffusion Model、AutoRegressive model等)有实践经验
  • 具备优秀的编程能力,熟练使用PyTorch,熟悉Megatron分布式训练框架
  • 熟悉AIGC应用数据准备的全流程,包括数据采集、清洗、标注,并对合成高质量训练数据有深入理解
  • 拥有强烈的责任心、良好的团队合作能力和跨团队沟通能力
  • 有相关方向顶会论文、知名开源项目或重要产品落地经验者优先
  • 熟悉OpenRLHF、ROLL、VERL等开源RL框架者更优