返回岗位列表

阶跃星辰

生成式奖励模型研究员

地点:北京 薪资:薪资未公开 日期:2026-03-03

岗位摘要

探索并验证生成式奖励模型的范式选择与组合,包括成对偏好对比、基于评分标准的生成式打分及其混合校准方案;沉淀可复用的数据集构建与模型评测流程;设计并推进GenRM的强化优化方案,面向RLAIF及偏好优化场景提升奖励信号的一致性、可解释性与泛化能力

岗位职责

  • 探索并验证生成式奖励模型的范式选择与组合,包括成对偏好对比、基于评分标准的生成式打分及其混合校准方案
  • 沉淀可复用的数据集构建与模型评测流程
  • 设计并推进GenRM的强化优化方案,面向RLAIF及偏好优化场景提升奖励信号的一致性、可解释性与泛化能力
  • 实现多智能体联动迭代机制
  • 构建GenRM的鲁棒性评估体系
  • 制定并实施reward hacking缓解策略

任职要求

  • 研究方向为LLM或VLM相关领域,具有模型自动评估(LLM-as-judge)项目经验者优先
  • 深度参与过大语言模型、视觉语言模型或智能体方向的研究项目
  • 或参与过具有清晰成果展示的相关工程项目
  • 具备扎实的工程实现与代码开发能力
  • 国内外本科及以上学历在读,计算机科学、人工智能、机器学习或相关专业
  • 具备强烈的研究热情、自我驱动力和快速学习能力
  • 能够独立思考并有效解决问题