生成式奖励模型研究员
岗位摘要
探索并验证生成式奖励模型的范式选择与组合,包括成对偏好对比、基于评分标准的生成式打分及其混合校准方案;沉淀可复用的数据集构建与模型评测流程;设计并推进GenRM的强化优化方案,面向RLAIF及偏好优化场景提升奖励信号的一致性、可解释性与泛化能力
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 探索并验证生成式奖励模型的范式选择与组合,包括成对偏好对比、基于评分标准的生成式打分及其混合校准方案
- 沉淀可复用的数据集构建与模型评测流程
- 设计并推进GenRM的强化优化方案,面向RLAIF及偏好优化场景提升奖励信号的一致性、可解释性与泛化能力
- 实现多智能体联动迭代机制
- 构建GenRM的鲁棒性评估体系
- 制定并实施reward hacking缓解策略
任职要求
- 研究方向为LLM或VLM相关领域,具有模型自动评估(LLM-as-judge)项目经验者优先
- 深度参与过大语言模型、视觉语言模型或智能体方向的研究项目
- 或参与过具有清晰成果展示的相关工程项目
- 具备扎实的工程实现与代码开发能力
- 国内外本科及以上学历在读,计算机科学、人工智能、机器学习或相关专业
- 具备强烈的研究热情、自我驱动力和快速学习能力
- 能够独立思考并有效解决问题
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。