返回岗位列表

阶跃星辰

Agent RL算法研究员

地点:北京 薪资:60-90K 日期:2026-05-22

岗位摘要

利用强化学习方法改进智能体的规划、反思与工具调用能力;探索基于人机协同的高质量数据挖掘与合成,增强智能体规划与工具使用能力;构建多模态智能体,提升多模态大模型RLHF训练效果;构建智能体自动化评测体系

岗位职责

  • 利用强化学习方法改进智能体的规划、反思与工具调用能力
  • 探索基于人机协同的高质量数据挖掘与合成,增强智能体规划与工具使用能力
  • 构建多模态智能体,提升多模态大模型RLHF训练效果
  • 构建智能体自动化评测体系

任职要求

  • 具备扎实的机器学习基础和强悍的编码能力,熟练使用PyTorch,熟悉Megatron等大规模训练框架
  • 了解Alignment领域常用方法,包括SFT、DPO、PPO、Self-Rewarding、Self-Critic等
  • 在NLP/CV/RL等至少一个AI领域有深入研究经历,或通过机器学习算法解决过复杂问题
  • 具备卓越的实验分析与问题解决能力,有创新思维,能够良好沟通、与团队高效协作

加分项

  • 有 ICML、ICLR、NeurIPS、ACL、CVPR 等顶级学术会议发表过有影响力研究成果的优先
  • 在 ACM/ICPC、NOI/IOI、Kaggle 等编程/AI 比赛获奖者优先
  • 主导、参与过 AI 相关的有大影响力的开源/闭源项目的优先
  • 何女士 3月内活跃
  • 上海阶跃星辰智能科技 · 高级HRBP

福利待遇

  • 有ICML、ICLR、NeurIPS、ACL、CVPR等顶级学术会议发表有影响力研究成果者优先
  • ACM/ICPC、NOI/IOI、Kaggle等编程/AI比赛获奖者优先
  • 主导或参与过有重大影响力的AI开源/闭源项目者优先

工作地址

北京海淀区大恒科技大厦9楼