返回岗位列表

阶跃星辰

强化学习与智能体研究员

地点:北京 薪资:薪资未公开 日期:2026-01-29

岗位摘要

利用强化学习方法改进智能体的规划、反思和工具使用能力,增强其在代码智能体实际场景中的可用性;探索基于人机协同的高质量数据挖掘与合成方法,以强化智能体的规划和工具利用能力;构建代码智能体的基础能力,包括规划能力、测试用例生成和代码生成能力

岗位职责

  • 利用强化学习方法改进智能体的规划、反思和工具使用能力,增强其在代码智能体实际场景中的可用性
  • 探索基于人机协同的高质量数据挖掘与合成方法,以强化智能体的规划和工具利用能力
  • 构建代码智能体的基础能力,包括规划能力、测试用例生成和代码生成能力
  • 构建多模态智能体,提升多模态大模型在RLHF(人类反馈强化学习)中的训练效果
  • 构建代码智能体的自动化评测系统和Docker环境生成
  • 基于多模态统一的CodeAgent等高价值场景智能体,应用场景不限于代码,还包括搜索、浏览器、终端、图片分析创作等工具的调用
  • 开发具备深度思考能力的智能体,实现长期与短期规划分析
  • 实现多智能体协同以完成复杂任务

任职要求

  • 具备扎实的机器学习基础和强大的编码能力,能熟练使用PyTorch
  • 熟悉Megatron等大规模训练框架
  • 在NLP(自然语言处理)、CV(计算机视觉)、RL(强化学习)等至少一个AI领域中有过深入的研究经历,或曾利用机器学习算法解决过复杂问题
  • 具备卓越的实验分析与问题解决能力
  • 拥有创新思维,能够良好沟通,并与团队成员高效协作

加分项

  • 编程竞赛经历
  • 有计算机、电子、物理、数学等专业硕博学位者优先
  • 有 ICML、ICLR、NeurIPS、ACL、CVPR 等顶级学术会议发表过有影响力研究成果的优先
  • 在 ACM/ICPC、NOI/IOI、Kaggle 等编程/AI 比赛获奖者优先
  • 主导、参与过 AI 相关的有大影响力的开源/闭源项目的优先