返回岗位列表

阶跃星辰

Code Agent 研究员

地点:北京 薪资:30-60K 日期:2026-05-22

岗位摘要

利用强化学习方法改进智能体的规划、反思及工具使用能力,提升 Code Agent 在实际场景中的可用性;探索基于人机协同的高质量数据挖掘与合成,增强智能体的规划和工具调用能力;构建 Code Agent 基础能力,包括规划能力、测例生成及代码生成能力

岗位职责

  • 利用强化学习方法改进智能体的规划、反思及工具使用能力,提升 Code Agent 在实际场景中的可用性
  • 探索基于人机协同的高质量数据挖掘与合成,增强智能体的规划和工具调用能力
  • 构建 Code Agent 基础能力,包括规划能力、测例生成及代码生成能力
  • 构建多模态智能体,提升多模态大模型 RLHF 训练效果
  • 构建 Code Agent 智能体自动化评测体系及 Docker 环境生成方案
  • 基于多模态统一架构,构建 CodeAgent 等高价值场景智能体,覆盖搜索、浏览器、Terminal、图片分析创作等多工具调用场景
  • 实现长短期规划分析与 Multi-Agent 协同,完成复杂任务

任职要求

  • 了解 Alignment 领域常用方法,包括 SFT、DPO、PPO、RFT、Self-Rewarding、Self-Critic 等
  • 具备扎实的机器学习基础和强悍的编码能力,熟练使用 PyTorch,熟悉 Megatron 等大规模训练框架
  • 在 NLP/CV/RL 等至少一个 AI 领域有深入研究经历,或通过机器学习算法解决过复杂问题,跨界研究者优先
  • 具备卓越的实验分析与问题解决能力,有创新思维,能够良好沟通并与团队高效协作
  • 计算机、数学、统计等相关专业背景

加分项

  • 有编程竞赛经历、软件工程背景经验者优先
  • 有计算机、电子、物理、数学等专业硕博学位者优先
  • 有 ICML、ICLR、NeurIPS、ACL、CVPR 等顶级学术会议发表过有影响力研究成果的优先
  • 在 ACM/ICPC、NOI/IOI、Kaggle 等编程/AI 比赛获奖者优先
  • 主导、参与过 AI 相关的有大影响力的开源/闭源项目的优先

福利待遇

  • 参与前沿 AI 研究,有机会在顶级学术会议发表有影响力成果
  • 接触大规模模型训练与 Code Agent 全栈技术研发
  • 与高水平研究团队协作,跨界探索多模态智能体前沿方向
  • 有竞争力的薪酬体系(30-60K)及清晰的职业发展路径

工作地址

北京海淀区大恒科技大厦-南座中关村大恒科技大厦南座12F