Agent RL算法研究员
岗位摘要
利用强化学习方法改进智能体的规划、反思及工具使用能力;探索基于人机协同的高质量数据挖掘与合成,增强智能体规划和工具调用能力;构建多模态智能体,提升多模态大模型RLHF训练效果;建立智能体自动化评测体系
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 利用强化学习方法改进智能体的规划、反思及工具使用能力
- 探索基于人机协同的高质量数据挖掘与合成,增强智能体规划和工具调用能力
- 构建多模态智能体,提升多模态大模型RLHF训练效果
- 建立智能体自动化评测体系
- 在实际场景中构建基于多模态统一的CodeAgent、DeepResearch等高价值场景智能体
- 开发专精整合搜索、浏览器、终端、图片分析创作等工具调用的智能体系统
- 实现具备长短期规划与分析能力的深度思考智能体
- 通过multi-agent协同完成复杂任务
任职要求
- 了解Alignment领域常用方法,包括但不限于SFT、DPO、PPO、RFT、Self-Rewarding和Self-Critic等
- 具备扎实的机器学习基础和强悍的编码能力,能熟练使用PyTorch
- 熟悉Megatron等大规模训练框架
- 在NLP/CV/RL等至少一个AI领域有深入研究经历,或通过机器学习算法解决过复杂问题
- 具备卓越的实验分析与问题解决能力
- 具有创新思维,能够良好沟通并与团队成员高效协作
- 计算机、电子、物理、数学等专业硕博学位优先
- 有ICML、ICLR、NeurIPS、ACL、CVPR等顶级学术会议发表过有影响力研究成果优先
- 在ACM/ICPC、NOI/IOI、Kaggle等编程/AI比赛获奖者优先
- 主导或参与过AI相关有大影响力的开源/闭源项目优先
加分项
- 有计算机、电子、物理、数学等专业硕博学位者优先
- 有 ICML、ICLR、NeurIPS、ACL、CVPR 等顶级学术会议发表过有影响力研究成果的优先
- 在 ACM/ICPC、NOI/IOI、Kaggle 等编程/AI 比赛获奖者优先
- 主导、参与过 AI 相关的有大影响力的开源/闭源项目的优先
- 张女士 刚刚活跃
福利待遇
- 月薪60-90K,16薪制
- 工作地点位于北京海淀区核心科技区域
工作地址
北京海淀区大恒科技大厦12F
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。