大模型强化学习研发实习生
岗位摘要
研究基于强化学习的Agent/Multi-Agent学习机制;提升模型在前沿全栈项目上的代码生成等Agent能力;研发更精准的Reward Model以指导模型对齐人类的价值观和需求;使模型和Agent具备长期的记忆和学习能力
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 研究基于强化学习的Agent/Multi-Agent学习机制
- 提升模型在前沿全栈项目上的代码生成等Agent能力
- 研发更精准的Reward Model以指导模型对齐人类的价值观和需求
- 使模型和Agent具备长期的记忆和学习能力
- 研究其他通往AGI/ASI的前沿技术
任职要求
- 985/211高校研究生以上学历或优秀本科生,计算机科学、人工智能、机器学习等相关专业
- 熟悉强化学习和大模型相关技术,具有相关实践和研究经验
- 有大模型+Agent相关研发经验者优先
- 有一定的相关研究经历,发表过顶级会议论文者优先,如ICLR, NeurIPS, CoRL, ICML, CVPR等
- 具备扎实的Python编程基础,有优秀的工程能力,具有ACM等编程竞赛获奖者优先
- 具备良好的团队协作能力和沟通能力
- SOTA模型或Agent框架的核心贡献者优先
- 过往有大规模生产级工程项目经验者优先
- 主导开发过被广泛使用的Agent/LLM开源项目者优先
加分项
- SOTA 模型或 Agent 框架的核心贡献者
- 过往有大规模生产级工程项目的经验
- 主导开发过被广泛使用的Agent/LLM开源项目
- 毕女士 刚刚活跃
- 月之暗面 · 月之暗面HR
福利待遇
- 实习薪资500-1000元/天
- 参与大模型前沿核心技术研发
- 与顶尖AI研究团队共事
工作地址
北京海淀区京东科技大厦13F
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。