Agent RL 算法研究员(实习)
岗位摘要
负责Agent RL算法迭代,结合强化学习环境构建具备记忆、反思、规划、自进化及工具调用能力的类人智能体;研究Multi-Agent系统中多个智能体如何高效协作,以完成超越单个智能体能力范围的复杂任务
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 负责Agent RL算法迭代,结合强化学习环境构建具备记忆、反思、规划、自进化及工具调用能力的类人智能体
- 研究Multi-Agent系统中多个智能体如何高效协作,以完成超越单个智能体能力范围的复杂任务
- 开发Omni-LLM-based Agent,实现文本、语音、图像等多模态融合的智能体系统
- 探索World Model,研究AI系统如何构建自身与外部世界的认知与期望模型
- 深入理解数据需求,推动人机协同的数据迭代流程,实现从人工到半自动化再到自动化的转变
任职要求
- 国内外高校研究生在读,具备良好的计算机或数学基础,拥有较强的编码能力
- 具有LLM(大语言模型)、强化学习、推理模型等相关背景,熟悉主流大语言模型的算法架构
- 了解Alignment领域的常用方法,包括但不限于SFT、DPO、PPO、Self-Rewarding和Self-Critic等
- 具备卓越的实验分析与问题解决能力,拥有创新思维,能够进行良好的沟通并与团队成员高效协作
- 一周实习三天以上,实习时间3个月以上
- 具备深度学习、机器学习的基础知识,熟悉有监督学习、自监督学习等基本训练范式者优先
- 在大语言模型方面有开源项目经验者优先,或曾通过机器学习算法解决过复杂问题,特别欢迎跨界研究者
- 在ACM/ICPC、NOI/IOI、Kaggle等编程/AI比赛获奖者优先
- 在ICML、ICLR、NeurIPS、ACL、CVPR等顶级学术会议发表过有影响力研究成果的优先
加分项
- 深度学习基础:具备深度学习、机器学习的基础知识,熟悉有监督学习、自监督学习等基本训练范式
- 项目经验:在大语言模型方面有开源项目经验者优先,或曾通过机器学习算法解决过复杂问题
- 特别欢迎跨界研究者
- 竞赛奖项:在 ACM/ICPC、NOI/IOI、Kaggle 等编程/AI 比赛获奖者优先
- 学术成果: ICML、ICLR、NeurIPS、ACL、CVPR 等顶级学术会议发表过有影响力研究成果的优先
- 高淳 刚刚活跃
- 上海阶跃星辰智能科技 · 校招HR
福利待遇
- 实习薪资300-500元/天
工作地址
北京海淀区大恒科技大厦南座12F
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。