模型算法实习生(强化学习/后训练方向)
岗位摘要
设计并构建良好的基准测试,用于评估模型的新能力;了解经典强化学习算法,具备在大语言模型或传统游戏等场景下成功训练强化学习的经验;熟悉VeRL、vLLM、Megatron等主流强化学习相关框架
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 设计并构建良好的基准测试,用于评估模型的新能力
- 了解经典强化学习算法,具备在大语言模型或传统游戏等场景下成功训练强化学习的经验
- 熟悉VeRL、vLLM、Megatron等主流强化学习相关框架
- 研发新的增强现有人类和合成数据的生成方法和流程,以优化数据质量
- 研发新的微调技术以及面向大模型的强化学习技术
- 研发新的测试时计算/智能体工作流技术,以提升模型在测试阶段的效果
- 研究通往通用人工智能的其他创新性技术
任职要求
- 985/211高校研究生以上学历或优秀本科生,计算机科学、人工智能、机器学习等相关专业
- 具有大模型后训练研发经验者优先
- 具备大规模强化学习系统研发经验者优先
- 具备良好提示词工程和智能体工作流构建经验者优先
- 有一定的相关研究经历,发表过顶级会议论文者优先,如ICLR、NeurIPS、CoRL、ICML、CVPR等
- 具备扎实的Python编程基础,有优秀的工程能力,具有ACM等编程竞赛获奖者优先
- 具备良好的团队协作能力和沟通能力
- 有开源项目,有系统与算法协同设计的意识和经验,能长期实习者优先
加分项
- 有开源项目,有system&algorithm的co
- design意识和经验,能长期实习
- 宋女士 本周活跃
工作地址
北京海淀区京东科技大厦13F
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。