强化学习训练框架工程师
岗位摘要
负责强化学习训练框架的研发、优化和维护,根据业务需求持续改进训练框架和策略,提升模型训练效率;分析和定位训练中的性能瓶颈,实施针对性优化措施,提升训练效率和稳定性;跟进业界技术进展,不断同步与集成最新训练优化策略
岗位职责
- 负责强化学习训练框架的研发、优化和维护,根据业务需求持续改进训练框架和策略,提升模型训练效率
- 分析和定位训练中的性能瓶颈,实施针对性优化措施,提升训练效率和稳定性
- 跟进业界技术进展,不断同步与集成最新训练优化策略
任职要求
- 对自然语言处理、计算机视觉和多模态算法有深入理解,熟悉主流的LLM模型架构,有分布式训练经验
- 对常见RL训练算法有基本了解
- 熟悉vLLM或SGLang等常用开源推理框架的优先考虑
福利待遇
- 薪资45-75K·16薪
- 参与Slime开源项目开发,与SGLang团队合作探索前沿技术
- 聚焦大规模MoE模型RL训练策略研究
- 支持完整的后训练工作流,打通预训练到生产的全链路
工作地址
北京海淀区搜狐网络大厦清华科技园搜狐网络大厦11层