强化学习训练框架实习生
岗位摘要
参与大规模强化学习训练框架的设计与开发,支持千亿参数级模型的Post-training阶段;深入分析训练与推理过程中的性能瓶颈,针对计算、显存和通信进行优化,提升训练吞吐量和资源利用率
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 参与大规模强化学习训练框架的设计与开发,支持千亿参数级模型的Post-training阶段
- 深入分析训练与推理过程中的性能瓶颈,针对计算、显存和通信进行优化,提升训练吞吐量和资源利用率
- 负责将高性能推理引擎集成到RL训练循环,优化数据生成效率
- 在多机多卡环境下,实施和改进各类并行策略(3D并行、FSDP、Sequence Parallelism等),确保训练的稳定性与扩展性
任职要求
- 计算机科学、人工智能或相关专业本科及以上在读,具备扎实的Python/C++编程能力和良好的代码风格
- 深入理解分布式训练原理,熟悉Megatron-LM、DeepSpeed等主流训练框架的源码或核心机制
- 理解并实践过大模型并行训练技术,包括但不限于数据并行(DP/FSDP)、张量并行(TP)、流水线并行(PP)及序列并行(SP)
- 熟练使用PyTorch,了解其底层运行机制(如DDP, Autograd, CUDA extension等)
- 有高性能推理框架开发/优化经验者优先,如vLLM、SGLang、TensorRT-LLM等,理解PagedAttention、Continuous Batching等技术原理
- 熟悉或使用过大模型强化学习框架者优先,如Verl、AReal、Slime、TRL或OpenRLHF,有相关代码贡献者优先
- 有CUDA/Triton编写高性能算子经验,或熟悉FlashAttention等内核优化技术者优先
- 在GitHub上有高质量开源项目贡献,或在AI/Sys顶级会议发表过相关论文者优先
福利待遇
- 实习薪资300-350元/天
- 每周工作5天,实习期6个月
- 参与前沿大模型强化学习训练系统研发
- 接触千亿参数级模型训练与高性能计算核心技术
工作地址
北京海淀区科建大厦北京市海淀区科建大厦
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。