强化学习训练基础设施实习生
岗位摘要
参与强化学习训练基础设施建设,支持大规模RL/LLM RL训练任务的高效、稳定运行;负责训练系统关键模块开发与优化,包括任务调度、分布式训练、样本采集、经验回放、日志监控、容错恢复、资源利用率优化等
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 参与强化学习训练基础设施建设,支持大规模RL/LLM RL训练任务的高效、稳定运行
- 负责训练系统关键模块开发与优化,包括任务调度、分布式训练、样本采集、经验回放、日志监控、容错恢复、资源利用率优化等
- 参与训练数据流与计算链路设计,打通Actor、Rollout、Reward、Learner等核心模块,提升训练吞吐、稳定性与可观测性
- 参与GPU集群训练问题定位与性能优化,包括显存利用、通信效率、吞吐瓶颈、长尾任务、故障恢复等
- 建设和维护RL训练平台相关工具链,包括实验管理、配置管理、监控告警、评测回归、结果复现等基础能力
- 与算法团队协作,支持PPO、DPO、GRPO等训练范式在大规模环境下的工程化落地
任职要求
- 计算机、软件工程、人工智能等相关专业本科及以上学历
- 扎实的系统与工程基础,熟悉Linux开发环境,具备良好的代码能力和工程习惯
- 熟练掌握Python,至少熟悉一种系统级语言或高性能语言,如C++、Go、Rust
- 熟悉分布式训练或分布式系统基本原理,了解多机多卡、并行训练、通信机制、任务调度等相关知识
- 熟悉PyTorch训练流程,理解模型训练中的性能瓶颈与常见优化手段
- 具备较强的问题定位与性能分析能力,能够基于日志、监控、Profile等手段分析系统问题
- 有良好的协作与沟通能力,能够与算法、平台、工程团队高效配合
加分项
- 有 RL 训练系统、分布式训练框架或大模型训练平台相关经验
- 熟悉 Ray、DeepSpeed、Megatron、NCCL、vLLM、Kubernetes、Slurm 等相关技术栈
- 有 GPU 性能优化、通信优化、异步流水线、任务编排等实践经验
- 有大规模训练平台、在线实验平台、监控告警体系建设经验
- 理解 RL 训练基本流程,了解 rollout、reward、advantage、policy update 等关键概念
- 我们希望你具备的特质
- 对训练系统、基础设施和性能优化有浓厚兴趣
- 对工程质量、系统稳定性和可扩展性有较高
福利待遇
- 接触最前沿的大模型与强化学习训练技术
- 参与大规模GPU集群训练系统的建设与优化
- 与优秀算法团队深度协作,积累工业界实战经验
- 有转正机会,表现优秀者可获得正式offer
工作地址
北京海淀区科建大厦
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。