返回岗位列表

面壁智能

强化学习训练基础设施实习生

地点:北京 薪资:300-350元/天 日期:2026-05-08

岗位摘要

参与强化学习训练基础设施建设,支持大规模RL/LLM RL训练任务的高效、稳定运行;负责训练系统关键模块开发与优化,包括任务调度、分布式训练、样本采集、经验回放、日志监控、容错恢复、资源利用率优化等

岗位职责

  • 参与强化学习训练基础设施建设,支持大规模RL/LLM RL训练任务的高效、稳定运行
  • 负责训练系统关键模块开发与优化,包括任务调度、分布式训练、样本采集、经验回放、日志监控、容错恢复、资源利用率优化等
  • 参与训练数据流与计算链路设计,打通Actor、Rollout、Reward、Learner等核心模块,提升训练吞吐、稳定性与可观测性
  • 参与GPU集群训练问题定位与性能优化,包括显存利用、通信效率、吞吐瓶颈、长尾任务、故障恢复等
  • 建设和维护RL训练平台相关工具链,包括实验管理、配置管理、监控告警、评测回归、结果复现等基础能力
  • 与算法团队协作,支持PPO、DPO、GRPO等训练范式在大规模环境下的工程化落地

任职要求

  • 计算机、软件工程、人工智能等相关专业本科及以上学历
  • 扎实的系统与工程基础,熟悉Linux开发环境,具备良好的代码能力和工程习惯
  • 熟练掌握Python,至少熟悉一种系统级语言或高性能语言,如C++、Go、Rust
  • 熟悉分布式训练或分布式系统基本原理,了解多机多卡、并行训练、通信机制、任务调度等相关知识
  • 熟悉PyTorch训练流程,理解模型训练中的性能瓶颈与常见优化手段
  • 具备较强的问题定位与性能分析能力,能够基于日志、监控、Profile等手段分析系统问题
  • 有良好的协作与沟通能力,能够与算法、平台、工程团队高效配合

加分项

  • 有 RL 训练系统、分布式训练框架或大模型训练平台相关经验
  • 熟悉 Ray、DeepSpeed、Megatron、NCCL、vLLM、Kubernetes、Slurm 等相关技术栈
  • 有 GPU 性能优化、通信优化、异步流水线、任务编排等实践经验
  • 有大规模训练平台、在线实验平台、监控告警体系建设经验
  • 理解 RL 训练基本流程,了解 rollout、reward、advantage、policy update 等关键概念
  • 我们希望你具备的特质
  • 对训练系统、基础设施和性能优化有浓厚兴趣
  • 对工程质量、系统稳定性和可扩展性有较高

福利待遇

  • 接触最前沿的大模型与强化学习训练技术
  • 参与大规模GPU集群训练系统的建设与优化
  • 与优秀算法团队深度协作,积累工业界实战经验
  • 有转正机会,表现优秀者可获得正式offer

工作地址

北京海淀区科建大厦