返回岗位列表

面壁智能

强化学习训练框架实习生

地点:北京 薪资:300-350元/天 日期:2026-03-03

岗位摘要

参与大规模强化学习训练框架的设计与开发,支持千亿参数级模型的Post-training阶段;深入分析训练与推理过程中的性能瓶颈,针对计算、显存和通信进行优化,提升训练吞吐量和资源利用率

岗位职责

  • 参与大规模强化学习训练框架的设计与开发,支持千亿参数级模型的Post-training阶段
  • 深入分析训练与推理过程中的性能瓶颈,针对计算、显存和通信进行优化,提升训练吞吐量和资源利用率
  • 负责将高性能推理引擎集成到RL训练循环,优化数据生成效率
  • 在多机多卡环境下,实施和改进各类并行策略(3D并行、FSDP、Sequence Parallelism等),确保训练的稳定性与扩展性

任职要求

  • 计算机科学、人工智能或相关专业本科及以上在读,具备扎实的Python/C++编程能力和良好的代码风格
  • 深入理解分布式训练原理,熟悉Megatron-LM、DeepSpeed等主流训练框架的源码或核心机制
  • 理解并实践过大模型并行训练技术,包括但不限于数据并行(DP/FSDP)、张量并行(TP)、流水线并行(PP)及序列并行(SP)
  • 熟练使用PyTorch,了解其底层运行机制(如DDP, Autograd, CUDA extension等)
  • 有高性能推理框架开发/优化经验者优先,如vLLM、SGLang、TensorRT-LLM等,理解PagedAttention、Continuous Batching等技术原理
  • 熟悉或使用过大模型强化学习框架者优先,如Verl、AReal、Slime、TRL或OpenRLHF,有相关代码贡献者优先
  • 有CUDA/Triton编写高性能算子经验,或熟悉FlashAttention等内核优化技术者优先
  • 在GitHub上有高质量开源项目贡献,或在AI/Sys顶级会议发表过相关论文者优先

福利待遇

  • 实习薪资300-350元/天
  • 每周工作5天,实习期6个月
  • 参与前沿大模型强化学习训练系统研发
  • 接触千亿参数级模型训练与高性能计算核心技术

工作地址

北京海淀区科建大厦北京市海淀区科建大厦