大模型训练框架工程师(训练框架&RL方向)
岗位摘要
参与顶尖大模型的训练系统建设,负责从集群调度、通信优化、并行策略到RL训练流水线的完整系统工程;在训练框架方向解决万卡集群上的训练效率与稳定性问题;参与或负责MiniMax自研强化学习训练系统Forge,建设RL训练流水线并提升其技术影响力
岗位职责
- 参与顶尖大模型的训练系统建设,负责从集群调度、通信优化、并行策略到RL训练流水线的完整系统工程
- 在训练框架方向解决万卡集群上的训练效率与稳定性问题
- 参与或负责MiniMax自研强化学习训练系统Forge,建设RL训练流水线并提升其技术影响力
- 与算法团队从架构设计阶段开始协作,而非在方案确定后仅做实现
- 深入排查基础设施瓶颈,提出方案并推动落地,提升模型能力上限
任职要求
- 编程能力扎实,具备清晰的系统设计思路,有强烈的工程品味和责任心
- 对AI训练系统或RL工程某一方向有深入理解,能独立发现问题、提出方案并推动落地
- 主动追踪算法与系统前沿,能将论文洞见转化为工程判断
- 在分布式系统、GPU性能优化、RL工程或推理加速等至少一个领域有真正深度
- 对算法前沿保持真实好奇心,清楚自身知识边界并愿意持续学习
- 本科及以上学历,经验不限
- 加分项:对PyTorch、Megatron-LM、SGLang等主流开源框架有深入了解并有实质性贡献
- 加分项:有万卡规模训练系统或大规模RLHF/RLVR工程实战经验
加分项
- 对主流开源框架(PyTorch、Megatron
- LM、SGLang 等)有深入了解,并有实质性贡献
- 有万卡规模训练系统或大规模 RLHF/RLVR 工程的实战经验
- 崔女士 刚刚活跃
福利待遇
- 薪酬结构为16薪
工作地址
北京海淀区蓟门壹号8f