大模型训推系统工程师(RL方向)
岗位摘要
基础训练/推理引擎构建、精度保障、效率优化;低精度训推效率优化、训推一致性建设;大规模RL框架设计/优化,面向下一代长程任务进行深度优化;稳定性建设,提升大规模训练过程中的容错定位及恢复效率
岗位职责
- 基础训练/推理引擎构建、精度保障、效率优化
- 低精度训推效率优化、训推一致性建设
- 大规模RL框架设计/优化,面向下一代长程任务进行深度优化
- 稳定性建设,提升大规模训练过程中的容错定位及恢复效率
- 算法/工程co-design,共同优化系统易用性、提升算法效果
- 提升系统可观测性,支持细粒度指标建设、生命周期追溯管理
任职要求
- 熟悉PyTorch分布式训练/推理原理,熟悉Megatron/FSDP、vLLM/SGLang者优先
- 熟悉PPO原理及各变种RL算法,熟悉verl、slime等框架者优先
- 熟悉性能分析、问题排查相关工具,具备独立定位解决复杂问题的能力
- 熟悉AI Coding,有使用或建设代码助手、自动化研发工具、Coding Agent的经验
福利待遇
- 薪资范围:50-70K·16薪
- 工作地点:北京海淀区大恒科技大厦南楼
- 团队氛围活跃,与行业顶尖人才共事
工作地址
北京海淀区大恒科技大厦南楼