大模型后训练系统工程师
岗位摘要
构建基础训练/推理引擎,保障精度并优化效率;优化低精度训练/推理效率,确保训练与推理一致性;设计/优化大规模强化学习框架,面向下一代长程任务进行深度优化;加强稳定性建设,提升大规模训练中的容错定位与恢复效率
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 构建基础训练/推理引擎,保障精度并优化效率
- 优化低精度训练/推理效率,确保训练与推理一致性
- 设计/优化大规模强化学习框架,面向下一代长程任务进行深度优化
- 加强稳定性建设,提升大规模训练中的容错定位与恢复效率
- 进行算法与工程协同设计,共同优化系统易用性和算法效果
- 提升系统可观测性,支持细粒度指标建设和生命周期追溯管理
任职要求
- 熟悉PyTorch分布式训练/推理原理,熟悉Megatron/FSDP、vLLM/Sglang者优先
- 熟悉PPO原理及各变种强化学习算法,熟悉verl、slime等框架者优先
- 熟悉性能分析和问题排查工具,具备独立定位和解决复杂问题的能力
- 熟悉AI编程,有使用或建设代码助手、自动化研发工具、Coding Agent的经验
福利待遇
- 参与前沿大模型技术研发
- 与顶尖算法和工程团队合作
- 提供具有竞争力的薪酬和职业发展机会
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。