培训性能工程师
岗位摘要
分析端到端训练运行,识别计算、通信和存储中的性能瓶颈;优化大规模分布式模型训练的GPU利用率和吞吐量;与运行时和系统工程师合作,提高内核效率、调度和集体通信性能;实施模型图转换以提高端到端吞吐量
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 分析端到端训练运行,识别计算、通信和存储中的性能瓶颈
- 优化大规模分布式模型训练的GPU利用率和吞吐量
- 与运行时和系统工程师合作,提高内核效率、调度和集体通信性能
- 实施模型图转换以提高端到端吞吐量
- 构建工具以监控和可视化集群中的MFU、吞吐量和正常运行时间
- 与研究人员合作,确保新模型架构在预训练期间高效扩展
- 参与基础设施决策,提高大型训练作业的可靠性和效率
任职要求
- 热爱性能优化,深入系统了解每一层的交互
- 具备Python和C++的扎实编程技能(Rust或CUDA为加分项)
- 有在多GPU系统或HPC集群上运行分布式训练作业的经验
- 喜欢调试复杂的分布式系统并严格测量效率
- 接触过PyTorch、JAX或TensorFlow等框架,了解大规模训练循环的构建方式
- 能够跨团队协作,将原始分析数据转化为实际的工程改进
加分项
- 有在多GPU系统或HPC集群上运行分布式训练作业的经验
- 喜欢调试复杂的分布式系统并严格测量效率
- 接触过PyTorch、JAX或TensorFlow等框架,了解大规模训练循环的构建方式
福利待遇
- 提供搬迁援助
- 混合工作模式(每周三天在办公室)
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。