训练性能工程师
岗位摘要
分析端到端训练运行,识别计算、通信和存储方面的性能瓶颈;优化大规模分布式模型训练的GPU利用率和吞吐量;与运行时和系统工程师合作,改进内核效率、调度和集体通信性能;实施模型图转换以提高端到端吞吐量
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 分析端到端训练运行,识别计算、通信和存储方面的性能瓶颈
- 优化大规模分布式模型训练的GPU利用率和吞吐量
- 与运行时和系统工程师合作,改进内核效率、调度和集体通信性能
- 实施模型图转换以提高端到端吞吐量
- 构建工具以监控和可视化集群的MFU、吞吐量和正常运行时间
- 与研究人员合作,确保新模型架构在预训练期间能够高效扩展
- 参与基础设施决策,以提高大型训练作业的可靠性和效率
任职要求
- 热衷于优化性能并深入系统以理解各层之间的交互
- 具备Python和C++的扎实编程技能(熟悉Rust或CUDA者优先)
- 具有在多GPU系统或HPC集群上运行分布式训练作业的经验
- 享受调试复杂的分布式系统并严格测量效率
- 接触过PyTorch、JAX或TensorFlow等框架,并了解大规模训练的工作原理
福利待遇
- 混合工作模式(每周三天在办公室)
- 为新员工提供搬迁援助
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。