大模型分布式训练优化工程师
岗位摘要
分析和优化大模型的分布式训练链路,提升训练性能和效率;对大模型训练优化技术展开研究,并落地到自动驾驶;推进训练框架和AI平台的结合,建立先进的训练调度机制、集群算力利用率评估机制;本科及以上学历,扎实的编程基础(Python/C++)与良好的工程习惯
岗位职责
- 分析和优化大模型的分布式训练链路,提升训练性能和效率
- 对大模型训练优化技术展开研究,并落地到自动驾驶
- 推进训练框架和AI平台的结合,建立先进的训练调度机制、集群算力利用率评估机制
任职要求
- 本科及以上学历,扎实的编程基础(Python/C++)与良好的工程习惯
- 熟悉常用深度学习框架(如PyTorch,TensorFlow等)的架构设计和原理
- 有分布式训练优化(数据并行/张量并行/流水线并行)者优先
- 有CUDA开发、深度学习编译技术栈、AI开源社区贡献等任一经验者优先
- 熟悉自动驾驶感知、端到端算法者优先