模型训练与推理基础设施开发工程师
岗位摘要
设计和实现支持大规模分布式训练的计算平台,优化模型训练效率和资源利用率;维护和扩展现有的分布式训练框架,确保平台的高性能和稳定性(如基于 PyTorch、TensorFlow 或 JAX)
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 设计和实现支持大规模分布式训练的计算平台,优化模型训练效率和资源利用率
- 维护和扩展现有的分布式训练框架,确保平台的高性能和稳定性(如基于 PyTorch、TensorFlow 或 JAX)
- 集成和优化高性能计算技术(如 CUDA、MPI、NCCL 等)
- 构建高效的推理框架,支持大模型的在线和离线推理需求
- 优化推理速度、内存占用和能耗,支持多种硬件架构(GPU、NPU等)
- 实现PD分离、Context Caching、模型量化、推敲编码等推理优化技术
- 开发工具链和监控系统,跟踪训练与推理过程的性能瓶颈
- 分析并优化数据加载、通信效率和硬件利用率等关键环节
- 与模型研究团队密切合作,理解模型需求,定制训练和推理策略
- 支持产品团队的模型部署需求,推动大模型在实际场景中的落地应用
任职要求
- 计算机科学、软件工程、机器学习或相关领域的本科及以上学历,硕士或博士优先
- 深入理解深度学习原理和分布式训练框架(如 Horovod、DeepSpeed、Ray 等)
- 熟练掌握至少一种主流深度学习框架(如 PyTorch、TensorFlow 或 JAX)
- 熟悉高性能计算技术(CUDA、NCCL、cuDNN 等)及硬件架构(GPU、NPU 等)
- 具有扎实的编程能力,精通 Python 和至少一种系统级编程语言(如 C++)
- 有参与或主导过大规模模型(如 Transformer、大语言模型)的训练和部署经验者优先
- 熟悉模型优化技术(如混合精度训练、剪枝、量化等)者优先
- 对云计算和容器化技术(如 Kubernetes、Docker、Terraform)有实际经验者优先
- 对新兴 AI 硬件(如 H卡)有实操经验者优先
- 具备优秀的系统设计和性能调优能力者优先
加分项
- 有参与或主导过大规模模型(如 Transformer、大语言模型)的训练和部署经验
- 熟悉模型优化技术(如混合精度训练、剪枝、量化等)
- 对云计算和容器化技术(如 Kubernetes、Docker、Terraform)有实际经验
- 对新兴 AI 硬件(如 H卡)有实操经验
- 具备优秀的系统设计和性能调优能力
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。