高级软件工程师
岗位摘要
构建和扩展ML优化的HPC基础设施:跨多个云部署和管理基于Kubernetes的GPU/TPU超级集群,确保AI工作负载的高吞吐量和低延迟性能;优化AI/ML训练:与云提供商合作,微调基础设施以实现成本效益、可靠性和性能,利用RDMA、NCCL和高速互连等技术
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 构建和扩展ML优化的HPC基础设施:跨多个云部署和管理基于Kubernetes的GPU/TPU超级集群,确保AI工作负载的高吞吐量和低延迟性能
- 优化AI/ML训练:与云提供商合作,微调基础设施以实现成本效益、可靠性和性能,利用RDMA、NCCL和高速互连等技术
- 排查和解决复杂问题:主动识别并解决基础设施瓶颈、性能下降和系统故障,确保对AI/ML工作流程的干扰最小
- 为研究人员提供自助服务工具:设计直观的界面和工作流程,使研究人员能够独立监控、调试和优化其训练任务
- 推动ML基础设施创新:与AI研究人员密切合作,了解新兴需求(例如JAX、PyTorch、分布式训练),并将其转化为稳健、可扩展的基础设施解决方案
- 倡导最佳实践:在整个组织中倡导可观测性、自动化和基础设施即代码(IaC),确保系统可维护且具有弹性
- 指导与协作:通过代码审查、文档编写和跨团队协作分享专业知识,培养知识传递和工程卓越的文化
任职要求
- 具备多年在多云环境中构建和管理Kubernetes GPU/TPU超级集群的经验
- 熟悉AI/ML训练工作负载优化技术,包括RDMA、NCCL和高速互联
- 具有使用JAX、PyTorch等框架支持大规模分布式训练的基础设施经验
- 精通基础设施即代码(IaC)、自动化运维和可观测性最佳实践
- 能够参与24x7全天候值班轮换制度,及时响应和解决基础设施故障
- 具备为AI研究人员设计开发自助服务工具和平台的能力
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。