返回岗位列表

Cohere

高级软件工程师

地点:美国 薪资:薪资未公开 日期:2026-01-29

岗位摘要

构建和扩展ML优化的HPC基础设施:跨多个云部署和管理基于Kubernetes的GPU/TPU超级集群,确保AI工作负载的高吞吐量和低延迟性能;优化AI/ML训练:与云提供商合作,微调基础设施以实现成本效益、可靠性和性能,利用RDMA、NCCL和高速互连等技术

岗位职责

  • 构建和扩展ML优化的HPC基础设施:跨多个云部署和管理基于Kubernetes的GPU/TPU超级集群,确保AI工作负载的高吞吐量和低延迟性能
  • 优化AI/ML训练:与云提供商合作,微调基础设施以实现成本效益、可靠性和性能,利用RDMA、NCCL和高速互连等技术
  • 排查和解决复杂问题:主动识别并解决基础设施瓶颈、性能下降和系统故障,确保对AI/ML工作流程的干扰最小
  • 为研究人员提供自助服务工具:设计直观的界面和工作流程,使研究人员能够独立监控、调试和优化其训练任务
  • 推动ML基础设施创新:与AI研究人员密切合作,了解新兴需求(例如JAX、PyTorch、分布式训练),并将其转化为稳健、可扩展的基础设施解决方案
  • 倡导最佳实践:在整个组织中倡导可观测性、自动化和基础设施即代码(IaC),确保系统可维护且具有弹性
  • 指导与协作:通过代码审查、文档编写和跨团队协作分享专业知识,培养知识传递和工程卓越的文化

任职要求

  • 具备多年在多云环境中构建和管理Kubernetes GPU/TPU超级集群的经验
  • 熟悉AI/ML训练工作负载优化技术,包括RDMA、NCCL和高速互联
  • 具有使用JAX、PyTorch等框架支持大规模分布式训练的基础设施经验
  • 精通基础设施即代码(IaC)、自动化运维和可观测性最佳实践
  • 能够参与24x7全天候值班轮换制度,及时响应和解决基础设施故障
  • 具备为AI研究人员设计开发自助服务工具和平台的能力