返回岗位列表

摩尔线程

AI算力集群网络工程师

地点:杭州 薪资:20-40K 日期:2026-03-05

岗位摘要

主导AI算力集群(GPU集群)的网络方案设计,重点优化高性能计算及分布式训练场景的网络架构;负责RoCE网络/IB网络的全栈设计与实现,包括无丢包网络的构建,确保低延迟、高吞吐;完成交换机选型、拓扑设计、配置部署(重点厂商:NVIDIA/新华三/浪潮/锐捷等)

岗位职责

  • 主导AI算力集群(GPU集群)的网络方案设计,重点优化高性能计算及分布式训练场景的网络架构
  • 负责RoCE网络/IB网络的全栈设计与实现,包括无丢包网络的构建,确保低延迟、高吞吐
  • 完成交换机选型、拓扑设计、配置部署(重点厂商:NVIDIA/新华三/浪潮/锐捷等)
  • 设计并实施网络自动化配置方案(Ansible/Python脚本等),提升大规模集群部署效率
  • 设计实施AI训练/推理场景网络性能手动/自动测试,作为产品稳定性功能的重要组件
  • 监控集群网络性能(时延、吞吐量、丢包率),针对RoCE网络进行精细化调优(PFC、ECN、DCQCN策略配置)
  • 定位并解决网络硬件故障(交换机、服务器、光模块、光纤等)
  • 定位并解决网络故障(如RDMA通信中断、拥塞风暴、路由震荡等),保障训练任务连续性
  • 优化集群通信性能,减少AllReduce等集合操作时延
  • 推动智能运维(AIOps)工具落地,实现网络异常预测与自动化根因分析
  • 与计算/存储团队协同设计端到端性能优化方案(集合通讯库、高性能存储)
  • 支持业务团队解决分布式训练中的网络瓶颈问题(如通信效率、多集群扩展)

任职要求

  • 本科及以上学历,计算机/通信/电子工程相关专业
  • 精通RoCE协议栈及无损网络技术(PFC、ECN、ETS)
  • 3年以上超大规模数据中心网络实战经验(≥1000节点)
  • 精通BGP/OSPF/EVPN/VxLAN等协议,具备跨厂商设备配置能力
  • 熟练使用网络诊断工具(Wireshark、tcpdump、perf、rdma_perf)
  • 熟悉Linux网络栈调优(TCP参数、IRQ绑定、NUMA亲和性)
  • 具备网络自动化开发能力(Python/Go/Ansible)
  • 具备高强度问题攻关能力,能快速定位复杂网络问题(如Incast拥塞、RDMA CM断开)
  • 良好的技术文档习惯,能输出架构设计、故障分析报告
  • 有NVIDIA Quantum/Spectrum交换机或InfiniBand网络运维经验者优先
  • 熟悉AI训练框架通信原理(NCCL/UCX/MPI)者优先
  • 持有CCIE/CCNP/JNCIE或同等级别认证者优先
  • 有AI/HPC/云平台(AWS/Azure/GCP)网络支持经验者优先

加分项

  • ○ 有NVIDIA Quantum/Spectrum交换机或InfiniBand网络运维经验
  • ○ 熟悉AI训练框架通信原理(NCCL/UCX/MPI)
  • ○ 持有CCIE/CCNP/JNCIE或同等级别认证

福利待遇

  • 薪资范围20-40K·16薪

工作地址

杭州滨江区医惠中心EWELLA座