返回岗位列表

摩尔线程

AI集群网络解决方案与服务工程师

地点:深圳 薪资:30-60K 日期:2026-05-08

岗位摘要

负责AI算力集群网络方案设计与实施交付,包括GPU训练网络架构设计(RoCE/IB/100G/200G/400G)、管理网络/存储网络/训练网络规划及ToR/Spine架构设计;负责AI集群网络环境部署与调试,包括交换机配置与上线、VLAN/VXLAN/BGP/ECMP配置及RDMA/RoCE网络…

岗位职责

  • 负责AI算力集群网络方案设计与实施交付,包括GPU训练网络架构设计(RoCE/IB/100G/200G/400G)、管理网络/存储网络/训练网络规划及ToR/Spine架构设计
  • 负责AI集群网络环境部署与调试,包括交换机配置与上线、VLAN/VXLAN/BGP/ECMP配置及RDMA/RoCE网络调优
  • 负责AI训练网络性能优化,包括NCCL网络性能优化、RDMA通信调优及GPU集群网络瓶颈定位
  • 参与IDC机房交付实施,负责网络拓扑设计、设备上架与布线方案及连线表编制
  • 负责客户现场问题技术支持,包括AI训练网络故障定位、网络性能问题排查及复杂交付问题攻坚
  • 配合AI算力平台部署,完成Kubernetes/容器网络调试及GPU调度网络问题定位

任职要求

  • 本科及以上学历,计算机、网络工程、通信工程等相关专业
  • 3-5年相关工作经验,具备IDC数据中心网络、HPC集群网络或AI算力集群网络经验之一
  • 熟悉数据中心网络架构(Spine-Leaf、ECMP)及网络协议(TCP/IP、BGP、OSPF、VXLAN)
  • 熟悉高速网络技术,包括RoCE、RDMA,了解InfiniBand
  • 熟悉Mellanox、H3C、Huawei、Arista等主流交换机设备
  • 了解NCCL、分布式训练网络、GPU通信网络及Deep Learning集群架构
  • 熟悉Linux系统(Ubuntu/CentOS),具备Shell、Python或Go脚本编写能力
  • 熟悉iperf、ibstat、ibdev2netdev、tcpdump等网络诊断工具者优先

福利待遇

  • 具有竞争力的薪酬体系:30-60K·16薪
  • 加入摩尔线程,参与国产AI芯片与算力平台建设
  • 接触前沿AI集群网络技术,职业发展前景广阔
  • 工作地点位于深圳南山区科兴科学园,交通便利

工作地址

深圳南山区科兴科学园深圳-南山区科兴科学园B2栋1405室