返回岗位列表

摩尔线程

AI集群网络解决方案与服务工程师

地点:北京 薪资:30-60K 日期:2026-05-08

岗位摘要

负责AI算力集群网络方案设计与实施交付,包括GPU训练网络架构设计(RoCE / IB / 100G / 200G / 400G);负责管理网络、存储网络与训练网络的整体规划,以及ToR / Spine架构设计

岗位职责

  • 负责AI算力集群网络方案设计与实施交付,包括GPU训练网络架构设计(RoCE / IB / 100G / 200G / 400G)
  • 负责管理网络、存储网络与训练网络的整体规划,以及ToR / Spine架构设计
  • 负责AI集群网络环境部署与调试,包括交换机配置上线、VLAN / VXLAN / BGP / ECMP配置
  • 负责RDMA / RoCE网络调优与AI训练网络性能优化,进行NCCL网络性能优化及GPU集群瓶颈定位
  • 参与IDC机房交付实施,负责网络拓扑设计、设备上架与布线方案及连线表编制
  • 负责客户现场问题技术支持,包括AI训练网络故障定位、网络性能问题排查及复杂交付问题攻坚
  • 配合AI算力平台部署,进行Kubernetes / 容器网络调试与GPU调度网络问题定位

任职要求

  • 本科及以上学历,计算机、网络工程、通信工程等相关专业
  • 具备3-5年相关经验,熟悉IDC数据中心网络、HPC集群网络或AI算力集群网络
  • 熟悉数据中心网络架构(Spine-Leaf、ECML)及其他网络技术
  • 掌握TCP/IP、BGP、OSPF、VXLAN等网络协议
  • 熟悉RoCE、RDMA高速网络技术,了解InfiniBand
  • 熟悉Mellanox、H3C、Huawei、Arista等主流交换机设备
  • 了解NCCL、分布式训练网络、GPU通信网络及Deep Learning集群架构
  • 熟悉Linux系统(Ubuntu / CentOS),具备Shell及Python/Go脚本编写能力
  • 熟悉iperf、ibstat、ibdev2netdev、tcpdump等网络诊断工具者优先

工作地址

北京朝阳区望京国际研发园I座