AI集群网络解决方案与服务工程师
岗位摘要
负责AI算力集群网络方案设计与实施交付,包括GPU训练网络架构设计(RoCE/IB/100G/200G/400G)、管理网络/存储网络/训练网络规划及ToR/Spine架构设计;负责AI集群网络环境部署与调试,包括交换机配置与上线、VLAN/VXLAN/BGP/ECMP配置及RDMA/RoCE网络…
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 负责AI算力集群网络方案设计与实施交付,包括GPU训练网络架构设计(RoCE/IB/100G/200G/400G)、管理网络/存储网络/训练网络规划及ToR/Spine架构设计
- 负责AI集群网络环境部署与调试,包括交换机配置与上线、VLAN/VXLAN/BGP/ECMP配置及RDMA/RoCE网络调优
- 负责AI训练网络性能优化,包括NCCL网络性能优化、RDMA通信调优及GPU集群网络瓶颈定位
- 参与IDC机房交付实施,负责网络拓扑设计、设备上架与布线方案及连线表编制
- 负责客户现场问题技术支持,包括AI训练网络故障定位、网络性能问题排查及复杂交付问题攻坚
- 配合AI算力平台部署,完成Kubernetes/容器网络调试及GPU调度网络问题定位
任职要求
- 本科及以上学历,计算机、网络工程、通信工程等相关专业
- 3-5年相关工作经验,具备IDC数据中心网络、HPC集群网络或AI算力集群网络经验之一
- 熟悉数据中心网络架构(Spine-Leaf、ECMP)及网络协议(TCP/IP、BGP、OSPF、VXLAN)
- 熟悉高速网络技术,包括RoCE、RDMA,了解InfiniBand
- 熟悉Mellanox、H3C、Huawei、Arista等主流交换机设备
- 了解NCCL、分布式训练网络、GPU通信网络及Deep Learning集群架构
- 熟悉Linux系统(Ubuntu/CentOS),具备Shell、Python或Go脚本编写能力
- 熟悉iperf、ibstat、ibdev2netdev、tcpdump等网络诊断工具者优先
福利待遇
- 具有竞争力的薪酬体系:30-60K·16薪
- 加入摩尔线程,参与国产AI芯片与算力平台建设
- 接触前沿AI集群网络技术,职业发展前景广阔
- 工作地点位于深圳南山区科兴科学园,交通便利
工作地址
深圳南山区科兴科学园深圳-南山区科兴科学园B2栋1405室
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。