AI集群网络解决方案与服务工程师
岗位摘要
负责AI算力集群网络方案设计与实施交付,包括GPU训练网络架构设计(RoCE/IB/100G/200G/400G);负责管理网络、存储网络与训练网络的整体规划,以及ToR/Spine架构设计
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 负责AI算力集群网络方案设计与实施交付,包括GPU训练网络架构设计(RoCE/IB/100G/200G/400G)
- 负责管理网络、存储网络与训练网络的整体规划,以及ToR/Spine架构设计
- 负责AI集群网络环境部署与调试,包括交换机配置上线及VLAN/VXLAN/BGP/ECMP配置
- 负责AI训练网络性能优化,进行NCCL网络性能优化、RDMA通信调优及GPU集群网络瓶颈定位
- 参与IDC机房交付实施,负责网络拓扑设计、设备上架与布线方案及连线表编制
- 负责客户现场问题技术支持,包括AI训练网络故障定位、网络性能问题排查及复杂交付问题攻坚
- 配合AI算力平台部署,进行Kubernetes/容器网络调试及GPU调度网络问题定位
任职要求
- 本科及以上学历,计算机、网络工程、通信工程等相关专业
- 3-5年数据中心网络、HPC集群网络或AI算力集群网络相关经验
- 熟悉数据中心网络架构,包括Spine-Leaf架构与ECMP负载均衡
- 熟悉TCP/IP、BGP、OSPF、VXLAN等网络协议
- 熟悉RoCE、RDMA高速网络技术,了解InfiniBand网络
- 熟悉Mellanox、H3C、Huawei、Arista等主流交换机设备
- 了解NCCL、分布式训练网络、GPU通信网络及深度学习集群架构
- 熟悉Linux系统(Ubuntu/CentOS),具备基础Shell及Python/Go脚本编写能力
- 熟悉iperf、ibstat、ibdev2netdev、tcpdump等网络诊断工具优先
福利待遇
- 具有竞争力的薪酬待遇,30-60K·16薪
- 摩尔线程作为GPU领域领先企业,提供前沿技术发展平台
- 参与AI算力集群网络建设,积累高端数据中心网络实战经验
工作地址
上海浦东新区长泰广场-C座上海-浦东新区长泰广场C座12层
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。