AI集群网络解决方案与服务工程师
岗位摘要
负责AI算力集群网络方案设计与实施交付,包括GPU训练网络架构设计(RoCE / IB / 100G / 200G / 400G);负责管理网络、存储网络与训练网络的整体规划,以及ToR / Spine架构设计
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 负责AI算力集群网络方案设计与实施交付,包括GPU训练网络架构设计(RoCE / IB / 100G / 200G / 400G)
- 负责管理网络、存储网络与训练网络的整体规划,以及ToR / Spine架构设计
- 负责AI集群网络环境部署与调试,包括交换机配置上线、VLAN / VXLAN / BGP / ECMP配置
- 负责RDMA / RoCE网络调优与AI训练网络性能优化,进行NCCL网络性能优化及GPU集群瓶颈定位
- 参与IDC机房交付实施,负责网络拓扑设计、设备上架与布线方案及连线表编制
- 负责客户现场问题技术支持,包括AI训练网络故障定位、网络性能问题排查及复杂交付问题攻坚
- 配合AI算力平台部署,进行Kubernetes / 容器网络调试与GPU调度网络问题定位
任职要求
- 本科及以上学历,计算机、网络工程、通信工程等相关专业
- 具备3-5年相关经验,熟悉IDC数据中心网络、HPC集群网络或AI算力集群网络
- 熟悉数据中心网络架构(Spine-Leaf、ECML)及其他网络技术
- 掌握TCP/IP、BGP、OSPF、VXLAN等网络协议
- 熟悉RoCE、RDMA高速网络技术,了解InfiniBand
- 熟悉Mellanox、H3C、Huawei、Arista等主流交换机设备
- 了解NCCL、分布式训练网络、GPU通信网络及Deep Learning集群架构
- 熟悉Linux系统(Ubuntu / CentOS),具备Shell及Python/Go脚本编写能力
- 熟悉iperf、ibstat、ibdev2netdev、tcpdump等网络诊断工具者优先
工作地址
北京朝阳区望京国际研发园I座
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。