AI算力集群网络工程师
岗位摘要
主导AI算力集群(GPU集群)的网络方案设计,重点优化高性能计算及分布式训练场景的网络架构;负责RoCE网络/IB网络的全栈设计与实现,包括无丢包网络的构建,确保低延迟、高吞吐;完成交换机选型、拓扑设计、配置部署(重点厂商:NVIDIA/新华三/浪潮/锐捷等)
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 主导AI算力集群(GPU集群)的网络方案设计,重点优化高性能计算及分布式训练场景的网络架构
- 负责RoCE网络/IB网络的全栈设计与实现,包括无丢包网络的构建,确保低延迟、高吞吐
- 完成交换机选型、拓扑设计、配置部署(重点厂商:NVIDIA/新华三/浪潮/锐捷等)
- 设计并实施网络自动化配置方案(Ansible/Python脚本等),提升大规模集群部署效率
- 设计实施AI训练/推理场景网络性能手动/自动测试,作为产品稳定性功能的重要组件
- 监控集群网络性能(时延、吞吐量、丢包率),针对RoCE网络进行精细化调优(PFC、ECN、DCQCN策略配置)
- 定位并解决网络硬件故障(交换机、服务器、光模块、光纤等)
- 定位并解决网络故障(如RDMA通信中断、拥塞风暴、路由震荡等),保障训练任务连续性
- 优化集群通信性能,减少AllReduce等集合操作时延
- 推动智能运维(AIOps)工具落地,实现网络异常预测与自动化根因分析
- 与计算/存储团队协同设计端到端性能优化方案(集合通讯库、高性能存储)
- 支持业务团队解决分布式训练中的网络瓶颈问题(如通信效率、多集群扩展)
任职要求
- 本科及以上学历,计算机/通信/电子工程相关专业
- 精通RoCE协议栈及无损网络技术(PFC、ECN、ETS)
- 3年以上超大规模数据中心网络实战经验(≥1000节点)
- 精通BGP/OSPF/EVPN/VxLAN等协议,具备跨厂商设备配置能力
- 熟练使用网络诊断工具(Wireshark、tcpdump、perf、rdma_perf)
- 熟悉Linux网络栈调优(TCP参数、IRQ绑定、NUMA亲和性)
- 具备网络自动化开发能力(Python/Go/Ansible)
- 具备高强度问题攻关能力,能快速定位复杂网络问题(如Incast拥塞、RDMA CM断开)
- 良好的技术文档习惯,能输出架构设计、故障分析报告
- 有NVIDIA Quantum/Spectrum交换机或InfiniBand网络运维经验者优先
- 熟悉AI训练框架通信原理(NCCL/UCX/MPI)者优先
- 持有CCIE/CCNP/JNCIE或同等级别认证者优先
- 有AI/HPC/云平台(AWS/Azure/GCP)网络支持经验者优先
加分项
- ○ 有NVIDIA Quantum/Spectrum交换机或InfiniBand网络运维经验
- ○ 熟悉AI训练框架通信原理(NCCL/UCX/MPI)
- ○ 持有CCIE/CCNP/JNCIE或同等级别认证
福利待遇
- 薪资范围20-40K·16薪
工作地址
杭州滨江区医惠中心EWELLA座
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。