超算网络研发工程师
岗位摘要
设计超大规模集群互联架构与路由策略,实现逐包多路径负载均衡和乱序收包处理机制;结合业务落地拥塞控制算法,解决PFC风暴、拥塞扩散等问题;构建端到端监控与tracing体系,主导大规模训练的网络故障诊断和性能回归分析
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 设计超大规模集群互联架构与路由策略,实现逐包多路径负载均衡和乱序收包处理机制
- 结合业务落地拥塞控制算法,解决PFC风暴、拥塞扩散等问题
- 构建端到端监控与tracing体系,主导大规模训练的网络故障诊断和性能回归分析
- 熟悉计算机体系结构,结合网络负载进行端到端Profiling与全链路排障
- 与训练框架、调度、存储、硬件等团队配合,推动网络性能持续演进
任职要求
- 计算机等相关专业,本科及以上学历
- 扎实的C/C++/Python系统编程能力,熟悉网络栈与高性能互连技术(RoCEv2、IB等)
- 精通高性能网络拓扑、路由与多路径负载均衡设计,理解乱序收包及重排序机制,掌握RDMA拥塞控制及相关机制
- 深入了解集合通讯算法和原理,有源码级开发或深度性能调优经验
- 深入了解计算机体系结构,能够清晰描述数据包从内存到对端的全过程及其潜在瓶颈
- 具备大规模网络故障诊断与性能优化实战经验,能跨端侧、交换机、网卡定位问题
加分项
- -有万卡以上 GPU 集群网络设计或长期运行经验
- -有高性能计算HPC应用开发经验,跑过全机级别的超大规模的并行任务
- -在SIGCOMM/NSDI/SC/ISCA/OSDI等系统顶会发表过高性能网络或分布式方向论文
- -有智能网卡、可编程交换机的 固件/OS 开发经验(P4、SDN、SONiC 等),熟悉硬件卸载与加速流水线设计
- -熟悉DPU/IPU/FPGA 等异构加速设备的开发
- 【你会得到】 -直接定义并落地下一代超算网络架构,挑战更大规模集群的极致性能
- -和顶尖系统/算子/框架工程师一起工作
- -你的工作会直接影响大模型训推的效率与成本
- 罗女士 2周内活跃
福利待遇
- 直接定义并落地下一代超算网络架构,挑战更大规模集群的极致性能
- 和顶尖系统/算子/框架工程师一起工作
- 工作直接影响大模型训推的效率与成本
工作地址
杭州拱墅区汇金国际A座
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。