GPU互联软件工程师/架构师
岗位摘要
设计并实现类NCCL/UCX的高性能GPU通信库,完成架构、核心模块与极致性能优化;深度挖掘RDMA/PCIe等硬件互联特性,设计高效拓扑、路由、流控与传输协议;实现并优化AllReduce、AllToAll等集合通信算子,为分布式训练提供基石
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 设计并实现类NCCL/UCX的高性能GPU通信库,完成架构、核心模块与极致性能优化
- 深度挖掘RDMA/PCIe等硬件互联特性,设计高效拓扑、路由、流控与传输协议
- 实现并优化AllReduce、AllToAll等集合通信算子,为分布式训练提供基石
- 与编译器、驱动、AI框架团队协同,构建软硬协同端到端通信方案
- 建模分析通信瓶颈,通过计算通信重叠、梯度压缩等手段持续降低延迟提升带宽
- 跟踪前沿通信技术,探索创新算法保持技术领先
任职要求
- 计算机/电子/AI等相关专业硕士及以上,优秀本科亦可
- 深入理解GPU并行计算模型、内存层次与I/O子系统
- 扎实掌握TCP/IP、RDMA及分布式系统、RPC、一致性模型
- 精通C/C++与Linux系统开发,熟练使用Git、GDB、Perf等工具
- 具备高性能库架构设计能力,追求极致性能优化
- 有NCCL、MPI、CUDA、PyTorch DDP等经验优先,顶会论文或竞赛获奖加分
加分项
- 有 MPI、NCCL、UCX、Gloo、Horovod 等通信库的开发、优化或深度使用经验
- 熟悉CUDA编程,了解GPU kernels、stream、event等并发机制
- 熟悉PyTorch DDP 或 TensorFlow MirroredStrategy 等分布式训练框架的原理
- 在系统、网络、高性能计算相关顶级会议(如 SC, PPoPP, OSDI, SOSP, NSDI, MLSys, ATC 等)发表过论文
- ICPC、数学建模竞赛等大型编程或算法竞赛获奖经历
- 你将获得: 挑战AI计算领域最核心、最复杂的系统软件问题,你的工作将直接影响公司产品的核心竞争力
- 成为同时精通硬件架构、系统软件和AI框架的稀缺人才,构建个人极强的技术壁垒
- 与业界顶尖的系统软件和AI架构师并肩作战,在解决真实世界大规模问题中快速成长
- 有竞争力的薪酬包和清晰的职业发展通道
- 吴双双 2周内活跃
- 壁仞科技 · 高级经理
福利待遇
- 直面AI最核心系统难题,代码直接决定万亿模型训练速度
- 成为软硬AI全栈稀缺人才,构建极高技术壁垒
- 与顶尖架构师并肩作战,解决真实大规模问题快速成长
- 提供有竞争力薪酬15薪及清晰晋升通道
工作地址
上海闵行区临港浦江科技广场16号楼
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。