GPU互联软件工程师
岗位摘要
设计并实现类NCCL/UCX的高性能GPU/AI芯片间通信库,完成架构、核心模块开发与极致性能优化;利用BRLink、PCIe、RDMA等底层互联技术设计高效拓扑、路由、流控及传输协议
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 设计并实现类NCCL/UCX的高性能GPU/AI芯片间通信库,完成架构、核心模块开发与极致性能优化
- 利用BRLink、PCIe、RDMA等底层互联技术设计高效拓扑、路由、流控及传输协议
- 实现并优化AllReduce、AllToAll、Broadcast、ReduceScatter等集合通信算子
- 与编译器、驱动、算子库、AI框架团队协同,构建软硬协同端到端通信解决方案
- 建模分析通信瓶颈,通过计算通信重叠、拓扑感知调度、梯度压缩等手段持续优化延迟与带宽
- 跟踪前沿技术,探索创新通信模式与算法,保持技术领先
任职要求
- 计算机、软件工程、人工智能、电子工程等相关专业硕士及以上学历,优秀本科亦可
- 深入理解GPU/AI加速器并行计算模型、内存层次与I/O子系统
- 扎实掌握计算机网络与分布式系统,熟悉TCP/IP、RDMA、RPC及一致性模型
- 精通C/C++,具备系统级软件开发与高性能库架构设计能力
- 熟悉Linux、Git、GDB、Perf等开发调试工具,具备强烈性能优化意识
- 有NCCL、UCX、Gloo、MPI等通信库开发/优化经验者优先
- 熟悉CUDA、PyTorch DDP、TensorFlow分布式训练原理者优先
- 在SC、PPoPP、OSDI等顶级会议发表论文或ACM-ICPC获奖者优先
加分项
- 有 MPI、NCCL、UCX、Gloo、Horovod 等通信库的开发、优化或深度使用经验
- 熟悉CUDA编程,了解GPU kernels、stream、event等并发机制
- 熟悉PyTorch DDP 或 TensorFlow MirroredStrategy 等分布式训练框架的原理
- 在系统、网络、高性能计算相关顶级会议(如 SC, PPoPP, OSDI, SOSP, NSDI, MLSys, ATC 等)发表过论文
- ICPC、数学建模竞赛等大型编程或算法竞赛获奖经历
- 徐先生 本周活跃
- 壁仞科技 · 工程师
福利待遇
- 15薪,年薪40-70K·15薪,具备行业竞争力的薪酬包
- 参与国家级AI算力基础设施建设,技术挑战与成长空间巨大
- 与顶尖软硬件团队协同,发表顶级会议论文机会
- 上海闵行区核心科技园区,交通便利,办公环境优越
工作地址
上海闵行区壁仞科技12层
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。