GPU 互联软件工程师/架构师
岗位摘要
设计并实现面向大规模 AI 集群的高性能 GPU 芯片间通信库,负责架构设计与性能优化;挖掘底层硬件互联技术特性,设计高效的通信拓扑、路由策略和数据传输协议;实现并优化 AllReduce 等关键通信集合操作符,为分布式训练与推理提供基石
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 设计并实现面向大规模 AI 集群的高性能 GPU 芯片间通信库,负责架构设计与性能优化
- 挖掘底层硬件互联技术特性,设计高效的通信拓扑、路由策略和数据传输协议
- 实现并优化 AllReduce 等关键通信集合操作符,为分布式训练与推理提供基石
- 与编译器及 AI 框架团队协作,构建软硬协同的端到端通信解决方案
- 分析通信性能瓶颈,通过软件手段持续优化通信库的延迟、带宽和扩展性
- 跟踪领域前沿技术,探索创新的通信模式与算法,保持技术领先性
任职要求
- 计算机、软件工程等相关专业硕士及以上学历,优秀本科生亦可
- 深入理解计算机体系结构,特别是 GPU 加速器的并行计算模型与内存层次结构
- 扎实的计算机网络和分布式系统知识,理解 RDMA 等网络协议
- 精通 C/C++,具备扎实的编码功底和系统级软件开发能力
- 具备优秀的系统设计和抽象能力,能够设计高性能软件库架构
- 熟悉 Linux 开发环境,熟练使用 Git、GDB、Perf 等工具进行开发和性能分析
- 具备强烈的性能优化意识,良好的问题解决能力及团队协作精神
加分项
- 有 MPI、NCCL、UCX、Gloo、Horovod 等通信库的开发、优化或深度使用经验
- 熟悉CUDA编程,了解GPU kernels、stream、event等并发机制
- 熟悉PyTorch DDP 或 TensorFlow MirroredStrategy 等分布式训练框架的原理
- 在系统、网络、高性能计算相关顶级会议(如 SC, PPoPP, OSDI, SOSP, NSDI, MLSys, ATC 等)发表过论文
- ICPC、数学建模竞赛等大型编程或算法竞赛获奖经历
- 你将获得: 挑战AI计算领域最核心、最复杂的系统软件问题,你的工作将直接影响公司产品的核心竞争力
- 成为同时精通硬件架构、系统软件和AI框架的稀缺人才,构建个人极强的技术壁垒
- 与业界顶尖的系统软件和AI架构师并肩作战,在解决真实世界大规模问题中快速成长
- 有竞争力的薪酬包和清晰的职业发展通道
- 秦先生 3日内活跃
- 壁仞科技 · 资深软件工程师
福利待遇
- 挑战 AI 计算领域最核心、最复杂的系统软件问题,直接影响产品核心竞争力
- 成为精通硬件架构、系统软件和 AI 框架的稀缺人才,构建个人技术壁垒
- 与业界顶尖的系统软件和 AI 架构师并肩作战,在解决真实世界问题中快速成长
- 提供有竞争力的薪酬包和清晰的职业发展通道
工作地址
北京朝阳区浦项中心B座10层
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。