返回岗位列表

壁仞科技

GPU互联软件架构/工程师(2026校招)

地点:北京 薪资:20-40K 日期:2026-03-03

岗位摘要

设计并实现大规模AI集群GPU/AI芯片间通信库,负责架构、核心模块与极致性能优化;深度挖掘PCIe/RDMA/自研互联技术特性,设计通信拓扑、路由、流控与传输协议;实现并优化AllReduce、AllToAll、Broadcast等集合通信算子,支撑分布式训练与推理

岗位职责

  • 设计并实现大规模AI集群GPU/AI芯片间通信库,负责架构、核心模块与极致性能优化
  • 深度挖掘PCIe/RDMA/自研互联技术特性,设计通信拓扑、路由、流控与传输协议
  • 实现并优化AllReduce、AllToAll、Broadcast等集合通信算子,支撑分布式训练与推理
  • 与编译器、驱动、框架团队协同,构建软硬协同端到端通信方案,提升系统整体效率
  • 建模分析通信瓶颈,通过计算通信重叠、拓扑调度、梯度压缩等手段持续优化延迟与带宽
  • 跟踪前沿通信技术,探索创新算法与模式,保持技术领先

任职要求

  • 计算机/电子/人工智能等相关专业硕士及以上,优秀本科亦可
  • 深入理解GPU并行计算模型、内存层次与I/O子系统,熟悉计算机体系结构
  • 扎实掌握TCP/IP、RDMA及分布式系统原理,了解RPC与一致性模型
  • 精通C/C++,具备系统级高性能软件设计与开发能力
  • 熟悉Linux、Git、GDB、Perf等开发调试工具,具备强烈性能优化意识
  • 有NCCL/UCX/MPI等通信库、CUDA、PyTorch/TF分布式训练经验者优先
  • 发表过SC/OSDI等顶级会议论文或ACM竞赛获奖者优先

加分项

  • 有 MPI、NCCL、UCX、Gloo、Horovod 等通信库的开发、优化或深度使用经验
  • 熟悉CUDA编程,了解GPU kernels、stream、event等并发机制
  • 熟悉PyTorch DDP 或 TensorFlow MirroredStrategy 等分布式训练框架的原理
  • 在系统、网络、高性能计算相关顶级会议(如 SC, PPoPP, OSDI, SOSP, NSDI, MLSys, ATC 等)发表过论文
  • ICPC、数学建模竞赛等大型编程或算法竞赛获奖经历
  • 你将获得: 挑战AI计算领域最核心、最复杂的系统软件问题,你的工作将直接影响公司产品的核心竞争力
  • 成为同时精通硬件架构、系统软件和AI框架的稀缺人才,构建个人极强的技术壁垒
  • 与业界顶尖的系统软件和AI架构师并肩作战,在解决真实世界大规模问题中快速成长
  • 有竞争力的薪酬包和清晰的职业发展通道
  • 田先生 刚刚活跃
  • 壁仞科技 · 芯片架构工程师

福利待遇

  • 直面AI最核心系统难题,代码直接影响产品竞争力
  • 成为软硬兼修的稀缺人才,构建个人技术壁垒
  • 与顶尖架构师并肩作战,快速成长为领域专家
  • 15薪+有竞争力薪酬包,职业发展通道清晰
  • 工作地点可选北京/上海/杭州/珠海/广州

工作地址

上海闵行区浦江科技广场16号楼13楼