高性能网络工程师
岗位摘要
开发和调优基于RDMA的通信系统,利用NVIDIA GPU和Mellanox网卡(InfiniBand, RoCE)实现节点间的超高速数据传输;实施和优化GPUDirect RDMA,以实现GPU与网络接口之间的直接内存访问,最小化CPU开销
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 开发和调优基于RDMA的通信系统,利用NVIDIA GPU和Mellanox网卡(InfiniBand, RoCE)实现节点间的超高速数据传输
- 实施和优化GPUDirect RDMA,以实现GPU与网络接口之间的直接内存访问,最小化CPU开销
- 将RDMA解决方案与基于Kubernetes的工作负载集成,确保跨分布式计算和存储系统的无缝操作
- 与AI研究人员和基础设施团队合作,使用NCCL和MPI加速数据管道和集体通信
- 排查并解决高吞吐量、低延迟网络环境中的性能瓶颈
任职要求
- 在高性能计算或AI超级计算环境中,具备NVIDIA RDMA技术(如GPUDirect RDMA, RoCE, InfiniBand)的实践经验
- 精通使用Rust、C或C++进行底层网络和系统优化编程
- 熟悉NVIDIA网络技术栈,包括Mellanox驱动程序、库(如libibverbs)和工具(如NVPeerMemory)
- 具备使用MPI、NCCL或类似框架优化GPU加速工作负载的分布式系统的经验
- 了解Kubernetes网络,并有将RDMA集成到容器化环境中的经验
- 加分项:具备AI/ML训练工作流程及其网络需求(如大规模参数同步)的背景知识
福利待遇
- 全面的医疗、视力和牙科保险
- 401(k)退休计划
- 短期和长期残疾保险
- 各种其他折扣和福利
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。