高性能计算算子与编译器工程师(实习/全职)
岗位摘要
针对GPU/NPU等架构,使用CUDA、Ascend C和TileLang,设计、实现并长期维护GEMM、Attention以及其他算子;针对不同通信场景和网络架构,设计、实现并长期维护通信算子(如DeepEP中的EP、CP/DP、Engram、PP),同时持续对NCCL/HCCL等主流集合通信库…
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 针对GPU/NPU等架构,使用CUDA、Ascend C和TileLang,设计、实现并长期维护GEMM、Attention以及其他算子
- 针对不同通信场景和网络架构,设计、实现并长期维护通信算子(如DeepEP中的EP、CP/DP、Engram、PP),同时持续对NCCL/HCCL等主流集合通信库进行调优和排障
- 参与面向深度学习的DSL编译器(如TileLang等)的研发,负责设计面向新一代硬件的编译优化,并围绕内部实际的新模型、新算子和性能优化的需求扩展DSL/IR/CodeGen的能力,在保持接口简洁和可维护性的同时尽可能提升性能
- 紧贴模型结构和算法演进,与框架同学、研究员共同为新思路设计硬件友好的模型结构和算法,并对真实训练/推理负载持续进行性能分析
任职要求
- 熟悉C++等编程语言,熟练掌握Git等工具
- 对细节有较高关注,对性能优化有较高热情,眼界广阔,同时对代码有品味的追求
福利待遇
- 深入NVIDIA GPU和Ascend NPU等国产硬件,从指令集、内存模型、编译栈到大规模互联,系统性地掌握多种硬件体系
- 团队提供必要指导,不要求相关背景,欢迎有热情的白纸同学加入
- 参与前沿AGI与硬件协同设计,与顶尖研究员和工程师合作
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。