高性能计算工程师
岗位摘要
负责大规模深度学习训练/推理框架中CUDA内核的性能优化与定制开发;开展与GPU体系结构相关的前沿探索性工作,包括新指令集、算子融合、异构计算和硬件趋势研究;与算法研究员合作,推动模型结构与底层实现的协同优化
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 负责大规模深度学习训练/推理框架中CUDA内核的性能优化与定制开发
- 开展与GPU体系结构相关的前沿探索性工作,包括新指令集、算子融合、异构计算和硬件趋势研究
- 与算法研究员合作,推动模型结构与底层实现的协同优化
任职要求
- 计算机、电子工程或相关专业本科及以上学历,或3年以上相关工作经验
- 精通CUDA编程模型,熟悉Tensor Core、WGMMA、Shared Memory等底层细节
- 具备优秀的代码实现能力(C++/CUDA/Triton/CUTLASS),良好的工程化与调试能力
- 具备良好的沟通与协作能力,能够与算法研究员、硬件工程师及跨团队成员高效配合
- 熟悉并行算法设计与优化,有大规模矩阵乘(GEMM)、注意力(FlashAttention/MLA)、MoE、稀疏算子优化经验者优先
- 熟悉分布式训练/推理框架(Megatron、vLLM、SGLang、TensorRT-LLM等)者优先
- 参与过开源社区(NCCL、CUTLASS、Triton、TileLang、Megatron-LM、vLLM等)贡献者优先
- 有HPC或超大规模AI模型训练经验者优先
福利待遇
- 薪资优厚,25-50K·16薪
- 加入前沿AI科技公司,参与月之暗面大模型核心研发
- 与技术顶尖的算法研究员和工程师团队合作
- 参与开源社区贡献,提升技术影响力
- 接触最新GPU架构与AI硬件趋势
工作地址
上海浦东新区自由贸易试验区临港新片区环湖西二路888号C楼
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。