大模型异构算力系统工程师
岗位摘要
围绕大模型异构算力集群,尤其是国产算力集群,面向大模型训练和推理场景支持算力评估、适配和落地维护,具体包括分布式优化框架、AI框架、网络集合通信、算子等方面内容;负责大模型分布式优化框架的系统分析、性能调优、特性开发、问题定位等工作,支持常见的大模型分布式优化框架
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 围绕大模型异构算力集群,尤其是国产算力集群,面向大模型训练和推理场景支持算力评估、适配和落地维护,具体包括分布式优化框架、AI框架、网络集合通信、算子等方面内容
- 负责大模型分布式优化框架的系统分析、性能调优、特性开发、问题定位等工作,支持常见的大模型分布式优化框架
- 负责PyTorch在异构算力下的系统分析、性能调优、问题定位等工作
- 负责常见大模型场景下高性能Kernel算子的关键指标分析和统计、融合开发、性能优化等工作
- 负责大模型超万卡规模的集合通信/NCCL关键指标分析和统计、系统定位/调优等工作
- 负责多种算力的Benchmark评测、对比验证、性能分析等工作
任职要求
- 具备大模型异构算力集群相关经验,熟悉国产算力集群者优先
- 精通分布式优化框架、AI框架(如PyTorch)及网络集合通信技术
- 熟悉高性能Kernel算子开发与性能优化方法
- 具备集合通信/NCCL关键指标分析与系统调优能力
- 熟悉多算力Benchmark评测与性能分析方法
- 具备良好的团队协作能力,能与算法、AI框架、网络、计算、芯片等多团队协同工作
福利待遇
- 接触业界前列的多种算力规模,参与前沿AI Infra基础设施建设
- 协同算法、AI框架、网络、计算、芯片等多团队,全面参与大模型软硬件技术底座建设
- 从算法到算子、从芯片架构到互联集群、从POC到大规模场景,充满机遇与挑战
- 兼顾学习与成长,在垂直和水平等多个领域和维度全面感受大模型带来的技术变革
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。