大模型训练优化工程师
岗位摘要
负责客户AI模型在寒武纪芯片(MLU)上的端到端性能优化和精度调优,及时总结可泛化实践,开发性能/精度分析工具;负责寒武纪model zoo的开发和维护,在寒武纪人工智能芯片上进行SOTA算法复现,并进行性能优化分析和精度调优,形成领域参考解决方案
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 负责客户AI模型在寒武纪芯片(MLU)上的端到端性能优化和精度调优,及时总结可泛化实践,开发性能/精度分析工具
- 负责寒武纪model zoo的开发和维护,在寒武纪人工智能芯片上进行SOTA算法复现,并进行性能优化分析和精度调优,形成领域参考解决方案
- 针对公开或私有的AI Benchmark(如MLPerf等)进行端到端优化,密切跟踪评估各AI平台厂商的优化技术实践,最大化MLU在这些benchmark上的表现
任职要求
- EECS或相关专业本科或硕士及以上学历
- 熟悉Megatron、DeepSeed等分布式框架,有实际大规模分布式训练经验
- 对大模型、多模态、强化学习中的某一个场景有一定的积累和见解
- 有GPU性能优化分析和精度调优经验,熟练掌握nvprof、nvvp、nsight和valgrind等性能分析工具
- 熟悉掌握一种或以上主流框架(TensorFlow/PyTorch等)
- 熟练操作Linux系统,熟练掌握C/C++/Python/Shell,有扎实的编程基础和调试经验
- 1年以上大模型性能优化和精度调试经验
- 加分项:对数据/模型并行等分布式方案有一定见解和经验,或量化训练有相关经验,或对主流框架有开发者视角的理解并有框架设计调优经验,或有CUDA/OpenCL/BANG C/OpenMP等并行计算模型开发经验,或熟悉GPGPU/MLU/CPU微架构有软硬件联合优化经验
加分项
- (满足一项即可)
- 对数据/模型并行等分布式方案有一定的见解和经验
- 对一种或以上主流框架(TensorFlow/PyTorch等)有开发者视角的理解,对框架设计或者调优有一定的见解和经验
- 熟悉并喜欢高性能优化,对CUDA/OpenCL/BANG/C/OpenMP等并行计算模型有一定的开发经验
- 熟悉GPGPU/MLU/CPU微架构,对软硬件联合优化有一定的见解和经验
- 陶先生 刚刚活跃
福利待遇
- 月薪28-55K,15薪,具竞争力的薪酬体系
- 工作地点位于北京海淀区北航致真大厦,交通便利
- 加入寒武纪核心技术团队,参与前沿AI芯片与大模型优化工作
工作地址
北京海淀区北航致真大厦D座16层
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。