AI平台开发工程师
岗位摘要
负责高性能计算集群的平台开发和建设工作,构建业界领先的集群算力调度能力、集群网络管理监控能力、集群故障发现和迁移自愈等能力;负责主流AI框架的云平台适配和性能调优工作,结合云平台底层技术特点和优势,打造具备差异化竞争力的AI加速平台产品能力
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 负责高性能计算集群的平台开发和建设工作,构建业界领先的集群算力调度能力、集群网络管理监控能力、集群故障发现和迁移自愈等能力
- 负责主流AI框架的云平台适配和性能调优工作,结合云平台底层技术特点和优势,打造具备差异化竞争力的AI加速平台产品能力
- 负责主流AI模型训练和推理性能优化调优工作,提升AI推理业务快速部署能力,提供平台算法优化加速能力
- 负责跟踪AI行业技术发展趋势,并进行深度探索分析,协同产品制订AI技术发展路线和产品规划
- 探索自研AI芯片分布式训练与推理云化能力,打造自研AI芯片一体化解决方案能力
任职要求
- 人工智能、计算机、数学等相关专业
- 5年以上AI研发或项目经验,有云计算领域相关经验优先
- 具备TensorRT,Triton等推理框架和服务部署软件的优化和实践能力
- 熟悉深度学习框架(Pytorch, Tensorflow等),熟悉各组件和类库,常见AI模型
- 熟悉行业内人工智能平台、机器学习实现方案,熟悉主流云计算厂商AI产品特点,有AI研发经验者优先
- 熟悉业界流行的显卡虚拟化技术,对Nvidia/AMD/Intel等GPU技术有较深理解的优先
- 对GPU,分布式计算,RDMA,MPI,GPU Direct等技术有了解和使用经验优先
- 精通C++、Golang等开发语言,熟练掌握Linux软件开发技术
加分项
- 熟悉NLP、CV相关的算法和技术,熟悉大模型推理优先
- 有以下某一方向领域的经验:CUDA,RDMA,AI Infrastructure,HW/SW Co-Design,Distributed Storage
- 在大模型领域,参与过大影响力的项目或论文者优先
福利待遇
- 熟悉NLP、CV相关的算法和技术,熟悉大模型推理优先
- 有以下某一方向领域的经验:CUDA,RDMA,AI Infrastructure,HW/SW Co-Design,Distributed Storage
- 在大模型领域,参与过大影响力的项目或论文者优先
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。