AI大模型平台运维工程师
岗位摘要
负责保障大规模AI集群的计算、网络和存储系统的稳定运行,监控、识别并解决各类线上问题;协助IDC和各类软硬件供应商完成大规模集群的部署、联调、上线运行;建设大规模集群的运维能力和运维体系,并对平台客户提供相关技术支持
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 负责保障大规模AI集群的计算、网络和存储系统的稳定运行,监控、识别并解决各类线上问题
- 协助IDC和各类软硬件供应商完成大规模集群的部署、联调、上线运行
- 建设大规模集群的运维能力和运维体系,并对平台客户提供相关技术支持
- 从运维视角研发各类工具、命令行、脚本等,配合完成算法模型的持续开发和部署能力
- 参与大模型平台的长期稳定性建设
任职要求
- 统招本科或本科以上学历,计算机及相关专业,5年以上相关工作经验
- 熟悉阿里云、腾讯云等云厂商运维,对主流AI设备厂商的CPU、GPU及硬件设备有深入理解
- 了解大模型网络理论知识,具备IB或RoCE网络架构经验,熟练掌握相关调试运维工具
- 熟悉Kubernetes、容器平台等相关技术生态,熟练掌握相关调试运维工具
- 具备千万DAU以上大规模集群服务的运维和优化经验、有大型互联网公司AI大模型系统开发、测试、运维、应用工作经验者优先
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。