AI超算集群运维工程师
岗位摘要
负责AI超算集群中前沿加速卡、服务器、超节点等基础设施的日常运维开发工作,包括巡检、维修、故障定位与生命周期管理,缩短平均故障恢复时间(MTTR),保障集群持续稳定运行;负责新一代计算资源的快速交付与上线,完成节点的基线检查与性能调优、验证工作,确保资源能够高质量高性能投入生产
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 负责AI超算集群中前沿加速卡、服务器、超节点等基础设施的日常运维开发工作,包括巡检、维修、故障定位与生命周期管理,缩短平均故障恢复时间(MTTR),保障集群持续稳定运行
- 负责新一代计算资源的快速交付与上线,完成节点的基线检查与性能调优、验证工作,确保资源能够高质量高性能投入生产
- 负责建设和优化面向AI超算集群的监控、告警与可观测性体系,实现集群健康状态的实时感知
- 构建自动化运维工具链,提升故障自愈率与运维效率,降低人工干预成本
任职要求
- 本科及以上学历,计算机、电子、通信、自动化或相关专业优先
- 具备Linux服务器运维经验,熟悉集群环境下的系统管理、故障排查与性能分析
- 熟悉GPU/AI加速卡服务器、RDMA网络等相关基础设施,有实际运维经验者优先
- 具备良好的脚本或自动化能力,能够使用Shell、Python、LLM等工具提升运维效率
- 具备良好的沟通协作能力、责任心和现场问题推动能力,能在跨团队协同场景下高效推进问题解决
加分项
- 有大规模AI超算集群(千卡以上)运维经验
- 有机房交付、批量上架、集群 bring
- up、验收测试经验
- 有 GPU 服务器压测、性能基线建立、异常案例归因和优化经验
- 具备监控体系建设经验(如Prometheus、Grafana等),有可观测性平台落地经验者优先
- 在 HPC 赛事(SC / ASC / ISC / PAC)中取得优异成绩
- AGI 时代的竞争,本质上也是大规模算力系统性能与可靠性的竞争。这里不是简单地维护机器,而是在参与建设 AGI 时代的核心基础设施。团队的价值,是让巨大而复杂的 AI 超算集群成为稳定可靠的生产力,让模型的每一次训练和推理都建立在坚实可靠的算力底座之上
- 【岗位类别】:实习/全职
- 有机房交付、批量上架、集群 bring-up、验收测试经验
福利待遇
- 参与建设AGI时代核心基础设施的宝贵经验
- 与前沿AI超算技术紧密接触,持续提升技术能力
- 团队氛围积极,鼓励创新与自动化
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。