返回岗位列表

面壁智能

AI大模型平台运维工程师

地点:北京 薪资:31-51K 日期:2026-03-03

岗位摘要

负责保障大规模AI集群的计算、网络和存储系统的稳定运行,监控、识别并解决各类线上问题;协助IDC和各类软硬件供应商完成大规模集群的部署、联调、上线运行;建设大规模集群的运维能力和运维体系,并对平台客户提供相关技术支持

岗位职责

  • 负责保障大规模AI集群的计算、网络和存储系统的稳定运行,监控、识别并解决各类线上问题
  • 协助IDC和各类软硬件供应商完成大规模集群的部署、联调、上线运行
  • 建设大规模集群的运维能力和运维体系,并对平台客户提供相关技术支持
  • 从运维视角研发各类工具、命令行、脚本等,配合完成算法模型的持续开发和部署能力
  • 参与大模型平台的长期稳定性建设

任职要求

  • 统招本科或本科以上学历,计算机及相关专业,5年以上相关工作经验
  • 熟悉阿里云、腾讯云等云厂商运维,对主流AI设备厂商的CPU、GPU及硬件设备有深入理解
  • 了解大模型网络理论知识,具备IB或RoCE网络架构经验,熟练掌握相关调试运维工具
  • 熟悉Kubernetes、容器平台等相关技术生态,熟练掌握相关调试运维工具
  • 具备千万DAU以上大规模集群服务的运维和优化经验、有大型互联网公司AI大模型系统开发、测试、运维、应用工作经验者优先