高级运维工程师(AI基础设施方向)
岗位摘要
保障线上服务(含AI大模型训练与推理任务)的可靠性、稳定性与高性能运行,持续优化系统容量与架构;设计并落地基于Kubernetes的自动化运维平台,支撑集群与服务的快速、稳定迭代;建设并完善全链路监控与可观测性体系,通过指标、日志、追踪快速定位故障,提升系统可见性
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 保障线上服务(含AI大模型训练与推理任务)的可靠性、稳定性与高性能运行,持续优化系统容量与架构
- 设计并落地基于Kubernetes的自动化运维平台,支撑集群与服务的快速、稳定迭代
- 建设并完善全链路监控与可观测性体系,通过指标、日志、追踪快速定位故障,提升系统可见性
- 主导服务治理、性能优化与高可用架构演进,解决关键链路瓶颈,推动整体SLA提升
- 深入业务场景,优化运维最佳实践,并通过工具化、自动化提升运维效率与系统可扩展性
任职要求
- 本科及以上学历,计算机、软件工程或相关专业
- 3年以上云计算、分布式系统或大规模服务运维经验
- 具备扎实的计算机基础,熟悉Linux操作系统、网络、存储及I/O原理
- 拥有优秀的系统化问题解决能力、强烈的责任心和良好的团队沟通技巧
- 精通Linux系统运维,深入理解Kubernetes核心原理与生态
- 熟练掌握至少一门编程语言(Python/Go)
- 拥有主流公有云(AWS/Azure/GCP/阿里云)的服务使用与运维经验
- 具备监控系统(如Prometheus、Grafana)、CI/CD、基础设施即代码(如Terraform/Crossplane)等实践经验
- 了解大模型训练/推理任务的生命周期管理与稳定性保障,具备相关集群运维经验者更佳
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。