AI平台运维/运维开发工程师(实习/全职)
岗位摘要
面向高并发、大规模业务的k8s集群或高性能分布式存储等平台基础设施提供专业的稳定性保障和全方位优化,支撑核心业务SLA达到99.99%+;负责持续完善和优化可观测体系,深入参与业务和平台层的监控建设、告警治理与排障工作,缩短MTTR
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 面向高并发、大规模业务的k8s集群或高性能分布式存储等平台基础设施提供专业的稳定性保障和全方位优化,支撑核心业务SLA达到99.99%+
- 负责持续完善和优化可观测体系,深入参与业务和平台层的监控建设、告警治理与排障工作,缩短MTTR
- 负责k8s集群或高性能分布式存储等内部工具链的开发与运维自动化建设,持续提升人效与交付效率
- 推动混沌工程、容灾演练、多集群容灾多活等可靠性工程落地,持续验证和提升系统韧性
- 主导公司运维平台(CMDB、运维作业、可观测等)的架构设计和开发
- 对接第三方开放平台、监控系统、仓管系统、采购系统等
- 和运维团队、采购团队、研发团队深度协作,不断完善运维开发需求
任职要求
- 本科及以上学历,扎实的Linux、操作系统、网络基础
- 具备良好的Bash/Python/Golang等开发能力
- 熟悉k8s集群或熟悉分布式系统基础原理
- 熟悉Prometheus、Grafana、Signoz等各类监控和可观测性工具
- 具备较好的灵活性、学习迁移能力和对新技术的追求精神,能够从0-1快速学习掌握新技术并解决未遇到的问题
- 对运维体系有较全面的认知,深入理解运维流程
- 熟悉CMDB、工单系统等运维平台
加分项
- 熟悉容器内使用GPU/RMDA的配置方式、工作原理及相关问题诊断
- 熟悉业务应用管理和监控,有业务稳定性治理经验
- 有大规模(5000+ 节点)集群运维经历或200+节点分布式系统运维经历
- 了解LLM训练/推理工作流,参与过相关故障和性能问题排查
- 运维开发方向
- 3年以上一线运维经历,深知运维痛点
- 熟悉SRE体系
- 成熟运维平台开发经历
- 我们的使命,不仅是守护算力的灯火,更是要托举起智能进化的“重力场”。作为AI平台基础设施的构建者,我们拒绝做被动的“消防员”,而是要做定义未来的“架构师”——在纳秒级的延迟中雕琢极致,在万卡集群的浪潮里锚定稳定。我们的终极愿景是:让复杂的底层逻辑隐于无形,让业务方只感受到“丝滑”与“确定”,让AI平台如同水与电一般,随时待命,无所不在。我们守护的不仅是平台的稳定,更是通向AGI彼岸的桥梁
- 平台运维方向
福利待遇
- 参与定义未来的AI平台架构,接触前沿技术
- 在万卡集群和高并发场景中积累实战经验
- 与顶尖团队协作,推动AGI基础设施发展
- 提供实习和全职机会,灵活选择
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。