资深SRE工程师
岗位摘要
保障大规模智算集群7×24稳定运行,支撑模型开发、训练与部署;统筹GPU/NPU/CPU及存储资源规划、预算与成本优化;设计并实施多地域、多机房容灾方案,负责服务部署与集群治理;主导关键业务重保与应急响应,快速定位并恢复故障
岗位职责
- 保障大规模智算集群7×24稳定运行,支撑模型开发、训练与部署
- 统筹GPU/NPU/CPU及存储资源规划、预算与成本优化
- 设计并实施多地域、多机房容灾方案,负责服务部署与集群治理
- 主导关键业务重保与应急响应,快速定位并恢复故障
- 开发自动化工具/平台,提升资源利用率与运维人效
任职要求
- 三年以上运维开发项目经验,熟悉Docker/Kubernetes生态
- 精通Linux环境下Go/Python/Shell至少两种语言
- 具备大型分布式系统资源管理与任务调度运维经验
- 强烈的责任心、自驱力与团队合作精神,沟通及学习能力强
- 优秀的逻辑分析与抽象能力,能合理拆分业务逻辑
- 良好的文档习惯,能及时撰写并更新流程与技术文档
福利待遇
- 16薪结构,年薪25-50K区间,极具竞争力
- 北京望京核心办公园区,交通便利
- 深耕AI算力赛道,技术前沿成长快
- 扁平团队氛围,充分技术决策权
工作地址
北京朝阳区望京国际研发园-I座1