资深SRE工程师
岗位摘要
保障大规模智算集群7×24稳定运行,支撑模型开发、训练与部署;统筹GPU/NPU/CPU及存储资源规划、预算与成本优化;设计并实施多地域、多机房容灾方案,负责服务部署与集群治理;主导关键业务重保与应急响应,快速定位并恢复故障
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 保障大规模智算集群7×24稳定运行,支撑模型开发、训练与部署
- 统筹GPU/NPU/CPU及存储资源规划、预算与成本优化
- 设计并实施多地域、多机房容灾方案,负责服务部署与集群治理
- 主导关键业务重保与应急响应,快速定位并恢复故障
- 开发自动化工具/平台,提升资源利用率与运维人效
任职要求
- 三年以上运维开发项目经验,熟悉Docker/Kubernetes生态
- 精通Linux环境下Go/Python/Shell至少两种语言
- 具备大型分布式系统资源管理与任务调度运维经验
- 强烈的责任心、自驱力与团队合作精神,沟通及学习能力强
- 优秀的逻辑分析与抽象能力,能合理拆分业务逻辑
- 良好的文档习惯,能及时撰写并更新流程与技术文档
福利待遇
- 16薪结构,年薪25-50K区间,极具竞争力
- 北京望京核心办公园区,交通便利
- 深耕AI算力赛道,技术前沿成长快
- 扁平团队氛围,充分技术决策权
工作地址
北京朝阳区望京国际研发园-I座1
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。