返回岗位列表

月之暗面

高级SRE工程师

地点:北京 薪资:35-50K 日期:2026-03-03

岗位摘要

负责核心在线服务的稳定性和性能,确保满足SLO要求;设计和实施架构改进,识别风险保障服务具备容错、降级与快速恢复能力;定期巡检资源水位,基于数据进行容量规划,确保系统能平稳应对业务增长

岗位职责

  • 负责核心在线服务的稳定性和性能,确保满足SLO要求
  • 设计和实施架构改进,识别风险保障服务具备容错、降级与快速恢复能力
  • 定期巡检资源水位,基于数据进行容量规划,确保系统能平稳应对业务增长
  • 设计统一观测平台(Prometheus、Loki、Tempo、Grafana)实现关键指标全覆盖,并持续优化
  • 以软件工程方式解决运维问题,用Go/Python构建平台将高频低效运维操作规范化系统化
  • 推动监控、报警、容量管理、故障演练的自动化与标准化
  • 设计并维护基于Kubernetes的PaaS底座能力,满足业务需求
  • 构建持续交付和变更管理流程,关键变更要可灰度、可验证、可回滚
  • 参与7x24小时的on-call轮值,快速响应、有序组织人员定位解决线上故障
  • 参与里程碑功能上线前的架构评审、测试等准备工作,保证上线后服务持续稳定运行
  • 组织故障复盘,推动问题根因分析输出有效可落地的改进措施,持续跟进改进效果
  • 与开发团队紧密协作,推动SRE原则和最佳实践落地
  • 参与制定流程标准,提升团队整体工程质量和可靠性文化,沉淀最佳实践文档

任职要求

  • 计算机科学、电子工程或相关专业本科及以上学历
  • 5年以上SRE/DevOps/后端/分布式/云原生相关实践经验
  • 有丰富的监控体系、日志分析、故障排查经验,熟悉SLO/SLI/SLA的定义与落地
  • 精通Go或Python,能够独立完成生产级系统平台和自动化工具开发
  • 深入理解Kubernetes及其生态系统,熟悉Ingress、ArgoCD
  • 掌握Prometheus、Grafana、Alertmanager、OpenTelemetry,能够设计并监控可靠性指标
  • 精通TCP/IP、HTTP/2、gRPC等协议;对系统性能与故障诊断有深刻理解
  • 对新技术有持续学习与实践的热情,能够带动团队技术成长
  • 实事求是、数据驱动、思维敏捷,具备优秀沟通协作能力,能够推动复杂问题在组织内落地解决

福利待遇

  • 月薪35-50K,16薪
  • 工作地点位于北京海淀区京东科技大厦

工作地址

北京海淀区京东科技大厦13