返回岗位列表

月之暗面

高级 SRE 工程师

地点:北京 薪资:薪资未公开 日期:2026-07-20

岗位摘要

构建可持续的 On-call 与应急响应体系,重构报警体系,建立分级降噪机制,实现故障的分钟级发现与精准定位;建立标准化的 On-call 手册与应急流程,引入混沌工程主动暴露系统脆弱点,主导故障复盘并推动根因修复

岗位职责

  • 构建可持续的 On-call 与应急响应体系,重构报警体系,建立分级降噪机制,实现故障的分钟级发现与精准定位
  • 建立标准化的 On-call 手册与应急流程,引入混沌工程主动暴露系统脆弱点,主导故障复盘并推动根因修复
  • 设计并落地安全变更框架,包括灰度发布、自动回滚和变更可观测性,降低变更导致故障的概率
  • 建立变更窗口管理、自动化测试卡点与发布流水线优化,确保研发团队快速且安全地迭代
  • 与研发团队共建统一的遥测标准,基于业务场景定义 SLO/SLI,建设符合业务特性的监控仪表盘
  • 治理现有指标债务,消除无效报警,构建从业务指标到基础设施指标的全链路可观测性
  • 开发内部平台或工具,将高频人工操作转化为自助服务,维护基于 Kubernetes 的 PaaS 底座能力
  • 沉淀 SRE 最佳实践文档与工具库,推动可靠性文化在组织内的标准化
  • 参与需求评审与架构设计,从可靠性和可维护性角度提出专业建议,帮助业务团队早期规避技术债务

任职要求

  • 3-5 年以上 SRE、DevOps 或后端工程经验,具备生产环境大规模分布式系统运维背景
  • 精通 Go 或 Python,能独立开发自动化工具、Operator 或内部平台,熟悉 GitOps 实践
  • 深入理解 Kubernetes 生态,包括 Operators、CRD、CNI/CRI,有生产级集群运维与排障经验
  • 熟练使用 Prometheus、Grafana、ELK/Loki、Jaeger/Tempo 等可观测性工具,具备从0到1构建监控体系的经验
  • 精通 Linux 内核、TCP/IP、HTTP、gRPC,具备扎实的网络与系统性能诊断能力
  • 优秀的跨团队沟通能力,既能深入技术细节调试,也能推动流程改进在组织内落地,具备代码即基础设施的自动化思维
  • 加分项:头部 AI 厂商 Code Plan 订阅者,拥有漂亮的终端,有从混乱到秩序的 SRE 建设经验
  • 加分项:熟悉 eBPF、Service Mesh 等云原生前沿技术,具备多云或混合云架构经验

加分项

  • 头部 AI厂商 Code Plan订阅者
  • 有一个漂亮的终端
  • 有从混乱到秩序的 SRE建设经验(如主导过报警治理、发布流程重构、On
  • call 体系搭建)
  • 熟悉 eBPF、Service Mesh (Istio/Linkerd) 等云原生前沿技术
  • 具备多云(AWS/GCP/阿里云)或混合云架构经验
  • 我们能提供什么直接的业务影响力:你的改进将立即作用于核心业务,解决真实且紧迫的痛点
  • 技术深度与广度的平衡:既能深入 Kubernetes、可观测性等技术栈,又能参与架构设计、流程定义等高层次工作
  • 建设而非维护:我们处于快速成长期,你需要建立标准而非遵守过时的标准,有充足的发挥空间和资源支持
  • 与优秀的工程团队协作:我们是一群务实、对技术有追求的工程师,相信你能在这里找到技术共鸣
  • 为什么我们需要你
  • 我们需要一位 Senior SRE 来完成关键的战略转向:将可靠性工作从“事后救火”推进到“事前设计”。你的核心使命是建立三道防线——可预测的发布工程、信号清晰的观测体系、持续进化的应急响应机制。这是一份高自由度、高可见度的角色。你将直接向工程负责人汇报,拥有跨团队推动技术决策的权限。成功意味着你建立的 SRE 实践将成为公司下一阶段增长的 engineering backbone
  • 你将负责什么
  • 构建可持续的 On-call 与应急响应体系
  • 重构现有报警体系,建立分级降噪机制(解决 P0 淹没问题),实现故障的分钟级发现与精准定位
  • 建立标准化的 On-call 手册与应急流程(Runbook),引入 Chaos Engineering 主动暴露系统脆弱点
  • 主导故障复盘(Postmortem),推动根因修复与改进措施落地,确保同类故障不重复发生
  • 发布工程与变更风险管理
  • 针对高频上线场景,设计并落地安全变更框架:灰度发布、自动回滚、变更可观测性,将“变更导致故障”的概率降至最低
  • 建立变更窗口管理、自动化测试卡点与发布流水线优化,让研发能够“快且安全”地迭代
  • 可观测性体系与 Telemetry 共建
  • 与研发团队共建统一的 Telemetry 标准(Metrics/Logs/Traces),基于业务场景定义清晰的 SLO/SLI,建设符合业务特性的监控 Dashboard
  • 治理现有指标债务,消除无效报警,构建从业务指标到基础设施指标的全链路可观测性
  • 工程效率基建
  • 用软件工程手段解决重复运维问题:开发内部平台或工具(如自动化诊断、容量巡检、配置管理),将高频人工操作转化为自助服务
  • 维护基于 Kubernetes 的 PaaS 底座能力,持续优化资源利用率与成本效率
  • 沉淀 SRE 最佳实践文档与工具库,推动可靠性文化在组织内的标准化
  • 参与需求评审与架构设计,从可靠性、可维护性角度提出专业建议,帮助业务团队在早期规避技术债务
  • 我们期待的你
  • 有从混乱到秩序的 SRE建设经验(如主导过报警治理、发布流程重构、On-call 体系搭建)
  • 我们能提供什么
  • 直接的业务影响力:你的改进将立即作用于核心业务,解决真实且紧迫的痛点
  • 允许6个月内投递3个职位,请选择适合的职位进行投递

福利待遇

  • 直接的业务影响力:你的改进将立即作用于核心业务,解决真实且紧迫的痛点
  • 技术深度与广度的平衡:既能深入 Kubernetes、可观测性等技术栈,又能参与架构设计、流程定义等高层次工作
  • 建设而非维护:处于快速成长期,你需要建立标准而非遵守过时的标准,有充足的发挥空间和资源支持
  • 与优秀的工程团队协作:与一群务实、对技术有追求的工程师共事,找到技术共鸣