高级SRE工程师
岗位摘要
重构报警体系,建立分级降噪机制,实现故障分钟级发现与精准定位;建立标准化On-call手册与应急流程,引入Chaos Engineering主动暴露系统脆弱点;主导故障复盘(Postmortem),推动根因修复与改进措施落地,确保同类故障不重复发生
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 重构报警体系,建立分级降噪机制,实现故障分钟级发现与精准定位;建立标准化On-call手册与应急流程,引入Chaos Engineering主动暴露系统脆弱点
- 主导故障复盘(Postmortem),推动根因修复与改进措施落地,确保同类故障不重复发生
- 设计并落地安全变更框架(灰度发布、自动回滚、变更可观测性),建立变更窗口管理与自动化测试卡点
- 与研发团队共建统一Telemetry标准(Metrics/Logs/Traces),基于业务场景定义SLO/SLI,建设监控Dashboard
- 治理现有指标债务,消除无效报警,构建从业务指标到基础设施指标的全链路可观测性
- 开发内部平台或工具(自动化诊断、容量巡检、配置管理),将高频人工操作转化为自助服务
- 维护基于Kubernetes的PaaS底座能力,持续优化资源利用率与成本效率
- 参与需求评审与架构设计,从可靠性、可维护性角度提出专业建议
任职要求
- 3-5年以上SRE、DevOps或Backend Engineering经验,有生产环境大规模分布式系统运维背景
- 扎实的工程能力:熟悉Go或Python,能独立开发自动化工具、Operator或内部平台,熟悉GitOps实践
- 深入理解Kubernetes生态(Operators、CRD、CNI/CRI),有生产级集群运维与排障经验
- 熟练使用Prometheus、Grafana、ELK/Loki、Jaeger/Tempo等工具,具备从0到1构建监控体系的经验
- 精通Linux内核、TCP/IP、HTTP、gRPC,具备扎实的网络与系统性能诊断能力
- 优秀的跨团队沟通能力,既能深入技术细节Debug,也能推动流程改进在组织内落地
- 具备"代码即基础设施"的自动化思维
- 加分项:头部AI厂商Code Plan订阅者、有漂亮的终端、有从混乱到秩序的SRE建设经验、熟悉eBPF/Service Mesh、具备多云或混合云架构经验
加分项
- 头部 AI 厂商 Code Plan 订阅者
- 有一个漂亮的终端
- 有从混乱到秩序的 SRE 建设经验(如主导过报警治理、发布流程重构、On
- call 体系搭建)
- 熟悉 eBPF、Service Mesh(Istio/Linkerd)等云原生前沿技术
- 我们能提供什么
- 直接的业务影响力:你的改进将立即作用于核心业务,解决真实且紧迫的痛点
- 技术深度与广度的平衡:既能深入 Kubernetes、可观测性等技术栈,又能参与架构设计、流程定义等高层次工作
- 建设而非维护:我们处于快速成长期,你需要建立标准而非遵守过时的标准,有充足的发挥空间和资源支持
- 与优秀的工程团队协作:我们是一群务实、对技术有追求的工程师,相信你能在这里找到技术共鸣
- 陈欣昊 刚刚活跃
- 月之暗面 · 部门负责人
福利待遇
- 直接的业务影响力:改进将立即作用于核心业务,解决真实且紧迫的痛点
- 技术深度与广度的平衡:既能深入Kubernetes、可观测性等技术栈,又能参与架构设计、流程定义等高层次工作
- 建设而非维护:处于快速成长期,需要建立标准而非遵守过时标准,有充足的发挥空间和资源支持
- 与优秀的工程团队协作:与务实、对技术有追求的工程师共同工作
工作地址
北京海淀区京东科技大厦13F
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。