站点可靠性工程师
岗位摘要
定义并拥有Devin和Windsurf的SLO、SLI和错误预算,构建监控、告警和可观测性系统,实时反映服务健康状况;以速度和清晰度领导事件响应,进行无指责的事后分析,将故障转化为持久改进,并构建值班手册和工具
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 定义并拥有Devin和Windsurf的SLO、SLI和错误预算,构建监控、告警和可观测性系统,实时反映服务健康状况
- 以速度和清晰度领导事件响应,进行无指责的事后分析,将故障转化为持久改进,并构建值班手册和工具
- 拥有部署管道、发布基础设施和内部开发者工具,使团队能够快速交付而不破坏系统,系统性地减少琐事
- 通过代码管理云基础设施,构建可复现、可审计、版本控制的环境,消除配置漂移
- 建模增长、预测资源需求,确保基础设施领先于需求,并在用户感知之前分析和改进系统性能
- 将安全视为可靠性要求,确保配置错误、漏洞和访问故障得到与故障同等紧急的处理和修复
- 与产品和工程团队紧密合作,从设计阶段就将可靠性融入产品,在架构评审中识别单点故障
任职要求
- 具有大规模生产系统运行经验,熟悉SLO、错误预算、值班轮换和事件指挥
- 扎实的软件工程基础,能够编写实际代码而不仅仅是配置工具
- 精通云基础设施(AWS、GCP或Azure)、容器编排(Kubernetes)和基础设施即代码(Terraform或同等工具)
- 具有为快速迭代的产品团队构建和拥有CI/CD管道及部署基础设施的经验
- 强大的可观测性直觉,知道如何对系统进行仪表化、构建有用的仪表盘和设计能捕捉信号而不产生噪音的告警
- 有系统性地通过自动化减少琐事的记录,而不仅仅是绕过问题
- 能够端到端地拥有事件处理:检测、分类、缓解、解决和事后分析
- 具有足够的产品同理心,能从用户角度而非仅基础设施角度理解可靠性的含义
- 有面向开发者的产品或平台经验者优先
福利待遇
- 加入一个人才密度极高的团队,与顶尖的竞争性程序员、前创始人和AI前沿公司领导者共事
- 参与构建首个AI软件工程师Devin,解决世界上最大的问题之一
- 在快速发展的AI初创公司中,拥有从零开始构建和影响关键基础设施的机会
- 与产品和工程团队紧密合作,将可靠性融入产品开发,拥有高度的自主权和影响力
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。