返回岗位列表

Cognition

站点可靠性工程师

地点:美国 薪资:$260,000-$300,000 日期:2026-07-20

岗位摘要

定义并拥有Devin和Windsurf的SLO、SLI和错误预算,构建监控、告警和可观测性系统,实时反映服务健康状况;以速度和清晰度领导事件响应,进行无指责的事后分析,将故障转化为持久改进,并构建值班手册和工具

岗位职责

  • 定义并拥有Devin和Windsurf的SLO、SLI和错误预算,构建监控、告警和可观测性系统,实时反映服务健康状况
  • 以速度和清晰度领导事件响应,进行无指责的事后分析,将故障转化为持久改进,并构建值班手册和工具
  • 拥有部署管道、发布基础设施和内部开发者工具,使团队能够快速交付而不破坏系统,系统性地减少琐事
  • 通过代码管理云基础设施,构建可复现、可审计、版本控制的环境,消除配置漂移
  • 建模增长、预测资源需求,确保基础设施领先于需求,并在用户感知之前分析和改进系统性能
  • 将安全视为可靠性要求,确保配置错误、漏洞和访问故障得到与故障同等紧急的处理和修复
  • 与产品和工程团队紧密合作,从设计阶段就将可靠性融入产品,在架构评审中识别单点故障

任职要求

  • 具有大规模生产系统运行经验,熟悉SLO、错误预算、值班轮换和事件指挥
  • 扎实的软件工程基础,能够编写实际代码而不仅仅是配置工具
  • 精通云基础设施(AWS、GCP或Azure)、容器编排(Kubernetes)和基础设施即代码(Terraform或同等工具)
  • 具有为快速迭代的产品团队构建和拥有CI/CD管道及部署基础设施的经验
  • 强大的可观测性直觉,知道如何对系统进行仪表化、构建有用的仪表盘和设计能捕捉信号而不产生噪音的告警
  • 有系统性地通过自动化减少琐事的记录,而不仅仅是绕过问题
  • 能够端到端地拥有事件处理:检测、分类、缓解、解决和事后分析
  • 具有足够的产品同理心,能从用户角度而非仅基础设施角度理解可靠性的含义
  • 有面向开发者的产品或平台经验者优先

福利待遇

  • 加入一个人才密度极高的团队,与顶尖的竞争性程序员、前创始人和AI前沿公司领导者共事
  • 参与构建首个AI软件工程师Devin,解决世界上最大的问题之一
  • 在快速发展的AI初创公司中,拥有从零开始构建和影响关键基础设施的机会
  • 与产品和工程团队紧密合作,将可靠性融入产品开发,拥有高度的自主权和影响力