Software Engineer Reliability San Francisco
岗位摘要
设计和实施解决方案,确保基础设施的可扩展性以满足快速增长的需求;构建和维护负载、混沌和合成测试软件,帮助开发团队提高系统可靠性;构建和维护自动化工具,简化重复任务并提高系统可靠性;构建和维护CPU/存储、GPU和网络生命周期管理平台,以提高效率和资源动态优化
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 设计和实施解决方案,确保基础设施的可扩展性以满足快速增长的需求
- 构建和维护负载、混沌和合成测试软件,帮助开发团队提高系统可靠性
- 构建和维护自动化工具,简化重复任务并提高系统可靠性
- 构建和维护CPU/存储、GPU和网络生命周期管理平台,以提高效率和资源动态优化
- 实施容错和弹性设计模式,最小化服务中断
- 制定和维护服务级别目标(SLOs)和服务级别指标(SLIs),确保系统可靠性
- 与研究、工程、产品管理和设计团队合作,将新功能和研究能力推向市场
- 参与值班轮换,响应关键事件,确保24/7系统可用性
任职要求
- 计算机科学、信息技术或相关领域的学士学位(或同等工作经验)
- 在快速发展的公司中有可靠性工程师或类似角色的经验
- 熟练掌握云基础设施
- 精通编程语言
- 有容器化技术和Kubernetes等容器编排平台的经验
- 了解Terraform或CloudFormation等基础设施即代码(IaC)工具
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。