可靠性工程师
岗位摘要
设计和实施解决方案,确保基础设施的可扩展性以满足快速增长的需求;构建和维护负载、混沌及合成测试软件,供开发团队使用,以提升其设计和运营系统的可靠性;构建和维护自动化工具,以简化重复性任务并提高系统可靠性
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 设计和实施解决方案,确保基础设施的可扩展性以满足快速增长的需求
- 构建和维护负载、混沌及合成测试软件,供开发团队使用,以提升其设计和运营系统的可靠性
- 构建和维护自动化工具,以简化重复性任务并提高系统可靠性
- 构建和维护CPU/存储、GPU及网络生命周期管理平台,以提高效率、明确责任并支持资源的动态优化
- 实施容错和弹性设计模式,以最小化服务中断
- 制定和维护服务级别目标(SLO)与服务级别指标(SLI),以衡量和确保系统可靠性
- 与研究人员、工程师、产品经理和设计师合作,将新功能和研究能力推向世界
- 参与待命轮班,响应关键事件并确保系统7x24小时可用性
任职要求
- 拥有通过出色的工具和系统赋能同事、加速工程可靠性的良好记录
- 具备谦逊的态度、乐于帮助同事的意愿,以及为团队成功不惜一切代价的决心
- 能够端到端地负责问题,并愿意学习任何所需知识以完成任务
- 乐于寻找并解决系统中的瓶颈和性能改进领域
- 运用基础设施即代码(IaC)原则来自动化基础设施配置和配置管理
- 具备与跨职能团队协作的经验,以确保可靠性和可扩展性被纳入考量
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。