软件工程师,基础设施可靠性
岗位摘要
设计、构建和运营工程中使用的可靠且高性能的系统;识别并修复性能瓶颈和低效问题,确保基础设施能够扩展到下一个数量级;深入解决复杂问题;持续改进自动化以减少手动工作,提升内部工具和开发者体验
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 设计、构建和运营工程中使用的可靠且高性能的系统
- 识别并修复性能瓶颈和低效问题,确保基础设施能够扩展到下一个数量级
- 深入解决复杂问题
- 持续改进自动化以减少手动工作,提升内部工具和开发者体验
- 参与事件响应、事后分析,并围绕系统可靠性和可扩展性制定最佳实践
任职要求
- 具备分布式系统原理的深入理解,并有构建和运营可扩展、可靠系统的实际经验
- 对性能和优化有敏锐的眼光,能够从复杂的全球分布式系统中榨取最大性能
- 有大规模操作Kubernetes等编排系统的经验,并能构建云平台的抽象层
- 熟悉Linux环境,以及Kubernetes、Terraform、CI/CD流水线和现代可观测性工具
- 有与跨职能团队合作的经验,确保在设计和开发新功能和服务时考虑可靠性和可扩展性
- 态度谦逊,乐于帮助同事,愿意为团队成功付出一切努力
- 能够端到端地解决问题,并愿意学习任何缺失的知识以完成任务
- 能够适应模糊性和快速变化的环境
- 4年以上相关行业经验,其中2年以上作为工程师或技术负责人领导大规模复杂项目或团队
- 对大规模分布式系统充满热情,专注于可靠性、可扩展性、安全性和持续改进
- 在快节奏、快速扩展的公司中有可靠性工程师、生产工程师或类似角色的实际经验
- 熟练掌握云基础设施(如AWS、GCP、Azure)和IaC工具(如Terraform),以及编程/脚本语言
- 有容器化技术和容器编排平台(如Kubernetes)的经验
- 有微服务架构和服务网格技术的经验
- 了解云环境中的安全最佳实践
- 对分布式系统、网络和数据库技术有深入理解
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。