基础设施可靠性工程师
岗位摘要
定义并执行基础设施可靠性和可扩展性的技术战略;构建和维护自动化、可观测性和控制平面,以确保跨数据中心、混合云/本地环境的健康运行;领导事件响应、深入根本原因分析和事后复盘,推动实际修复
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 定义并执行基础设施可靠性和可扩展性的技术战略
- 构建和维护自动化、可观测性和控制平面,以确保跨数据中心、混合云/本地环境的健康运行
- 领导事件响应、深入根本原因分析和事后复盘,推动实际修复
- 识别、检测并消除系统性故障模式(容量、网络、硬件、存储、软件)
- 使用Python和Rust设计和实施高杠杆率的系统软件(守护进程、控制器、调度器等)
- 推动大规模GPU集群运营和AI工作负载可靠性的技术前沿
任职要求
- 5年以上生产软件交付和/或大规模分布式基础设施运营经验
- Linux系统、TCP/IP网络和系统编程的专家级知识
- 强大的编码技能,具备Rust(强烈优先)以及Python、Go或C++中至少一种语言的生产经验
- 在本地和云环境(有GCP经验者优先)中具有大规模分布式系统的深厚经验
- 具备容器编排(Kubernetes、Borg类系统或自定义调度器)、容器运行时和基础设施即代码(Puppet/Chef/Ansible/Terraform)的实践专业知识
- 深刻理解分布式系统中的常见故障模式及其缓解方法(爆炸半径控制)
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。