站点可靠性工程师
岗位摘要
设计、构建和维护可扩展、高可用且容错的基础设施,以支持我们的网络服务和机器学习工作负载;确保我们的平台、推理和模型训练环境始终保持高可用性,并能在多个高性能计算集群中无缝复制工作环境
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 设计、构建和维护可扩展、高可用且容错的基础设施,以支持我们的网络服务和机器学习工作负载
- 确保我们的平台、推理和模型训练环境始终保持高可用性,并能在多个高性能计算集群中无缝复制工作环境
- 操作系统并排查生产环境中的问题(中断、待命响应、用户管理、数据提取、基础设施扩展等)
- 实施和改进监控、警报和事件响应系统,以确保最佳系统性能并最大限度地减少停机时间
- 实施和维护工作流和工具(CI/CD、容器化、编排、监控、日志记录和警报系统),用于我们的客户端API和大型训练运行
- 偶尔参与待命轮换,以响应事件并进行根本原因分析以防止未来再次发生
- 使用Kubernetes、Flux、Terraform等工具,持续改进基础设施自动化、部署和编排
- 与AI/ML研究人员合作,开发和实施解决方案,以实现安全且可重复的模型训练实验
- 构建一个云无关的平台,在科学和基础设施之间提供一个抽象层
- 设计和开发新的工作流和工具,以提高我们系统的可靠性、可用性和性能(自动化脚本、重构、新的基于API的功能、Web应用程序、仪表板等)
- 与安全团队合作,确保基础设施遵循最佳安全实践和合规要求
- 记录流程和程序,以确保团队内部的一致性和知识共享
- 为开源项目、研究出版物、博客文章和会议做出贡献
任职要求
- 计算机科学、工程或相关领域的硕士学位
- 在DevOps/SRE岗位拥有7年以上经验
- 在云计算和高可用分布式系统方面有丰富经验
- 接触过关键环境中的站点可靠性问题(问题根本原因分析、生产环境故障排除、待命轮换等)
- 有根据可靠性关键绩效指标(可观测性、警报、服务水平协议)工作的经验
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。