返回岗位列表

Mistral AI

站点可靠性工程师

地点:英国 薪资:薪资未公开 日期:2026-01-29

岗位摘要

设计、构建和维护可扩展、高可用且容错的基础设施,以支持我们的网络服务和机器学习工作负载;确保我们的平台、推理和模型训练环境始终保持高可用性,并能在多个高性能计算集群中无缝复制工作环境

岗位职责

  • 设计、构建和维护可扩展、高可用且容错的基础设施,以支持我们的网络服务和机器学习工作负载
  • 确保我们的平台、推理和模型训练环境始终保持高可用性,并能在多个高性能计算集群中无缝复制工作环境
  • 操作系统并排查生产环境中的问题(中断、待命响应、用户管理、数据提取、基础设施扩展等)
  • 实施和改进监控、警报和事件响应系统,以确保最佳系统性能并最大限度地减少停机时间
  • 实施和维护工作流和工具(CI/CD、容器化、编排、监控、日志记录和警报系统),用于我们的客户端API和大型训练运行
  • 偶尔参与待命轮换,以响应事件并进行根本原因分析以防止未来再次发生
  • 使用Kubernetes、Flux、Terraform等工具,持续改进基础设施自动化、部署和编排
  • 与AI/ML研究人员合作,开发和实施解决方案,以实现安全且可重复的模型训练实验
  • 构建一个云无关的平台,在科学和基础设施之间提供一个抽象层
  • 设计和开发新的工作流和工具,以提高我们系统的可靠性、可用性和性能(自动化脚本、重构、新的基于API的功能、Web应用程序、仪表板等)
  • 与安全团队合作,确保基础设施遵循最佳安全实践和合规要求
  • 记录流程和程序,以确保团队内部的一致性和知识共享
  • 为开源项目、研究出版物、博客文章和会议做出贡献

任职要求

  • 计算机科学、工程或相关领域的硕士学位
  • 在DevOps/SRE岗位拥有7年以上经验
  • 在云计算和高可用分布式系统方面有丰富经验
  • 接触过关键环境中的站点可靠性问题(问题根本原因分析、生产环境故障排除、待命轮换等)
  • 有根据可靠性关键绩效指标(可观测性、警报、服务水平协议)工作的经验