数据中心系统软件工程师
岗位摘要
维护并提升xAI本地和云端数据中心环境(包括用于AI训练的高密度GPU集群)的可靠性和正常运行时间;设计、实施和管理监控、日志记录与告警系统(例如Prometheus、Grafana、PagerDuty)
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 维护并提升xAI本地和云端数据中心环境(包括用于AI训练的高密度GPU集群)的可靠性和正常运行时间
- 设计、实施和管理监控、日志记录与告警系统(例如Prometheus、Grafana、PagerDuty)
- 开发和维护基础设施即代码(Pulumi、Terraform)以及持续部署流水线(Buildkite、ArgoCD)
- 参与值班轮换,响应事件,进行根本原因分析,并推动事后复盘流程
- 分析系统性能,预测容量需求,并针对大规模AI/ML工作负载优化资源利用率
- 与硬件、网络和软件工程团队合作,设计和实施弹性、可扩展的解决方案
任职要求
- 计算机科学、工程或相关技术领域的学士学位,或具备同等实践经验
- 在Linux/Unix系统管理、网络和脚本语言(如Python、Bash)方面拥有丰富的经验
- 具备大规模分布式系统、云基础设施(AWS、GCP、Azure)或高性能计算(HPC)环境的实际经验
- 具备监控和可观测性工具(Prometheus、Grafana、ELK stack)的经验
- 出色的解决问题能力,能够在压力下进行调试和故障排除
- 强大的沟通和协作能力,能够与跨职能团队有效合作
福利待遇
- 有竞争力的薪酬和股权方案
- 全面的医疗、牙科和视力保险
- 灵活的休假政策和无限制带薪休假
- 餐饮和零食供应
- 健身和健康津贴
- 学习与发展资源
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。