基础设施工程师
岗位摘要
设计、构建和运营一个可扩展的基于Kubernetes的平台,以托管大规模AI和HPC工作负载,确保高性能、可靠性和安全性;拥有集群管理的完整生命周期,从引导和配置到全球运营,通过集成和开发必要的软件组件(包括自动化、监控和编排工具)
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 设计、构建和运营一个可扩展的基于Kubernetes的平台,以托管大规模AI和HPC工作负载,确保高性能、可靠性和安全性
- 拥有集群管理的完整生命周期,从引导和配置到全球运营,通过集成和开发必要的软件组件(包括自动化、监控和编排工具)
- 通过设计工作流程、工具(脚本、API、仪表板)和CI/CD流水线来推动基础设施创新,以优化系统可靠性、可用性和可观测性
- 倡导零信任安全模型,加强IAM、网络(VPC)和访问控制以保护平台安全
- 开发以用户为中心的功能,简化系统管理员和最终客户的操作,减少日常工作中的摩擦
- 通过严格的根本原因分析领导事件解决,防止问题复发并提高系统弹性
任职要求
- 熟练掌握软件开发(最好是Golang)并了解软件开发最佳实践
- 在基础设施工程角色(软件工程师、平台、DevOps、云...)中有成功的经验
- 深入理解Kubernetes内部原理,并具有容器化和编排工具(Docker、Kubernetes、Openstack...)的实践经验
- 熟悉基础设施即代码工具,如Terraform或CloudFormation
- 了解监控、日志记录、警报和可观测性工具(Prometheus、Grafana、ELK、Datadog...)
- 接触过高可用分布式系统和关键环境中的站点可靠性问题(问题根本原因分析、生产环境故障排除、待命轮换...)
- 有根据可靠性KPI(可观测性、警报、SLA)工作的经验
- 自我激励,能够在快节奏的初创环境中茁壮成长
福利待遇
- 加入一家塑造AI未来的先驱公司
- 成为充满活力、协作、对AI充满热情的团队一员
- 在法国和英国等主要地点工作,欧洲远程工作可考虑
- 致力于推动创新和产生有意义的影响
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。