站点可靠性工程师,前沿系统基础设施
岗位摘要
启动和扩展大型Kubernetes集群,包括自动化配置、引导和集群生命周期管理;构建软件抽象层,统一多个集群并为训练工作负载提供无缝接口;负责从裸机到固件升级的节点启动,确保大规模快速、可重复的部署
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 启动和扩展大型Kubernetes集群,包括自动化配置、引导和集群生命周期管理
- 构建软件抽象层,统一多个集群并为训练工作负载提供无缝接口
- 负责从裸机到固件升级的节点启动,确保大规模快速、可重复的部署
- 改进操作指标,如减少集群重启时间(例如从几小时缩短到几分钟)和加速固件或操作系统升级周期
- 集成网络和硬件健康系统,提供跨服务器、交换机和数据中心基础设施的端到端可靠性
- 开发监控和可观测性系统,及早发现问题并在极端负载下保持集群稳定
- 需要达到与软件工程师相同的执行水平
任职要求
- 在大型或高可用性环境中担任基础设施、系统或分布式系统工程师的经验
- 深入了解Kubernetes内部机制、集群扩展模式和容器化工作负载
- 精通云基础设施概念(计算、网络、存储、安全)以及自动化集群或数据中心操作
- 有GPU工作负载、固件管理或高性能计算背景者优先
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。