前沿系统工程师
岗位摘要
启动和扩展大型Kubernetes集群,包括自动化配置、引导和集群生命周期管理;构建软件抽象层,统一多个集群,为训练工作负载提供无缝接口;负责从裸机到固件升级的节点启动,确保大规模快速、可重复的部署
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 启动和扩展大型Kubernetes集群,包括自动化配置、引导和集群生命周期管理
- 构建软件抽象层,统一多个集群,为训练工作负载提供无缝接口
- 负责从裸机到固件升级的节点启动,确保大规模快速、可重复的部署
- 改进运营指标,例如减少集群重启时间(例如,从几小时缩短到几分钟)并加速固件或操作系统升级周期
- 集成网络和硬件健康系统,确保服务器、交换机和数据中心基础设施的端到端可靠性
- 开发监控和可观测性系统,及早发现问题,并在极端负载下保持集群稳定
- 需要达到与软件工程师同等的执行水平
任职要求
- 在高增长或超大规模环境中,拥有操作或扩展Kubernetes集群或类似容器编排系统的深厚经验
- 具备强大的编程或脚本技能(Python、Go或类似语言),并熟悉Terraform或CloudFormation等基础设施即代码工具
- 熟悉裸机Linux环境、GPU硬件和大规模网络
- 乐于解决快速变化、高影响力的运营问题,并构建自动化以消除手动工作
- 能够在细致的工程设计与保持关键任务系统运行的紧迫性之间取得平衡
- 具备在大型或高可用性环境中担任基础设施、系统或分布式系统工程师的经验
- 拥有强大的知识背景
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。