机器学习平台工程师(K8s / GPU 基础设施)
岗位摘要
设计并维护支撑大模型训练/推理的Kubernetes平台,负责集群生命周期管理、节点治理、网络/存储CSI插件及自动化运维体系;深度优化容器镜像分发,将千节点集群的Pod启动时间压缩到秒级
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 设计并维护支撑大模型训练/推理的Kubernetes平台,负责集群生命周期管理、节点治理、网络/存储CSI插件及自动化运维体系
- 深度优化容器镜像分发,将千节点集群的Pod启动时间压缩到秒级
- 研发平台化工具链(CLI/SDK/Web Console),覆盖实验管理、模型管理、数据集编排、工作流流水线(MLOps),降低算法工程师的使用门槛
- 建设集群可观测性与成本治理体系,通过eBPF/Prometheus实现训练任务级资源画像与异常诊断
任职要求
- 计算机相关专业,3年以上分布式系统或基础设施开发经验
- 精通Go,具备扎实的操作系统、网络、存储基础
- 深度掌握Kubernetes生态(Scheduler/Operator/CRD/CSI/CNI),有500+节点生产集群运维或二次开发经验
- 熟悉Linux容器技术(containerd/runc/cgroup/seccomp),具备GPU服务器集群运维经验
- 加分项:有K8s调度器(Scheduler Framework / Volcano / Koordinator)源码级开发或社区贡献
- 加分项:熟悉GPU拓扑感知调度、MIG/MPS虚拟化、显存/算力分时复用
- 加分项:具备大规模集群(1000+节点)自动化运维、故障自愈、多地域容灾经验
加分项
- 有 K8s 调度器(Scheduler Framework / Volcano / Koordinator)源码级开发或社区贡献
- 熟悉 GPU 拓扑感知调度、MIG/MPS 虚拟化、显存/算力分时复用
- 具备大规模集群(1000+ 节点)自动化运维、故障自愈、多地域容灾经验
福利待遇
- 薪资范围:25-50K·16薪
- 工作地点:北京海淀区京东科技大厦13层
- 团队氛围良好,有专业招聘者对接
工作地址
北京海淀区京东科技大厦13层
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。