返回岗位列表

MiniMax

K8S研发工程师-资源调度

地点:北京 薪资:30-60K 日期:2026-09-18

岗位摘要

参与研发和优化Kubernetes调度能力,包括队列、配额、优先级、抢占、公平性与资源预留;面向训练任务建设gang scheduling、拓扑感知和大规模作业协同调度能力,减少任务排队与启动失败

岗位职责

  • 参与研发和优化Kubernetes调度能力,包括队列、配额、优先级、抢占、公平性与资源预留
  • 面向训练任务建设gang scheduling、拓扑感知和大规模作业协同调度能力,减少任务排队与启动失败
  • 面向GPU等异构资源,参与设备发现、资源建模、碎片治理和亲和性策略设计
  • 参与scheduler framework插件、Operator/Controller、资源画像与调度策略平台的研发
  • 建设调度仿真、回放、压测和效果评估体系,用排队时长、调度成功率、资源利用率和业务SLO验证策略
  • 与训练/推理平台、K8s集群、系统底座和可观测团队协作,完成从需求识别、策略设计到上线验证的闭环

任职要求

  • 计算机、软件工程、数学或相关专业本科及以上学历,具备扎实的计算机基础
  • 至少熟练掌握Go、Python、C++、Java中一门语言,能够独立完成编码、调试与测试,coding是硬门槛
  • 熟悉数据结构、算法、操作系统、计算机网络和分布式系统基础
  • 理解进程/容器资源管理、并发控制和常见调度问题,对Kubernetes或集群调度有学习兴趣
  • 具备基本的数据分析和实验意识,能够通过指标、压测或模拟验证技术判断
  • 有Owner意识和协作能力,愿意深入理解训练、推理等上层workload
  • 加分项:阅读过Kubernetes scheduler/scheduler framework代码,或开发过调度插件、Operator、device plugin
  • 加分项:了解Volcano、Koordinator、YuniKorn、Kueue等调度系统,或有相关实践
  • 加分项:做过操作系统调度、集群资源管理、组合优化、排队论或仿真项目
  • 加分项:了解GPU拓扑、分布式训练、gang scheduling、弹性训练或推理服务调度
  • 加分项:有开源贡献、算法竞赛、技术竞赛或可展示的系统项目

加分项

  • 阅读过 Kubernetes scheduler / scheduler framework 代码,或开发过调度插件、Operator、device plugin
  • 了解 Volcano、Koordinator、YuniKorn、Kueue 等调度系统,或有相关实践
  • 做过操作系统调度、集群资源管理、组合优化、排队论或仿真项目
  • 了解 GPU 拓扑、分布式训练、gang scheduling、弹性训练或推理服务调度
  • 有开源贡献、算法竞赛、技术竞赛或可展示的系统项目
  • 李明基 刚刚活跃

福利待遇

  • 薪酬结构为16薪

工作地址

北京海淀区蓟门壹号8楼