K8S研发工程师-资源调度
岗位摘要
参与研发和优化Kubernetes调度能力,包括队列、配额、优先级、抢占、公平性与资源预留;面向训练任务建设gang scheduling、拓扑感知和大规模作业协同调度能力,减少任务排队与启动失败
岗位职责
- 参与研发和优化Kubernetes调度能力,包括队列、配额、优先级、抢占、公平性与资源预留
- 面向训练任务建设gang scheduling、拓扑感知和大规模作业协同调度能力,减少任务排队与启动失败
- 面向GPU等异构资源,参与设备发现、资源建模、碎片治理和亲和性策略设计
- 参与scheduler framework插件、Operator/Controller、资源画像与调度策略平台的研发
- 建设调度仿真、回放、压测和效果评估体系,用排队时长、调度成功率、资源利用率和业务SLO验证策略
- 与训练/推理平台、K8s集群、系统底座和可观测团队协作,完成从需求识别、策略设计到上线验证的闭环
任职要求
- 计算机、软件工程、数学或相关专业本科及以上学历,具备扎实的计算机基础
- 至少熟练掌握Go、Python、C++、Java中一门语言,能够独立完成编码、调试与测试,coding是硬门槛
- 熟悉数据结构、算法、操作系统、计算机网络和分布式系统基础
- 理解进程/容器资源管理、并发控制和常见调度问题,对Kubernetes或集群调度有学习兴趣
- 具备基本的数据分析和实验意识,能够通过指标、压测或模拟验证技术判断
- 有Owner意识和协作能力,愿意深入理解训练、推理等上层workload
- 加分项:阅读过Kubernetes scheduler/scheduler framework代码,或开发过调度插件、Operator、device plugin
- 加分项:了解Volcano、Koordinator、YuniKorn、Kueue等调度系统,或有相关实践
- 加分项:做过操作系统调度、集群资源管理、组合优化、排队论或仿真项目
- 加分项:了解GPU拓扑、分布式训练、gang scheduling、弹性训练或推理服务调度
- 加分项:有开源贡献、算法竞赛、技术竞赛或可展示的系统项目
加分项
- 阅读过 Kubernetes scheduler / scheduler framework 代码,或开发过调度插件、Operator、device plugin
- 了解 Volcano、Koordinator、YuniKorn、Kueue 等调度系统,或有相关实践
- 做过操作系统调度、集群资源管理、组合优化、排队论或仿真项目
- 了解 GPU 拓扑、分布式训练、gang scheduling、弹性训练或推理服务调度
- 有开源贡献、算法竞赛、技术竞赛或可展示的系统项目
- 李明基 刚刚活跃
福利待遇
- 薪酬结构为16薪
工作地址
北京海淀区蓟门壹号8楼