返回岗位列表

月之暗面

Kubernetes 调度器开发工程师

地点:北京 薪资:35-60K 日期:2026-06-26

岗位摘要

负责Kubernetes调度器及调度插件的深度定制,设计面向AI工作负载的调度策略(GPU拓扑感知、NUMA亲和、网络亲和、RDMA域感知);攻克超大规模集群(万卡级)调度性能瓶颈,优化调度吞吐、调度延迟与决策质量,支持每秒数百Pod的调度并发

岗位职责

  • 负责Kubernetes调度器及调度插件的深度定制,设计面向AI工作负载的调度策略(GPU拓扑感知、NUMA亲和、网络亲和、RDMA域感知)
  • 攻克超大规模集群(万卡级)调度性能瓶颈,优化调度吞吐、调度延迟与决策质量,支持每秒数百Pod的调度并发
  • 构建异构资源调度体系,实现GPU/CPU/内存/高速互联网给的多维资源建模与在离线混部,提升集群整体利用率
  • 研发抢占、回填、gang-scheduling、coscheduling等高级调度能力,保障大模型训练任务与推理服务的SLO
  • 设计调度仿真与A/B测试框架,通过真实负载回放验证调度策略效果,推动调度算法持续迭代

任职要求

  • 计算机相关专业,3年以上后端/基础架构开发经验
  • 精通Go语言,深度掌握Kubernetes生态
  • 扎实的调度算法基础(资源调度、任务调度、负载均衡、装箱优化),有大规模分布式系统设计与性能优化经验
  • 熟悉GPU集群架构(NVLink/InfiniBand/RoCE),理解AI训练/推理任务对资源调度的特殊诉求
  • 责任心强,深度理解业务问题,能主动拓展能力边界
  • 具备出色的系统级问题定位能力,能通过代码级分析解决调度死锁、资源竞争、热点节点等复杂问题
  • 加分项:Kubernetes/Volcano/YARN/Mesos等调度系统社区贡献者
  • 加分项:有GPU/NPU大规模集群调度实际落地经验
  • 加分项:具备eBPF/内核调优及监控经验

加分项

  • Kubernetes/Volcano/YARN/Mesos 等调度系统社区贡献者
  • 有 GPU/NPU 大规模集群调度实际落地经验
  • 具备 eBPF/内核调优及监控经验
  • 毕女士 本周活跃

福利待遇

  • 薪资范围35-60K·14薪
  • 工作地点在北京海淀区京东科技大厦
  • 团队氛围活跃,HR直接沟通

工作地址

北京海淀区京东科技大厦13