返回岗位列表

面壁智能

AI算力调度平台研发工程师

地点:北京 薪资:薪资未公开 日期:2026-07-20

岗位摘要

负责AI算力调度平台核心服务的设计、开发与持续演进,支撑模型训练、研发调试、镜像管理、数据流转等关键场景;基于Kubernetes/Volcano构建资源管理、项目配额、任务调度、队列治理、优先级与抢占等核心能力,持续提升GPU资源利用率与平台吞吐能力

岗位职责

  • 负责AI算力调度平台核心服务的设计、开发与持续演进,支撑模型训练、研发调试、镜像管理、数据流转等关键场景
  • 基于Kubernetes/Volcano构建资源管理、项目配额、任务调度、队列治理、优先级与抢占等核心能力,持续提升GPU资源利用率与平台吞吐能力
  • 参与平台控制面架构设计,推动领域模型统一、接口规范升级和系统架构演进,推进REST向gRPC、同步接口向异步任务、单体能力向平台化能力升级
  • 负责平台稳定性与可运维性建设,包括任务状态流转、失败重试、幂等控制、审计追踪、故障恢复及复杂线上问题排查
  • 与算法、训练平台、基础设施、运维/SRE等团队协作,持续优化多集群资源治理、调度效率、平台稳定性和使用体验

任职要求

  • 本科及以上学历,计算机相关专业,3年及以上后端或平台研发经验
  • 熟练掌握Go语言,具备良好的工程设计与编码能力,能够独立承担核心模块设计与实现
  • 熟悉Kubernetes核心原理,理解资源模型、调度链路、控制器机制;有调度系统、任务编排或平台开发经验者优先
  • 熟悉PostgreSQL/MySQL、Redis等常见基础组件,理解异步任务、幂等控制、重试补偿等分布式系统常见设计
  • 熟悉gRPC、protobuf、RESTful API设计,有控制面服务、平台API或架构升级经验者优先
  • 具备较强的Linux问题排查、系统分析、跨团队沟通与技术推动能力
  • 加分项:有GPU集群、AI Infra、训练平台、MLOps或云原生资源治理平台相关经验
  • 加分项:有Volcano、Kueue、Operator、Controller或Kubernetes调度扩展相关经验
  • 加分项:有资源配额、优先级抢占、多租户治理、控制面建模等平台建设经验
  • 加分项:熟悉监控告警、链路追踪、成本分析等可观测体系,或有从REST向gRPC、从单体向领域化演进的实际经验

加分项

  • 有 GPU 集群、AI Infra、训练平台、MLOps 或云原生资源治理平台相关经验
  • 有 Volcano、Kueue、Operator、Controller 或 Kubernetes 调度扩展相关经验
  • 有资源配额、优先级抢占、多租户治理、控制面建模等平台建设经验
  • 熟悉监控告警、链路追踪、成本分析等可观测体系,或有从 REST 向 gRPC、从单体向领域化演进的实际经验

福利待遇

  • 参与前沿AI算力调度平台建设,接触大规模GPU集群与云原生技术
  • 与算法、训练平台、基础设施等顶尖团队协作,技术视野广阔
  • 推动平台架构演进,从单体到平台化、从REST到gRPC,技术挑战丰富
  • 平台稳定性与可运维性建设,提升系统可靠性与工程能力
  • 持续优化资源治理与调度效率,直接贡献于AI基础设施性能提升