AI算力调度平台研发工程师
岗位摘要
负责AI算力调度平台核心服务的设计、开发与持续演进,支撑模型训练、研发调试、镜像管理、数据流转等关键场景;基于Kubernetes/Volcano构建资源管理、项目配额、任务调度、队列治理、优先级与抢占等核心能力,持续提升GPU资源利用率与平台吞吐能力
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 负责AI算力调度平台核心服务的设计、开发与持续演进,支撑模型训练、研发调试、镜像管理、数据流转等关键场景
- 基于Kubernetes/Volcano构建资源管理、项目配额、任务调度、队列治理、优先级与抢占等核心能力,持续提升GPU资源利用率与平台吞吐能力
- 参与平台控制面架构设计,推动领域模型统一、接口规范升级和系统架构演进,推进REST向gRPC、同步接口向异步任务、单体能力向平台化能力升级
- 负责平台稳定性与可运维性建设,包括任务状态流转、失败重试、幂等控制、审计追踪、故障恢复及复杂线上问题排查
- 与算法、训练平台、基础设施、运维/SRE等团队协作,持续优化多集群资源治理、调度效率、平台稳定性和使用体验
任职要求
- 本科及以上学历,计算机相关专业,3年及以上后端或平台研发经验
- 熟练掌握Go语言,具备良好的工程设计与编码能力,能够独立承担核心模块设计与实现
- 熟悉Kubernetes核心原理,理解资源模型、调度链路、控制器机制;有调度系统、任务编排或平台开发经验者优先
- 熟悉PostgreSQL/MySQL、Redis等常见基础组件,理解异步任务、幂等控制、重试补偿等分布式系统常见设计
- 熟悉gRPC、protobuf、RESTful API设计,有控制面服务、平台API或架构升级经验者优先
- 具备较强的Linux问题排查、系统分析、跨团队沟通与技术推动能力
- 加分项:有GPU集群、AI Infra、训练平台、MLOps或云原生资源治理平台相关经验
- 加分项:有Volcano、Kueue、Operator、Controller或Kubernetes调度扩展相关经验
- 加分项:有资源配额、优先级抢占、多租户治理、控制面建模等平台建设经验
- 加分项:熟悉监控告警、链路追踪、成本分析等可观测体系,或有从REST向gRPC、从单体向领域化演进的实际经验
加分项
- 有 GPU 集群、AI Infra、训练平台、MLOps 或云原生资源治理平台相关经验
- 有 Volcano、Kueue、Operator、Controller 或 Kubernetes 调度扩展相关经验
- 有资源配额、优先级抢占、多租户治理、控制面建模等平台建设经验
- 熟悉监控告警、链路追踪、成本分析等可观测体系,或有从 REST 向 gRPC、从单体向领域化演进的实际经验
福利待遇
- 参与前沿AI算力调度平台建设,接触大规模GPU集群与云原生技术
- 与算法、训练平台、基础设施等顶尖团队协作,技术视野广阔
- 推动平台架构演进,从单体到平台化、从REST到gRPC,技术挑战丰富
- 平台稳定性与可运维性建设,提升系统可靠性与工程能力
- 持续优化资源治理与调度效率,直接贡献于AI基础设施性能提升
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。