Infra系统工程师 - 训练平台
岗位摘要
基于Kubernetes构建稳定、可扩展的大模型训练平台,实现GPU算力资源的自动管理与高效调度;通过自动化手段,保障内部超大规模训练任务的高效运行;优化训练作业调度器,实现拓扑感知、抢占与弹性扩缩容
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 基于Kubernetes构建稳定、可扩展的大模型训练平台,实现GPU算力资源的自动管理与高效调度
- 通过自动化手段,保障内部超大规模训练任务的高效运行
- 优化训练作业调度器,实现拓扑感知、抢占与弹性扩缩容
- 跟进云原生领域前沿技术,优化云原生异构资源编排
任职要求
- 拥有良好的代码开发习惯,熟练掌握Golang,具备基础的全栈能力,有代码洁癖者优先
- 精通K8s核心组件(Scheduler, Kubelet, Operator),有生产环境下的大规模集群运维或开发经验
- 掌握可观测性理念,熟悉Prometheus/OpenTelemetry
- 具备快速学习能力,能够独立思考和解决问题
- 具备良好的团队合作精神和沟通能力
福利待遇
- 薪资25-50K·16薪,竞争力薪酬福利
- 参与前沿大模型训练平台建设,与顶尖技术团队共事
- 技术氛围浓厚,持续跟进云原生领域前沿技术
工作地址
北京海淀区京东科技大厦13F
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。