机器学习平台研发工程师
岗位摘要
负责机器学习平台与算力基础设施的研发与演进,为模型训练、推理、评测及数据处理等流程提供稳定、高效、可扩展的平台能力;参与并主导大规模算力平台的设计与研发,覆盖资源调度、任务编排、容器与运行时管理等关键方向
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 负责机器学习平台与算力基础设施的研发与演进,为模型训练、推理、评测及数据处理等流程提供稳定、高效、可扩展的平台能力
- 参与并主导大规模算力平台的设计与研发,覆盖资源调度、任务编排、容器与运行时管理等关键方向
- 持续提升集群整体资源利用率,保障训练与推理场景的稳定运行
- 基于Kubernetes、Docker等云原生技术,参与调度器扩展及CRD/Controller等核心能力建设,支撑大规模分布式训练与推理场景
- 持续推进平台的易用性与性能优化,完善工具链与开发体验,降低算法与模型团队的使用门槛,提升整体研发效率
任职要求
- 本科及以上学历,3年及以上研发经验,有大规模容器集群或平台型系统建设经验,有千卡及以上规模集群管理或调度经验者优先
- 熟练掌握Golang,具备扎实的数据结构与算法基础,能够独立定位和解决复杂系统问题
- 熟悉Kubernetes核心机制与组件(如调度、网络、存储、Controller/CRD等),了解容器运行时及云原生相关技术体系
- 熟悉常见分布式数据处理或计算框架(如Ray/Spark/Flink等),理解其架构设计与运行模型
- 了解并行计算与高性能计算相关技术,具备OpenMP/MPI/RDMA等使用或优化经验者优先
- 熟悉至少一种主流深度学习框架及分布式训练方案,如PyTorch、DDP、DeepSpeed、FSDP等
- 具备良好的自驱力、责任感和团队协作意识,能够与算法、平台及业务团队高效协作
工作地址
北京海淀区智谱华章科技有限公司11111111111
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。