返回岗位列表

阶跃星辰

机器学习平台工程师

地点:北京 薪资:30-60K 日期:2026-03-03

岗位摘要

与公司算法和框架团队深度合作,为大模型进行算法与算力深度结合的联合优化,打造超大规模高效可靠的大规模算力平台,提升平台可用性和容错性,提升训练任务的运行和开发效率;进行前瞻性技术调研且进行自主创新,保持公司在大模型系统方面的技术领先地位

岗位职责

  • 与公司算法和框架团队深度合作,为大模型进行算法与算力深度结合的联合优化,打造超大规模高效可靠的大规模算力平台,提升平台可用性和容错性,提升训练任务的运行和开发效率
  • 进行前瞻性技术调研且进行自主创新,保持公司在大模型系统方面的技术领先地位
  • 负责机器学习平台的开发,支撑公司相关业务的算法生产与高效迭代
  • 负责设计和实现机器学习相关的基础设施、工具链、训推产品等,并推动落地到业务中
  • 负责训推任务的监控、问题监测、性能调优,降本增效
  • 探索业界前沿的AI Ops相关技术,持续提升平台能力、降低算法使用成本

任职要求

  • 统招研究生及以上学历,计算机科学、人工智能或相关领域专业,两年及以上相关工作经验
  • 了解前沿的AI技术,有工程实践经验者优先
  • 熟练掌握Linux环境下的C/C++、Go、Python语言
  • 了解或使用过常用MLOps和任务调度框架之一:Kubeflow、MLFlow、Volcano,或类似自研项目
  • 熟悉英伟达/AMD/国产GPU/NPU计算卡的环境配置和编程;熟悉RoCE/IB等高速网络环境配置和编程;熟悉CUDA、NCCL等计算和通信库的原理和使用;熟悉CUDA和NCCL相关问题的调研和排错者优先;具有二次开发能力者优先
  • 熟悉TensorFlow/PyTorch模型的训练和部署;了解混合精度训练、分布式训练等训练加速方法优先;掌握K8s扩展功能开发者优先
  • 了解Agent原理和技术进展,有工程实践经验者优先
  • 了解模型推理加速的研究和技术进展,包括但不限于PD分离、AF分离等推理优化技术等
  • 了解业界常用的大语言模型推理加速框架,如VLLM、SGLang、Dynamo、TensorRT-LLM等
  • 了解业界常用深度学习框架,如Tensorflow/PyTorch,了解常用的分布式加速库包括但不限于:Megatron、DeepSpeed等
  • 具有独立解决问题的能力,良好的团队合作精神
  • 有强烈的工作责任心,较好的学习能力、沟通能力和自驱力;有良好的工作文档习惯,及时按要求撰写更新工作流程及技术文档

工作地址

北京海淀区大恒科技大厦12F