返回岗位列表

阶跃星辰

大模型系统与机器学习平台开发工程师

地点:北京 薪资:薪资未公开 日期:2026-01-29

岗位摘要

与公司算法和框架团队深度合作,为大模型进行算法与算力深度结合的联合优化;打造超大规模高效可靠的大规模算力平台,提升平台可用性、容错性及训练任务的运行和开发效率;进行前瞻性技术调研并进行自主创新,保持公司在大模型系统方面的技术领先地位

岗位职责

  • 与公司算法和框架团队深度合作,为大模型进行算法与算力深度结合的联合优化
  • 打造超大规模高效可靠的大规模算力平台,提升平台可用性、容错性及训练任务的运行和开发效率
  • 进行前瞻性技术调研并进行自主创新,保持公司在大模型系统方面的技术领先地位
  • 负责机器学习平台的开发,支撑公司相关业务的算法生产与高效迭代
  • 负责设计和实现机器学习相关的基础设施、工具链、训推产品等,并推动落地到业务中
  • 负责训推任务的监控、问题监测、性能调优,实现降本增效
  • 探索业界前沿的AI Ops相关技术,持续提升平台能力、降低算法使用成本

任职要求

  • 统招研究生及以上学历,计算机科学、人工智能或相关领域专业
  • 了解前沿的AI技术,有工程实践经验者优先
  • 熟练掌握Linux环境下的C/C++、Go、Python语言
  • 了解或使用过常用MLOps和任务调度框架之一:Kubeflow、MLFlow、Volcano,或类似自研项目
  • 熟悉英伟达/AMD/国产GPU/NPU计算卡的环境配置和编程
  • 熟悉RoCE/IB等高速网络环境配置和编程
  • 熟悉CUDA、NCCL等计算和通信库的原理和使用
  • 熟悉CUDA和NCCL相关问题的调研和排错者优先;具有二次开发能力者优先
  • 熟悉TensorFlow/PyTorch模型的训练和部署;掌握K8s扩展功能开发者优先
  • 了解Agent原理和技术进展,有工程实践经验者优先
  • 了解业界常用深度学习框架,如Tensorflow/PyTorch,了解常用的分布式加速库包括但不限于:Megatron、DeepSpeed等
  • 具有独立解决问题的能力,良好的团队合作精神
  • 有强烈的工作责任心,较好的学习能力、沟通能力和自驱力
  • 有良好的工作文档习惯,及时按要求撰写更新工作流程及技术文档