机器学习平台工程师
岗位摘要
与公司算法和框架团队深度合作,为大模型进行算法与算力深度结合的联合优化,打造超大规模高效可靠的大规模算力平台,提升平台可用性和容错性,提升训练任务的运行和开发效率;进行前瞻性技术调研且进行自主创新,保持公司在大模型系统方面的技术领先地位
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 与公司算法和框架团队深度合作,为大模型进行算法与算力深度结合的联合优化,打造超大规模高效可靠的大规模算力平台,提升平台可用性和容错性,提升训练任务的运行和开发效率
- 进行前瞻性技术调研且进行自主创新,保持公司在大模型系统方面的技术领先地位
- 负责机器学习平台的开发,支撑公司相关业务的算法生产与高效迭代
- 负责设计和实现机器学习相关的基础设施、工具链、训推产品等,并推动落地到业务中
- 负责训推任务的监控、问题监测、性能调优,降本增效
- 探索业界前沿的AI Ops相关技术,持续提升平台能力、降低算法使用成本
任职要求
- 统招研究生及以上学历,计算机科学、人工智能或相关领域专业,两年及以上相关工作经验
- 了解前沿的AI技术,有工程实践经验者优先
- 熟练掌握Linux环境下的C/C++、Go、Python语言
- 了解或使用过常用MLOps和任务调度框架之一:Kubeflow、MLFlow、Volcano,或类似自研项目
- 熟悉英伟达/AMD/国产GPU/NPU计算卡的环境配置和编程;熟悉RoCE/IB等高速网络环境配置和编程;熟悉CUDA、NCCL等计算和通信库的原理和使用;熟悉CUDA和NCCL相关问题的调研和排错者优先;具有二次开发能力者优先
- 熟悉TensorFlow/PyTorch模型的训练和部署;了解混合精度训练、分布式训练等训练加速方法优先;掌握K8s扩展功能开发者优先
- 了解Agent原理和技术进展,有工程实践经验者优先
- 了解模型推理加速的研究和技术进展,包括但不限于PD分离、AF分离等推理优化技术等
- 了解业界常用的大语言模型推理加速框架,如VLLM、SGLang、Dynamo、TensorRT-LLM等
- 了解业界常用深度学习框架,如Tensorflow/PyTorch,了解常用的分布式加速库包括但不限于:Megatron、DeepSpeed等
- 具有独立解决问题的能力,良好的团队合作精神
- 有强烈的工作责任心,较好的学习能力、沟通能力和自驱力;有良好的工作文档习惯,及时按要求撰写更新工作流程及技术文档
工作地址
北京海淀区大恒科技大厦12F
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。