大模型系统工程师
岗位摘要
与公司算法和框架团队深度合作,为大模型进行算法与算力深度结合的联合优化;打造超大规模高效可靠的大规模算力平台,提升平台可用性和容错性;提升训练任务的运行和开发效率;进行前瞻性技术调研且进行自主创新,保持公司在大模型系统方面的技术领先地位
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 与公司算法和框架团队深度合作,为大模型进行算法与算力深度结合的联合优化
- 打造超大规模高效可靠的大规模算力平台,提升平台可用性和容错性
- 提升训练任务的运行和开发效率
- 进行前瞻性技术调研且进行自主创新,保持公司在大模型系统方面的技术领先地位
- 负责机器学习平台的开发,支撑公司相关业务的算法生产与高效迭代
- 负责设计和实现机器学习相关的基础设施、工具链、训推产品等,并推动落地到业务中
- 负责训推任务的监控、问题监测、性能调优,降本增效
- 探索业界前沿的AI Ops相关技术,持续提升平台能力、降低算法使用成本
任职要求
- 统招研究生及以上学历,计算机科学、人工智能或相关领域专业
- 了解前沿的AI技术,有工程实践经验者优先
- 熟练掌握Linux环境下的C/C++,Go,Python语言
- 了解或使用过常用MLOps和任务调度框架之一:Kubeflow,MLFlow,Volcano,或类似自研项目
- 了解Agent原理和技术进展,有工程实践经验者优先
- 了解业界常用深度学习框架,如Tensorflow/PyTorch,了解常用的分布式加速库包括但不限于:Megatron,DeepSpeed等
- 具有独立解决问题的能力,良好的团队合作精神
- 有强烈的工作责任心,较好的学习能力、沟通能力和自驱力
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。