返回岗位列表

阶跃星辰

大模型训练优化工程师

地点:北京 薪资:30-60K 日期:2026-06-26

岗位摘要

负责大语言模型(LLM)训练基础设施的设计与开发,包括大规模数据加载优化、训练数据构建和数据处理Pipeline;负责大规模训练数据格式与存储方案设计(如WebDataset/Sharded Dataset等),优化数据IO和分布式训练场景下的数据吞吐能力

岗位职责

  • 负责大语言模型(LLM)训练基础设施的设计与开发,包括大规模数据加载优化、训练数据构建和数据处理Pipeline
  • 负责大规模训练数据格式与存储方案设计(如WebDataset/Sharded Dataset等),优化数据IO和分布式训练场景下的数据吞吐能力
  • 负责模型工具链建设,包括模型格式转换、权重切分与合并、跨框架模型迁移(如HuggingFace/Megatron等)
  • 参与大模型训练系统开发与优化,支持预训练、SFT、RLHF等不同训练流程,提高训练效率和GPU利用率
  • 参与大模型推理基础设施开发,建设高性能推理平台,支持在线推理服务
  • 跟踪大模型训练与推理领域的前沿技术(如高效数据管道、训练加速等),持续推动系统能力升级

任职要求

  • 计算机科学、人工智能、软件工程或相关专业,硕士及以上学历,3-5年AI Infra相关工作经验
  • 精通Python/Go/C++中至少两门语言,能编写高质量代码
  • 有良好的算法和数理基础,熟悉常用算法
  • 熟练掌握深度学习框架(PyTorch)、分布式训练技术(5D并行)及相关框架(Megatron-LM),有实际模型训练经验,对LLM训练的各个环节尤其是dataloader、checkpoint等模块有深入研究
  • 熟悉使用分布式计算系统如Ray、Spark,有实际使用和应用调优的经验
  • 擅长性能优化,对性能和稳定性有极致追求,能在压力下快速定位性能瓶颈并给出优化方案
  • 具备良好的问题分析与解决能力,良好的团队合作精神和沟通能力,能编写高质量文档

加分项

  • 在国内外知名会议如SIGMOD、NeurIPS、ICML、OSDI等发表过LLM训练优化相关的论文
  • 在ACM、ASC、PAC等编程竞赛中取得过较好成绩
  • 张女士 刚刚活跃

福利待遇

  • 薪资范围:30-60K·16薪
  • 工作地点:北京海淀区
  • 参与前沿大模型技术研发
  • 与优秀团队合作,持续学习成长

工作地址

北京海淀区大恒科技大厦12F