大模型训练优化工程师
岗位摘要
负责大语言模型(LLM)训练基础设施的设计与开发,包括大规模数据加载优化、训练数据构建和数据处理Pipeline;负责大规模训练数据格式与存储方案设计(如WebDataset/Sharded Dataset等),优化数据IO和分布式训练场景下的数据吞吐能力
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 负责大语言模型(LLM)训练基础设施的设计与开发,包括大规模数据加载优化、训练数据构建和数据处理Pipeline
- 负责大规模训练数据格式与存储方案设计(如WebDataset/Sharded Dataset等),优化数据IO和分布式训练场景下的数据吞吐能力
- 负责模型工具链建设,包括模型格式转换、权重切分与合并、跨框架模型迁移(如HuggingFace/Megatron等)
- 参与大模型训练系统开发与优化,支持预训练、SFT、RLHF等不同训练流程,提高训练效率和GPU利用率
- 参与大模型推理基础设施开发,建设高性能推理平台,支持在线推理服务
- 跟踪大模型训练与推理领域的前沿技术(如高效数据管道、训练加速等),持续推动系统能力升级
任职要求
- 计算机科学、人工智能、软件工程或相关专业,硕士及以上学历,3-5年AI Infra相关工作经验
- 精通Python/Go/C++中至少两门语言,能编写高质量代码
- 有良好的算法和数理基础,熟悉常用算法
- 熟练掌握深度学习框架(PyTorch)、分布式训练技术(5D并行)及相关框架(Megatron-LM),有实际模型训练经验,对LLM训练的各个环节尤其是dataloader、checkpoint等模块有深入研究
- 熟悉使用分布式计算系统如Ray、Spark,有实际使用和应用调优的经验
- 擅长性能优化,对性能和稳定性有极致追求,能在压力下快速定位性能瓶颈并给出优化方案
- 具备良好的问题分析与解决能力,良好的团队合作精神和沟通能力,能编写高质量文档
加分项
- 在国内外知名会议如SIGMOD、NeurIPS、ICML、OSDI等发表过LLM训练优化相关的论文
- 在ACM、ASC、PAC等编程竞赛中取得过较好成绩
- 张女士 刚刚活跃
福利待遇
- 薪资范围:30-60K·16薪
- 工作地点:北京海淀区
- 参与前沿大模型技术研发
- 与优秀团队合作,持续学习成长
工作地址
北京海淀区大恒科技大厦12F
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。