LLM 预训练主训研究员
岗位摘要
负责千卡以上规模预训练任务的日常运维与异常处理,保障训练零中断或快速恢复;诊断并解决loss spike、梯度爆炸、NaN、慢节点等训练异常,建立系统化的问题分类与处理机制;优化训练吞吐(MFU),通过kernel融合、通信隐藏、梯度checkpoint等手段提升GPU利用率
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 负责千卡以上规模预训练任务的日常运维与异常处理,保障训练零中断或快速恢复
- 诊断并解决loss spike、梯度爆炸、NaN、慢节点等训练异常,建立系统化的问题分类与处理机制
- 优化训练吞吐(MFU),通过kernel融合、通信隐藏、梯度checkpoint等手段提升GPU利用率
- 维护checkpoint管理体系,支持断点续训、模型版本对比与快速回滚
- 深度使用并优化Megatron-LM/FSDP,参与训练框架的定制化改造
- 负责3D并行策略(TP/PP/DP)的配置调优,针对不同模型规模找到最优并行方案
- 与基础设施团队协作,推动NCCL通信拓扑优化、网络带宽利用率提升
- 参与scaling law实验设计,高效运行小模型代理实验并推断大模型行为
- 建立训练metric监控体系(loss曲线、grad norm、吞吐、显存),支持研究员快速判断实验质量
任职要求
- 熟练掌握PyTorch分布式训练,深入理解DDP/FSDP/Megatron-LM
- 有100卡以上规模训练任务的实际运维经验,能独立排查训练异常
- 理解GPU性能模型(compute bound/memory bound),能分析并优化训练瓶颈
- 熟悉NCCL、InfiniBand/RoCE网络基础
- 有完整预训练项目经验(从数据准备到训练完成)者优先
- 参与过vLLM/SGLang等推理框架的开发或深度使用优先
- 有scaling law实验设计或MFU系统性优化经验优先
- 有开源大模型训练框架贡献(Megatron-LM/DeepSpeed等)优先
加分项
- 有完整预训练项目经验(从数据准备到训练完成)
- 参与过 vLLM / SGLang 等推理框架的开发或深度使用
- 有 scaling law 实验设计或 MFU 系统性优化经验
- 有开源大模型训练框架贡献(Megatron
- LM / DeepSpeed 等)
福利待遇
- 日薪500-1000元
- 实习周期3个月,每周4天
- 工作地点在北京海淀区大恒科技大厦
- 与顶尖团队合作,参与前沿大模型训练
工作地址
北京海淀区大恒科技大厦12F
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。