返回岗位列表

阶跃星辰

LLM 预训练主训研究员

地点:北京 薪资:500-1000元/天 日期:2026-06-26

岗位摘要

负责千卡以上规模预训练任务的日常运维与异常处理,保障训练零中断或快速恢复;诊断并解决loss spike、梯度爆炸、NaN、慢节点等训练异常,建立系统化的问题分类与处理机制;优化训练吞吐(MFU),通过kernel融合、通信隐藏、梯度checkpoint等手段提升GPU利用率

岗位职责

  • 负责千卡以上规模预训练任务的日常运维与异常处理,保障训练零中断或快速恢复
  • 诊断并解决loss spike、梯度爆炸、NaN、慢节点等训练异常,建立系统化的问题分类与处理机制
  • 优化训练吞吐(MFU),通过kernel融合、通信隐藏、梯度checkpoint等手段提升GPU利用率
  • 维护checkpoint管理体系,支持断点续训、模型版本对比与快速回滚
  • 深度使用并优化Megatron-LM/FSDP,参与训练框架的定制化改造
  • 负责3D并行策略(TP/PP/DP)的配置调优,针对不同模型规模找到最优并行方案
  • 与基础设施团队协作,推动NCCL通信拓扑优化、网络带宽利用率提升
  • 参与scaling law实验设计,高效运行小模型代理实验并推断大模型行为
  • 建立训练metric监控体系(loss曲线、grad norm、吞吐、显存),支持研究员快速判断实验质量

任职要求

  • 熟练掌握PyTorch分布式训练,深入理解DDP/FSDP/Megatron-LM
  • 有100卡以上规模训练任务的实际运维经验,能独立排查训练异常
  • 理解GPU性能模型(compute bound/memory bound),能分析并优化训练瓶颈
  • 熟悉NCCL、InfiniBand/RoCE网络基础
  • 有完整预训练项目经验(从数据准备到训练完成)者优先
  • 参与过vLLM/SGLang等推理框架的开发或深度使用优先
  • 有scaling law实验设计或MFU系统性优化经验优先
  • 有开源大模型训练框架贡献(Megatron-LM/DeepSpeed等)优先

加分项

  • 有完整预训练项目经验(从数据准备到训练完成)
  • 参与过 vLLM / SGLang 等推理框架的开发或深度使用
  • 有 scaling law 实验设计或 MFU 系统性优化经验
  • 有开源大模型训练框架贡献(Megatron
  • LM / DeepSpeed 等)

福利待遇

  • 日薪500-1000元
  • 实习周期3个月,每周4天
  • 工作地点在北京海淀区大恒科技大厦
  • 与顶尖团队合作,参与前沿大模型训练

工作地址

北京海淀区大恒科技大厦12F