大模型训练基础设施实习生
岗位摘要
参与大模型预训练Infra框架的维护与迭代,协助保障训练系统的稳定性与可扩展性;参与MoE架构的训练优化工作,包括Expert并行、负载均衡、通信优化等方向;协助设计与优化并行策略(TP/PP/DP/EP/SP),提升大规模训练的吞吐量与资源利用率
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 参与大模型预训练Infra框架的维护与迭代,协助保障训练系统的稳定性与可扩展性
- 参与MoE架构的训练优化工作,包括Expert并行、负载均衡、通信优化等方向
- 协助设计与优化并行策略(TP/PP/DP/EP/SP),提升大规模训练的吞吐量与资源利用率
- 配合算法团队,协助适配新模型架构至现有训练框架
任职要求
- 硕士在读,计算机、人工智能等相关专业,实习时间不少于3个月
- 理解Transformer、MoE等主流模型架构的基本原理
- 了解分布式训练基本概念,接触过Megatron-LM、DeepSpeed、FSDP中至少一种框架
- 了解常见并行策略(Tensor Parallel、Pipeline Parallel、Expert Parallel等)的基本思路
- 熟练使用PyTorch,有实际的模型训练经验
- 对大模型RL训练(RLHF/GRPO等)有基本了解
- 学习能力强,具备良好的代码能力与问题排查意识
- 有MoE模型训练或相关加速库使用经验者优先
- 了解Flash Attention、混合精度训练、Activation Checkpointing、ZeRO等优化技术者优先
- 有CUDA/Triton算子开发或GPU性能分析(Nsight、NCU等)经验者优先
- 有开源训练框架的源码阅读或贡献经验者优先
- 有相关方向的论文阅读或复现经历者优先
加分项
- 有 MoE 模型训练或相关加速库使用经验
- 了解 Flash Attention、混合精度训练、Activation Checkpointing、ZeRO 等优化技术
- 有 CUDA/Triton 算子开发或 GPU 性能分析(Nsight、NCU 等)经验
- 有开源训练框架的源码阅读或贡献经验
- 有相关方向的论文阅读或复现经历
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。