返回岗位列表

面壁智能

大模型训练基础设施实习生

地点:北京 薪资:薪资未公开 日期:2026-03-03

岗位摘要

参与大模型预训练Infra框架的维护与迭代,协助保障训练系统的稳定性与可扩展性;参与MoE架构的训练优化工作,包括Expert并行、负载均衡、通信优化等方向;协助设计与优化并行策略(TP/PP/DP/EP/SP),提升大规模训练的吞吐量与资源利用率

岗位职责

  • 参与大模型预训练Infra框架的维护与迭代,协助保障训练系统的稳定性与可扩展性
  • 参与MoE架构的训练优化工作,包括Expert并行、负载均衡、通信优化等方向
  • 协助设计与优化并行策略(TP/PP/DP/EP/SP),提升大规模训练的吞吐量与资源利用率
  • 配合算法团队,协助适配新模型架构至现有训练框架

任职要求

  • 硕士在读,计算机、人工智能等相关专业,实习时间不少于3个月
  • 理解Transformer、MoE等主流模型架构的基本原理
  • 了解分布式训练基本概念,接触过Megatron-LM、DeepSpeed、FSDP中至少一种框架
  • 了解常见并行策略(Tensor Parallel、Pipeline Parallel、Expert Parallel等)的基本思路
  • 熟练使用PyTorch,有实际的模型训练经验
  • 对大模型RL训练(RLHF/GRPO等)有基本了解
  • 学习能力强,具备良好的代码能力与问题排查意识
  • 有MoE模型训练或相关加速库使用经验者优先
  • 了解Flash Attention、混合精度训练、Activation Checkpointing、ZeRO等优化技术者优先
  • 有CUDA/Triton算子开发或GPU性能分析(Nsight、NCU等)经验者优先
  • 有开源训练框架的源码阅读或贡献经验者优先
  • 有相关方向的论文阅读或复现经历者优先

加分项

  • 有 MoE 模型训练或相关加速库使用经验
  • 了解 Flash Attention、混合精度训练、Activation Checkpointing、ZeRO 等优化技术
  • 有 CUDA/Triton 算子开发或 GPU 性能分析(Nsight、NCU 等)经验
  • 有开源训练框架的源码阅读或贡献经验
  • 有相关方向的论文阅读或复现经历