多模态大模型系统研发实习生
岗位摘要
参与多模态大模型训练系统的研发与优化,基于PyTorch/Megatron等框架构建大规模分布式训练系统,深入理解并优化TP/PP/CP/SP/EP/MoE等并行训练策略,参与多模态数据管线的构建与优化
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 参与多模态大模型训练系统的研发与优化,基于PyTorch/Megatron等框架构建大规模分布式训练系统,深入理解并优化TP/PP/CP/SP/EP/MoE等并行训练策略,参与多模态数据管线的构建与优化
- 参与大模型推理系统的设计与实现,基于vLLM/SGLang等框架构建高性能推理服务,探索KV Cache、batching、scheduling等关键推理技术,支持多模态模型推理部署,并探索量化推理与性能优化
- 参与RLHF/RLAIF/GRPO等大模型对齐算法的工程实现,构建训推分离的RL训练系统,参照slime、verl等开源框架构建RL管线,优化rollout、sampling、reward与trainer等核心模块
- 参与大模型系统工程研发,进行CUDA/NCCL/GPU计算性能优化,通过性能分析工具定位系统瓶颈,提升大规模训练与推理系统的稳定性与性能
任职要求
- 熟练使用Python,具备良好的代码习惯与工程能力
- 熟悉PyTorch或深度学习基础
- 熟悉Linux开发环境
- 对大模型系统技术有浓厚兴趣
- 熟悉Megatron/DeepSpeed/FSDP等大模型训练框架者优先
- 熟悉vLLM/SGLang/TensorRT-LLM等推理框架者优先
- 熟悉RLHF/PPO/GRPO等强化学习算法者优先
- 使用过slime、verl或类似RL框架者优先
- 有大模型训练或推理系统开发经验者优先
- 熟悉CUDA/GPU编程或性能优化者优先
- 熟悉分布式系统或分布式训练者优先
- 有开源项目经验(GitHub/技术博客等)者优先
- 对大模型系统技术充满热情,喜欢研究系统底层原理与性能优化
- 能稳定实习3-6个月及以上
加分项
- (满足任意一条)
- 熟悉 Megatron / DeepSpeed / FSDP 等大模型训练框架
- 熟悉 vLLM / SGLang / TensorRT-LLM 等推理框架
- 熟悉 RLHF / PPO / GRPO 等强化学习算法
- 使用过 slime、verl 或类似 RL 框架
- 有大模型训练或推理系统开发经验
- 熟悉 CUDA / GPU 编程或性能优化
- 熟悉分布式系统或分布式训练
- 有开源项目经验(GitHub / 技术博客等)
- 【我们希望你是这样的人】
- 对大模型系统技术充满热情
- 喜欢研究系统底层原理与性能优化
- 能稳定实习 3-6 个月及以上
- 深度参与 智谱 AI 多模态大模型(GLM 系列 / VLM) 的系统研发
- 接触 大规模训练系统、RL 对齐系统与推理系统 的核心工程实践
- 使用 A100 / H100 等大规模 GPU 集群 进行模型训练与实验
- 与顶尖 AI 研究员与系统工程师协作,快速提升系统研发能力
- 表现优秀的同学将获得 长期实习 / 转正机会
福利待遇
- 深度参与智谱AI多模态大模型(GLM系列/VLM)的系统研发
- 接触大规模训练系统、RL对齐系统与推理系统的核心工程实践
- 使用A100/H100等大规模GPU集群进行模型训练与实验
- 与顶尖AI研究员与系统工程师协作,快速提升系统研发能力
- 表现优秀的同学将获得长期实习/转正机会
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。