大模型分布式训练与推理框架研发工程师
岗位摘要
基于分布式训练框架(如 Megatron-LM、DeepSpeed)或高性能推理框架(如 SGLang、vLLM)进行二次开发与优化;分析并优化训练与推理阶段的性能瓶颈,包括显存占用、通信延迟、计算效率等
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 基于分布式训练框架(如 Megatron-LM、DeepSpeed)或高性能推理框架(如 SGLang、vLLM)进行二次开发与优化
- 分析并优化训练与推理阶段的性能瓶颈,包括显存占用、通信延迟、计算效率等
- 研发高效的训练与推理融合框架(如 RLHF),支持大规模分布式环境
- 深入研究 CUDA、通信框架(NCCL、RDMA 等),开发高性能算子及优化分布式通信效率
任职要求
- 985 硕士及以上学历,计算机相关专业,具备扎实的理论基础和强大的动手能力
- 熟悉 Python 或 C++/CUDA 编程,熟悉 PyTorch 及其底层实现
- 熟悉分布式系统开发与调试,有多进程调度与并行算法优化经验者优先
- 熟悉 LLM 模型结构与算法(GPT、MoE、RLHF 等)
- 有推理框架(如 SGLang、vLLM)或训练框架(如 Megatron-LM、DeepSpeed)开发与优化经验
加分项
- 拥有高性能 CUDA Kernel 或通信算子开发与优化经验
- 具备复杂大规模分布式系统设计与实现能力
- 在实际项目中解决性能瓶颈的实战经验
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。