大语言模型推理优化工程师
岗位摘要
负责大语言模型线上推理框架的性能优化,解决高并发、低延迟、高可靠性等核心问题,提升服务吞吐量与稳定性;设计并实现分布式大模型推理系统,优化多卡(如NVIDIA GPU集群)资源调度与通信效率,支持千卡级训练/推理场景
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 负责大语言模型线上推理框架的性能优化,解决高并发、低延迟、高可靠性等核心问题,提升服务吞吐量与稳定性
- 设计并实现分布式大模型推理系统,优化多卡(如NVIDIA GPU集群)资源调度与通信效率,支持千卡级训练/推理场景
- 深度适配NVIDIA GPU硬件架构,利用CUDA、cuDNN等工具链进行算子级优化,提升模型计算效率与显存利用率
- 调研并引入前沿技术(如异构计算、AI编译器优化),推动模型量化、蒸馏等轻量化方案落地
任职要求
- 编程能力:精通C/C++,熟悉Python,具备扎实的数据结构与算法基础,ACM/ICPC、NOI等竞赛获奖者优先
- GPU与CUDA:熟悉NVIDIA GPU架构及编程模型,掌握CUDA核函数优化、显存管理、多流并发等技术,有实际性能调优经验
- 框架与工具:熟悉PyTorch、Megatron、vLLM/SGLang等深度学习训练和推理框架
- 工程经验:有分布式系统开发经验,熟悉MPI、NCCL等通信库,或参与过大模型训练/推理项目者优先
- 学历背景:计算机/电子/数学等相关专业硕士及以上学历(优秀本科生可放宽)
加分项
- 熟悉硬件加速技术(如FP16/BF16混合精度、GPU Direct RDMA)
- 有大规模推荐系统、NLP模型优化经验,或开源社区贡献经历
- 具备跨团队协作能力,能与算法、业务团队紧密配合推动技术落地
福利待遇
- 熟悉硬件加速技术(如FP16/BF16混合精度、GPU Direct RDMA)
- 有大规模推荐系统、NLP模型优化经验,或开源社区贡献经历
- 具备跨团队协作能力,能与算法、业务团队紧密配合推动技术落地
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。