返回岗位列表

小米

大语言模型推理优化工程师

地点:北京 薪资:薪资未公开 日期:2026-01-29

岗位摘要

负责大语言模型线上推理框架的性能优化,解决高并发、低延迟、高可靠性等核心问题,提升服务吞吐量与稳定性;设计并实现分布式大模型推理系统,优化多卡(如NVIDIA GPU集群)资源调度与通信效率,支持千卡级训练/推理场景

岗位职责

  • 负责大语言模型线上推理框架的性能优化,解决高并发、低延迟、高可靠性等核心问题,提升服务吞吐量与稳定性
  • 设计并实现分布式大模型推理系统,优化多卡(如NVIDIA GPU集群)资源调度与通信效率,支持千卡级训练/推理场景
  • 深度适配NVIDIA GPU硬件架构,利用CUDA、cuDNN等工具链进行算子级优化,提升模型计算效率与显存利用率
  • 调研并引入前沿技术(如异构计算、AI编译器优化),推动模型量化、蒸馏等轻量化方案落地

任职要求

  • 编程能力:精通C/C++,熟悉Python,具备扎实的数据结构与算法基础,ACM/ICPC、NOI等竞赛获奖者优先
  • GPU与CUDA:熟悉NVIDIA GPU架构及编程模型,掌握CUDA核函数优化、显存管理、多流并发等技术,有实际性能调优经验
  • 框架与工具:熟悉PyTorch、Megatron、vLLM/SGLang等深度学习训练和推理框架
  • 工程经验:有分布式系统开发经验,熟悉MPI、NCCL等通信库,或参与过大模型训练/推理项目者优先
  • 学历背景:计算机/电子/数学等相关专业硕士及以上学历(优秀本科生可放宽)

加分项

  • 熟悉硬件加速技术(如FP16/BF16混合精度、GPU Direct RDMA)
  • 有大规模推荐系统、NLP模型优化经验,或开源社区贡献经历
  • 具备跨团队协作能力,能与算法、业务团队紧密配合推动技术落地

福利待遇

  • 熟悉硬件加速技术(如FP16/BF16混合精度、GPU Direct RDMA)
  • 有大规模推荐系统、NLP模型优化经验,或开源社区贡献经历
  • 具备跨团队协作能力,能与算法、业务团队紧密配合推动技术落地