返回岗位列表

摩尔线程

AI端侧推理优化工程师

地点:北京 薪资:30-60K 日期:2026-03-03

岗位摘要

负责vLLM、llama.cpp、MNN等端侧大模型推理框架的性能优化与加速,提升吞吐并降低延迟;负责语音、Embedding、OCR、AIGC、自动驾驶等模型在ONNXRuntime、MNN等框架中的调优与部署适配

岗位职责

  • 负责vLLM、llama.cpp、MNN等端侧大模型推理框架的性能优化与加速,提升吞吐并降低延迟
  • 负责语音、Embedding、OCR、AIGC、自动驾驶等模型在ONNXRuntime、MNN等框架中的调优与部署适配
  • 与算子、编译器团队紧密协作,完成高性能推理框架集成、验证与交付
  • 深入分析推理链路性能瓶颈,设计系统级优化方案并推动落地

任职要求

  • 精通vLLM、llama.cpp、ONNXRuntime等至少一种主流推理框架架构与源码
  • 掌握Flash Attention、Paged Attention、Speculative Decoding、Continuous Batching等大模型加速技术并有实战经验
  • 熟练使用Triton/Cutlass开发高性能GPU Kernel,精通CUDA编程、内存管理与性能优化,有重要项目落地
  • 熟练使用PyTorch Profiler、Nsight Systems/Compute等工具,掌握CUDA Graph、Torch AOT等高级调优技术
  • 责任心强,具备优秀沟通协作能力,可协同算法、编译、硬件团队完成端到端交付
  • 有头部企业推理引擎大规模落地、MLIR/TVM编译器优化或端侧量化部署经验者优先

加分项

  • 有一线互联网公司或头部AI企业推理引擎优化与大规模业务落地经验
  • 在推理框架技术基础上,深入掌握算子优化、编译器优化(如MLIR、TVM)或GPU硬件架构知识
  • 具备端侧模型量化(如W4A16、W4A8等)调优及部署实践经验
  • 汪伟 刚刚活跃

福利待遇

  • 年薪30-60K×16薪,极具竞争力
  • 硕士应届生亦可,成长空间大
  • 北京望京国际研发园,核心科技园区
  • 与顶尖AI团队共事,技术氛围浓厚

工作地址

北京朝阳区望京国际研发园l座3层