AI端侧推理优化工程师
岗位摘要
负责vLLM、llama.cpp、MNN等端侧推理框架的性能优化与加速,提升吞吐并降低延迟;负责语音、Embedding、OCR、AIGC、自动驾驶等模型在ONNXRuntime、MNN等框架中的调优与端侧部署
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 负责vLLM、llama.cpp、MNN等端侧推理框架的性能优化与加速,提升吞吐并降低延迟
- 负责语音、Embedding、OCR、AIGC、自动驾驶等模型在ONNXRuntime、MNN等框架中的调优与端侧部署
- 与算子、编译器团队紧密协作,完成高性能推理框架的集成、验证与交付
- 深入分析推理链路瓶颈,设计系统级优化方案,保障框架在真实场景高效稳定运行
任职要求
- 精通vLLM、llama.cpp、ONNXRuntime等至少一种主流推理框架的架构、机制与源码
- 熟练掌握Flash Attention、Paged Attention、Speculative Decoding、Continuous Batching等大模型加速技术并有实战经验
- 熟练使用Triton、Cutlass开发高性能GPU Kernel,精通CUDA编程、内存管理与性能优化,有重要项目落地
- 熟练使用PyTorch Profiler、Nsight Systems/Compute等工具,掌握CUDA Graph、Torch AOT等高级调优技术
- 责任心强,具备优秀沟通协作能力,能协同算法、编译、硬件团队完成端到端交付
- (加分)有一线互联网或头部AI企业推理引擎优化与大规模业务落地经验
- (加分)深入掌握MLIR、TVM等编译器优化或GPU硬件架构知识
- (加分)具备W4A16、W4A8等端侧量化调优及部署实践经验
加分项
- 有一线互联网公司或头部AI企业推理引擎优化与大规模业务落地经验
- 在推理框架技术基础上,深入掌握算子优化、编译器优化(如MLIR、TVM)或GPU硬件架构知识
- 具备端侧模型量化(如W4A16、W4A8等)调优及部署实践经验
- 蔡猛 刚刚活跃
- 摩尔线程 · 技术总监
福利待遇
- 年薪15薪,30-60K区间,具备市场竞争力
- 北京望京国际研发园优质办公环境
- 与顶尖技术团队共事,参与前沿AI落地项目
工作地址
北京朝阳区望京国际研发园I座2层
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。