返回岗位列表

小米

自动驾驶感知模型部署工程师

地点:北京 薪资:薪资未公开 日期:2026-01-29

岗位摘要

负责自动驾驶感知模型(Detection / Segmentation / BEV / Multi-Modal)在多种硬件平台上的部署与加速,包括 GPU、NPU、CPU(如 NVIDIA)等平台

岗位职责

  • 负责自动驾驶感知模型(Detection / Segmentation / BEV / Multi-Modal)在多种硬件平台上的部署与加速,包括 GPU、NPU、CPU(如 NVIDIA)等平台
  • 将模型从训练框架(PyTorch)导出到推理框架(TensorRT / ONNX Runtime / TVM / 自研引擎),并进行算子适配、性能调优、内存优化
  • 分析推理瓶颈(算子、访存、调度、流水线并行)并制定端到端加速方案,包括量化(INT8/QAT/PTQ)、剪枝、稀疏化、算子融合、子图重写等
  • 根据感知模型特性(多 head、多尺度、BEV 变换、时序堆叠等)设计高效部署结构,负责模型结构重写与轻量化策略落地
  • 参与自研推理框架的算子开发,包括 CUDA kernel 编写、调度优化和跨硬件后端适配
  • 与感知算法、软件和硬件团队协作,推动模型在车辆端的高性能、低延迟、低功耗部署

任职要求

  • 熟悉 PyTorch/ONNX/TensorRT 工作流,能独立完成模型导出、转换、调试
  • 至少熟悉一种主流推理框架(TensorRT / ONNX Runtime / TVM / TFLite / MNN / ncnn 等)
  • 能够分析模型算子瓶颈,掌握 profiler 工具(Nsight、nvprof、perf、Tracy)
  • 熟悉常见加速技术:算子融合、kernel 调优、流水线并行、异步调度、memory pool、dynamic shape 优化等
  • 熟练掌握现代 C++(C++11/14/17),熟悉多线程、内存管理
  • 了解 CUDA 基本优化技巧(shared memory、coalesced memory、warp divergence、kernel fusion)

加分项

  • 有自动驾驶感知模型部署经验(BEVFusion、CenterPoint、FCOS3D、Occupancy Network、 等)
  • 有 QAT 实践经验,能解决量化精度掉点与 kernel 对齐问题
  • 有稀疏化、剪枝、蒸馏等经验并落地过大模型加速方案
  • 具备 GPU 性能建模能力,熟悉计算/访存平衡
  • 有自研推理引擎、算子框架(如 Plugin、TVM schedule)开发经验
  • 有多平台部署能力(如 NVIDIA + 地平线 + 其他端侧 SoC)
  • 熟悉 CGraph、AITemplate、BladeDISC、OpenVINO、XLA 等高级编译器