端侧模型推理优化工程师
岗位摘要
负责端侧LLM/ASR/TTS等各类模型的推理引擎选型、适配与性能优化;持续优化推理速度:量化(INT4/INT8)、KV Cache优化、speculative decoding、FlashAttention等
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 负责端侧LLM/ASR/TTS等各类模型的推理引擎选型、适配与性能优化
- 持续优化推理速度:量化(INT4/INT8)、KV Cache优化、speculative decoding、FlashAttention等
- 适配硬件平台的异构算力(CPU/GPU/NPU),设计最优的推理调度策略
- 搭建端侧模型评估体系:精度、延迟、功耗、内存占用的综合benchmark
- 跟踪开源端侧各类开源模型进展,持续引入最优模型
- 优化语音链路端到端延迟(从用户说完话到助理开始回复<目标值)
- 与硬件团队协作,针对目标芯片平台进行算子级优化
任职要求
- 3年以上模型推理优化经验,有端侧/嵌入式设备部署实战经历
- 精通模型量化、剪枝、蒸馏等压缩技术
- 熟悉至少一种推理框架:llama.cpp/ONNX Runtime/TensorRT/SGLang
- 熟悉C/C++,能做算子级性能调优
- 理解NPU/GPU硬件架构,有异构计算调度经验
- 加分项:有语音模型(Whisper/Sherpa/Piper/Kokoro)的端侧部署经验
- 加分项:熟悉ARM平台或Qualcomm/RK3588/Jetson等边缘芯片
加分项
- 有语音模型(Whisper / Sherpa / Piper / Kokoro)的端侧部署经验
- 熟悉 ARM 平台或 Qualcomm / RK3588 / Jetson 等边缘芯片
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。