端侧推理Infra研发工程师
岗位摘要
负责端侧模型推理系统的研发与优化,服务于公司各个算法产品的端侧化;既懂算法也懂系统,优化LLM、VLM、Omni等核心算法业务;与公司各算法部门深度合作,分析端侧算法业务的性能瓶颈和系统架构特征
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 负责端侧模型推理系统的研发与优化,服务于公司各个算法产品的端侧化
- 既懂算法也懂系统,优化LLM、VLM、Omni等核心算法业务
- 与公司各算法部门深度合作,分析端侧算法业务的性能瓶颈和系统架构特征
- 使用软硬件结合的优化思想,实现极致性能
任职要求
- 熟练掌握C/C++、Python语言,能够使用主流深度学习框架
- 熟悉端侧模型的推理框架例如QNN、NeuroPilot、MNN等
- 熟悉主流深度学习模型及其应用场景,如Qwen-LLM、QwenVL、DeepSeek等系列模型
- 对模型推理调试、调优有实操经验,能分析与优化算法系统实际推理时的算力、IO等瓶颈
- 研发端侧推理加速系统
- 熟悉大模型的推理加速方案,例如混合低Bit QAT/PTQ量化、推测解码、异构存算、条件计算、KVCache共享等(加分项)
- 理解端侧硬件架构特点,具备端侧GPU/NPU异构性能分析与调优的经验(加分项)
- 熟悉各类深度学习模型和算子底层实现细节,并能实现优化(加分项)
- 熟悉Gemma3N、RWKV、混合Attention等新架构模型特点(加分项)
加分项
- 熟悉大模型的推理加速方案,例如混合低 Bit QAT/PTQ量化、推测解码、异构存算、条件计算、KVCache 共享等
- 理解端侧硬件架构特点,具备端侧 GPU/NPU 异构性能分析与调优的经验
- 熟悉各类深度学习模型和算子底层实现细节,并能实现优化
- 熟悉 Gemma3N、RWKV 、混合Attention等新架构模型特点
- 张女士 刚刚活跃
工作地址
北京海淀区大恒科技大厦12F
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。