多模态交互模型研发工程师
岗位摘要
负责面向AI手机、智能座舱等ToB场景的多模态交互模型研发,包括语音基础模型、视觉-语言模型(VLM)、全模态大模型的后训练(CPT/SFT/RL)与推理优化;研发基于神经网络、扩散模型或大模型的端侧音频信号处理算法(如语音增强、降噪、去混响),提升复杂声学环境下的语音交互质量
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 负责面向AI手机、智能座舱等ToB场景的多模态交互模型研发,包括语音基础模型、视觉-语言模型(VLM)、全模态大模型的后训练(CPT/SFT/RL)与推理优化
- 研发基于神经网络、扩散模型或大模型的端侧音频信号处理算法(如语音增强、降噪、去混响),提升复杂声学环境下的语音交互质量
- 构建支持自然打断、精准判停、上下文感知的实时双工交互模型,实现低延迟、高鲁棒性的流式对话体验
- 针对端侧资源约束,开展模型压缩、量化、蒸馏及高效部署,确保算法在DSP/NPU等嵌入式平台稳定运行
- 与系统、产品团队紧密协作,推动算法从原型验证到大规模商用落地
任职要求
- 计算机、人工智能、电子工程等相关专业硕士及以上学历,3年以上AI模型或音频算法研发经验
- 在以下至少两个方向有扎实实践:基于神经网络/Diffusion/LLM的语音信号处理(增强、降噪、语音修复等);语音大模型、视觉-语言模型(VLM)或全模态(Omni)大模型的后训练(CPT/SFT/RL);双工交互核心技术:VAD、打断检测(Barge-in)、语义判停、流式响应
- 熟练掌握PyTorch,具备大模型训练、调优及端侧部署经验
- 有AI手机、车载、IoT等智能终端项目落地经验,熟悉ARM/DSP/NPU架构者加分
- 具备良好的工程能力、产品意识和跨团队协作精神,能平衡性能、延迟与功耗
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。