返回岗位列表

阿里巴巴

多模态交互算法工程师

地点:北京 薪资:薪资未公开 日期:2026-01-29

岗位摘要

负责面向AI手机、智能座舱等ToB场景的多模态交互模型研发,包括语音基础模型、视觉-语言模型(VLM)、全模态大模型的后训练(CPT/SFT/RL)与推理优化;研发基于神经网络、扩散模型或大模型的端侧音频信号处理算法(如语音增强、降噪、去混响),提升复杂声学环境下的语音交互质量

岗位职责

  • 负责面向AI手机、智能座舱等ToB场景的多模态交互模型研发,包括语音基础模型、视觉-语言模型(VLM)、全模态大模型的后训练(CPT/SFT/RL)与推理优化
  • 研发基于神经网络、扩散模型或大模型的端侧音频信号处理算法(如语音增强、降噪、去混响),提升复杂声学环境下的语音交互质量
  • 构建支持自然打断、精准判停、上下文感知的实时双工交互模型,实现低延迟、高鲁棒性的流式对话体验
  • 针对端侧资源约束,开展模型压缩、量化、蒸馏及高效部署,确保算法在DSP/NPU等嵌入式平台稳定运行
  • 与系统、产品团队紧密协作,推动算法从原型验证到大规模商用落地

任职要求

  • 计算机、人工智能、电子工程等相关专业硕士及以上学历,3年以上AI模型或音频算法研发经验
  • 在以下至少两个方向有扎实实践:①基于神经网络/Diffusion/LLM的语音信号处理(增强、降噪、语音修复等);②语音大模型、视觉-语言模型(VLM)或全模态(Omni)大模型的后训练(CPT/SFT/RL);③双工交互核心技术:VAD、打断检测(Barge-in)、语义判停、流式响应
  • 熟练掌握PyTorch,具备大模型训练、调优及端侧部署经验
  • 有AI手机、车载、IoT等智能终端项目落地经验,熟悉ARM/DSP/NPU架构者加分
  • 具备良好的工程能力、产品意识和跨团队协作精神,能平衡性能、延迟与功耗