返回岗位列表

阿里巴巴

多模态口语交互算法专家

地点:北京 薪资:薪资未公开 日期:2026-01-29

岗位摘要

负责通义实验室多模态口语交互的算法研发,深入理解全链路多模态交互技术;开展端到端多模态联合建模,实现语音/视觉/文本等模态融合并应用于人机交互场景;研发多模态交互应用算法,包括意图动态规划、多智能体协作、多任务推理、主动交互

岗位职责

  • 负责通义实验室多模态口语交互的算法研发,深入理解全链路多模态交互技术
  • 开展端到端多模态联合建模,实现语音/视觉/文本等模态融合并应用于人机交互场景
  • 研发多模态交互应用算法,包括意图动态规划、多智能体协作、多任务推理、主动交互
  • 设计多模态对话系统,涵盖多轮交互状态管理、情境感知、情感理解及生成控制
  • 开发音视频内容理解能力,包括转写后处理、音视频分析、口语长篇章理解及生成
  • 推动多模态口语交互技术在消费电子、具身机器人、内容消费等场景的落地应用
  • 持续关注行业前沿动态,通过专利申请、论文和技术报告提升团队技术影响力

任职要求

  • 计算机或通信专业硕士及以上学历
  • 具有2年以上多模态交互或语言理解算法研发经验
  • 至少精通以下一项:多模态联合建模(语音+视觉/文本)、对话系统设计及开发、口语语言理解、多智能体交互决策
  • 精通基于深度神经网络的机器学习算法,熟悉Transformer、GPT、LLM等算法原理
  • 掌握AI产品开发的开源工具和框架,具备优秀的编程能力
  • 在顶级会议或期刊发表过相关领域论文者优先
  • 有业界前沿的语音多模态交互或数字人交互系统算法经验者优先