多模态口语交互算法专家
岗位摘要
负责通义实验室多模态口语交互的算法研发,深入理解全链路多模态交互技术;开展端到端多模态联合建模,实现语音/视觉/文本等模态融合并应用于人机交互场景;研发多模态交互应用算法,包括意图动态规划、多智能体协作、多任务推理、主动交互
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 负责通义实验室多模态口语交互的算法研发,深入理解全链路多模态交互技术
- 开展端到端多模态联合建模,实现语音/视觉/文本等模态融合并应用于人机交互场景
- 研发多模态交互应用算法,包括意图动态规划、多智能体协作、多任务推理、主动交互
- 设计多模态对话系统,涵盖多轮交互状态管理、情境感知、情感理解及生成控制
- 开发音视频内容理解能力,包括转写后处理、音视频分析、口语长篇章理解及生成
- 推动多模态口语交互技术在消费电子、具身机器人、内容消费等场景的落地应用
- 持续关注行业前沿动态,通过专利申请、论文和技术报告提升团队技术影响力
任职要求
- 计算机或通信专业硕士及以上学历
- 具有2年以上多模态交互或语言理解算法研发经验
- 至少精通以下一项:多模态联合建模(语音+视觉/文本)、对话系统设计及开发、口语语言理解、多智能体交互决策
- 精通基于深度神经网络的机器学习算法,熟悉Transformer、GPT、LLM等算法原理
- 掌握AI产品开发的开源工具和框架,具备优秀的编程能力
- 在顶级会议或期刊发表过相关领域论文者优先
- 有业界前沿的语音多模态交互或数字人交互系统算法经验者优先
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。