多模态口语交互算法研发工程师
岗位摘要
负责通义实验室多模态口语交互的算法研发,推进大模型增强的语言交互技术能力建设;端到端多模态联合建模:语音/视觉/文本等模态融合并应用于人机交互场景;多模态交互应用算法:意图动态规划、多智能体协作、多任务推理、主动交互
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 负责通义实验室多模态口语交互的算法研发,推进大模型增强的语言交互技术能力建设
- 端到端多模态联合建模:语音/视觉/文本等模态融合并应用于人机交互场景
- 多模态交互应用算法:意图动态规划、多智能体协作、多任务推理、主动交互
- 多模态对话系统设计:多轮交互状态管理、情境感知、情感理解及生成控制
- 转写内容后处理:书面化、标点、分段分章节
- 音视频分析:分角色、语种判别、视频场景划分
- 口语内容长篇章理解及生成
- 探索多模态口语交互技术落地于实际应用场景
- 持续关注行业前沿动态,通过专利申请、论文和技术报告等形式提升团队的技术影响力
任职要求
- 计算机或通信专业硕士及以上学历
- 具有2年以上多模态交互或语言理解算法研发经验,至少精通一项相关领域
- 精通基于深度神经网络的机器学习算法,熟悉Transformer、GPT、LLM等算法原理
- 掌握AI产品开发的开源工具和框架,具备优秀的编程能力
- 在顶级会议或期刊上发表过相关领域的论文者优先
- 有业界前沿的语音多模态交互或数字人交互系统的算法经验者优先
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。