多模态理解/音频大模型算法研究员
岗位摘要
主导多模态理解/音频大模型的前沿算法研究及产业落地;研发语音识别、语音翻译以及音频分析等理解算法;开发跨模态(语音/文本/视觉)的音频语义理解系统;探索音频大模型架构设计;推动算法成果转化:通过ModelScope开源社区创造研究价值,或通过阿里云产品体系创造商业价值
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 主导多模态理解/音频大模型的前沿算法研究及产业落地
- 研发语音识别、语音翻译以及音频分析等理解算法
- 开发跨模态(语音/文本/视觉)的音频语义理解系统
- 探索音频大模型架构设计
- 推动算法成果转化:通过ModelScope开源社区创造研究价值,或通过阿里云产品体系创造商业价值
- 持续跟踪国际前沿技术动态(ICASSP/Interspeech/NeurIPS/ICLR等),参与国际会议、研讨会,与全球顶级团队进行交流合作
任职要求
- 计算机科学、信号处理、语音处理、人工智能等相关领域硕士及以上学历
- 2年以上音频AI研发经验,包括但不限于音频识别及理解、音频生成、数字人、多模态交互等方向
- 扎实的深度学习基础,熟练掌握PyTorch/TensorFlow等框架
- 优秀的编程能力(Python/C++),具备大规模音频数据处理经验
- 良好的跨团队协作能力,对技术落地有强烈热情
加分项
- 在音频、多模态、机器学习顶会或期刊发表过相关论文
- 深入了解语音在各类业务场景应用落地的相关挑战
- 具备多模态(语音+视觉+文本)交互系统研发及落地经验
福利待遇
- 在音频、多模态、机器学习顶会或期刊发表过相关论文者优先
- 深入了解语音在各类业务场景应用落地的相关挑战者优先
- 具备多模态(语音+视觉+文本)交互系统研发及落地经验者优先
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。