返回岗位列表

阿里巴巴

音频算法研究员/工程师(通义千问团队)

地点:北京 薪资:薪资未公开 日期:2026-01-29

岗位摘要

负责单人及多说话人语音识别技术的研究与开发;开展语音合成与高质量音频合成相关工作;进行音频前端处理与音色转换技术研究;实现音色克隆(Zero-Shot TTS)功能;探索音乐生成与歌声生成技术

岗位职责

  • 负责单人及多说话人语音识别技术的研究与开发
  • 开展语音合成与高质量音频合成相关工作
  • 进行音频前端处理与音色转换技术研究
  • 实现音色克隆(Zero-Shot TTS)功能
  • 探索音乐生成与歌声生成技术
  • 提升模型指令遵循能力与推理能力,包括SFT、GRPO等方法
  • 优化流式音频交互模型的推理与加速,熟悉RTC/WebSocket等技术

任职要求

  • 计算机、机器学习等相关专业背景,博士及硕士学历优先
  • 具备较强的代码能力,拥有丰富的TTS、Codec、流式ASR研究经验及相关数据处理经验
  • 精通Python编程语言及Pytorch等深度学习框架
  • 熟悉Transformer架构及大语言模型基础知识
  • 善于平衡研究目标与落地实现,以结果为导向
  • 具备良好的沟通能力和团队合作精神
  • 关注技术影响力,具有开源开放精神
  • 曾发表NeurIPS、ICLR、ICML、ACL、CVPR、ECCV、InterSpeech等顶级会议论文者优先
  • 具有音视频实时交互系统开发经验者优先
  • 具有高表现力或鲁棒性TTS生成模型研究/开发经验者优先
  • 拥有知名开源项目并在开源社区具有较好影响力者优先

加分项

  • 曾发表顶级会议论文并具有一定的学术影响力,包括但不限于 NeurIPS、ICLR、ICML、ACL、CVPR、ECCV、InterSpeech 等,具有一些有深度的研究工作是较大
  • 欢迎其他方向的多模态同学看音频方向的机会
  • 具有较强的工程能力,有开发音视频实时交互系统的经验
  • 具有高表现力/鲁棒 TTS 生成模型研究/开发经验
  • 具有持续打磨好每一个技术细节的钻研精神
  • 拥有知名开源项目,在开源社区具有较好的影响力