返回岗位列表

阿里巴巴

通义实验室-语音大模型算法工程师-通义千问

地点:北京 薪资:薪资未公开 日期:2026-01-29

岗位摘要

单人/多说话人语音识别;语音合成与高质量音频合成;音乐生成 / 歌声生成;理解指令遵循能力提升与推理,包括 SFT, GRPO 等;流式音频交互模型的推理与加速 (熟悉RTC/WebSocket等)

岗位职责

  • 单人/多说话人语音识别
  • 语音合成与高质量音频合成
  • 音乐生成 / 歌声生成
  • 理解指令遵循能力提升与推理,包括 SFT, GRPO 等
  • 流式音频交互模型的推理与加速 (熟悉RTC/WebSocket等)

任职要求

  • 计算机、机器学习等相关专业,博士及硕士优先
  • 较强的代码能力,具有丰富的 TTS / Codec / 流ASR 研究经验,具有相关数据处理经验
  • 精通 Python 以及 Pytorch 等深度学习框架
  • 熟悉 Transformer 架构以及大语言模型基础知识
  • 善于平衡研究目标及落地实现,且结果导向
  • 关注技术影响力,具有开源开放精神
  • 曾发表顶级会议论文并具有一定的学术影响力,包括但不限于 NeurIPS、ICLR、ICML、ACL、CVPR、ECCV、InterSpeech 等,具有一些有深度的研究工作是较大加分项,欢迎其他方向的多模态同学看音频方向的机会

加分项

  • 曾发表顶级会议论文并具有一定的学术影响力,包括但不限于 NeurIPS、ICLR、ICML、ACL、CVPR、ECCV、InterSpeech 等,具有一些有深度的研究工作是较大
  • 欢迎其他方向的多模态同学看音频方向的机会
  • 具有较强的工程能力,有开发音视频实时交互系统的经验
  • 具有高表现力/鲁棒 TTS 生成模型研究/开发经验
  • 具有持续打磨好每一个技术细节的钻研精神
  • 拥有知名开源项目,在开源社区具有较好的影响力