返回岗位列表

阿里巴巴

AI音乐生成研究员

地点:北京 薪资:薪资未公开 日期:2026-01-29

岗位摘要

参与Qwen3-Music项目的研究与开源工作,构建具有世界级影响力的音频模型项目;负责AI音乐生成核心技术的研发,包括旋律生成、伴奏合成、歌声合成、音色建模等方向;持续优化MusicLM类模型的训练与性能提升

岗位职责

  • 参与Qwen3-Music项目的研究与开源工作,构建具有世界级影响力的音频模型项目
  • 负责AI音乐生成核心技术的研发,包括旋律生成、伴奏合成、歌声合成、音色建模等方向
  • 持续优化MusicLM类模型的训练与性能提升
  • 独立完成从实验设计到模型部署的全流程工程实现
  • 开展数据处理与模型优化相关工作,保障模型质量与效率
  • 推动技术成果的开源开放,扩大技术影响力

任职要求

  • 计算机科学、语音交互、人工智能、机器学习等领域的博士或硕士毕业生
  • 必须具备实际的AI音乐生成项目经验,如旋律生成、伴奏合成、歌声合成、音色建模、MusicLM类模型训练等
  • 有完整项目落地、上线或开源经验者优先考虑
  • 熟练掌握Python编程语言及PyTorch/TensorFlow深度学习框架
  • 熟悉音频处理工具链,包括librosa、torchaudio、audiocraft等
  • 对Transformer架构、扩散模型、自回归模型有深入理解
  • 熟悉音频编解码器技术,如EnCodec、SoundStream等
  • 具备良好的工程实现能力和相关数据处理经验
  • 具有开源开放精神,关注技术影响力
  • 对基础模型前沿问题保持持续热情,具备独立思考能力和系统性研究思维
  • 敢于挑战现有范式,能够独立应用技术解决复杂问题

加分项

  • 熟悉音乐理论(调式、和弦进行、曲式结构)、有 DAW 使用经验、参与过音乐类创业项目、在 GitHub 有高质量开源项目
  • 曾发表顶级会议论文并具有一定的学术影响力,包括但不限于:InterSpeech、CVPR、ECCV、NeurIPS、ICML、ICLR、ACL、TPAMI等国际顶级计算机会议/期刊

福利待遇

  • 参与全球领先的全模态大模型技术研发
  • 与世界级研究团队共同推动下一代AI交互技术发展
  • 研究成果可直接应用于通义千问系列开源产品,获得广泛技术影响力
  • 支持开发实时交互系统,推动技术产业化落地