音频算法研究员/工程师(通义千问团队)
岗位摘要
负责单人及多说话人语音识别技术的研究与优化;开展语音合成与高质量音频合成相关工作;进行音频前端处理与音色转换技术研发;实现音色克隆(Zero-Shot TTS)相关算法;探索音乐生成与歌声生成的创新方法
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 负责单人及多说话人语音识别技术的研究与优化
- 开展语音合成与高质量音频合成相关工作
- 进行音频前端处理与音色转换技术研发
- 实现音色克隆(Zero-Shot TTS)相关算法
- 探索音乐生成与歌声生成的创新方法
- 提升模型指令遵循能力与推理性能,包括SFT、GRPO等技术应用
- 负责流式音频交互模型的推理优化与加速,熟悉RTC/WebSocket等技术
任职要求
- 计算机科学、人工智能、信号处理等相关专业硕士及以上学历
- 具备语音识别(ASR)、语音合成(TTS)、音乐生成等相关领域研究经验
- 熟练掌握深度学习框架(PyTorch/TensorFlow)及音频处理工具
- 具有大模型训练经验,熟悉SFT、RLHF、GRPO等对齐技术者优先
- 有实时音视频系统开发经验,熟悉RTC、WebSocket等通信协议者优先
- 在顶级会议(ICML/NeurIPS/ICLR/Interspeech等)发表过论文者优先
- 具备良好的工程实现能力,能够推动算法落地应用
福利待遇
- 参与全球顶尖大模型项目的核心技术研发
- 充足的计算资源与数据支持,助力前沿研究
- 与业界顶尖专家共事,获得快速成长机会
- 具有竞争力的薪酬待遇与绩效激励
- 完善的职业发展通道与晋升机制
- 开放包容的技术氛围与创新文化
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。