AI 院--多模态音频团队--音频生成算法工程师(社招)
岗位摘要
负责交互大模型中的音频生成、音频理解算法研究、训练、应用,包括但不限于指令控制TTS、语音理解、语义VAD、音频编解码器等;负责模型的多机多卡训练、高性能推理等;负责将生成技术落地到业务,熟悉语音合成中的SFT技术,并进行持续优化
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 负责交互大模型中的音频生成、音频理解算法研究、训练、应用,包括但不限于指令控制TTS、语音理解、语义VAD、音频编解码器等
- 负责模型的多机多卡训练、高性能推理等
- 负责将生成技术落地到业务,熟悉语音合成中的SFT技术,并进行持续优化
任职要求
- 硕士及以上学历,计算机、数学、通信等相关专业;具备良好的学习能力、逻辑思维能力、沟通协作能力
- 有三年及以上语音合成算法经验,或三篇及以上顶会论文(各类CCF-A会、ICASSP/INTERSPEECH等)
- 熟练使用Python和Pytorch/Tensorflow深度学习框架
- 对以下至少一种熟悉并有相关经验
- )语音大模型的框架&理论,包括但不限于Diffusion、Vall-E/SpearTTS/AudioLM、MusicLM
- )音频理解大模型/ASR大模型,包括但不限于qwen-audio、sensevoice、whisper
- )上一代语音合成模型,包括但不限于Tacotron、Fastspeech
- )各类声码器的原理&优化,包括但不限于Hifi-GAN,MelGAN,BigvGAN
- )有业务落地工程经验优先
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。