AI院-多模态音频-算法工程师(26届校招)
岗位摘要
负责音频生成中的SFT技术并探索RL的训练优化;负责音频生成的token2wav模块,包括diffusion model、vocoder;2026届毕业,自然语言处理、机器学习、人工智能、软件工程等相关专业,硕士及以上学历
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 负责音频生成中的SFT技术并探索RL的训练优化
- 负责音频生成的token2wav模块,包括diffusion model、vocoder
任职要求
- 2026届毕业,自然语言处理、机器学习、人工智能、软件工程等相关专业,硕士及以上学历
- 较强的算法开发能力,熟悉常用的机器学习、深度学习算法
- 熟练使用Python和Pytorch/Tensorflow深度学习框架
- 熟悉以下至少一种且有相应研发经验优先:大模型的框架与理论(如Diffusion、Vall-E/SpearTTS/AudioLM、MusicLM等),各类声码器(如Hifi-GAN、MelGAN、BigvGAN等),上一代语音合成模型(如Tacotron、Fastspeech等)
- 具备优秀的代码能力和基础算法功底,有较为丰富的工程经验,有大规模训练经验或大规模数据处理经验
- 在ACL、NeurIPS、ICLR、EMNLP、ICML等顶级会议或期刊上发表过论文者优先
- 熟悉并行训练框架,有多机多卡训练经验者优先
加分项
- 在ACL,NeurIPS,ICLR,EMNLP,ICML等顶级会议或期刊上发表过论文者优先
- 熟悉并行训练框架,有多机多卡训练经验者优先
福利待遇
- 薪资25-50K·16薪
工作地址
北京海淀区搜狐网络大厦搜狐网络大厦11层
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。