多模态语音算法专家
岗位摘要
负责智能体场景下多模态理解与生成算法的研究、训练及应用,包括但不限于上下文感知语音识别、指令控制语音合成及全模态理解等方向;负责模型的多机多卡训练与高性能推理优化;硕士及以上学历,计算机、数学、通信等相关专业,具备良好的学习能力、逻辑思维能力和沟通协作能力
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 负责智能体场景下多模态理解与生成算法的研究、训练及应用,包括但不限于上下文感知语音识别、指令控制语音合成及全模态理解等方向
- 负责模型的多机多卡训练与高性能推理优化
任职要求
- 硕士及以上学历,计算机、数学、通信等相关专业,具备良好的学习能力、逻辑思维能力和沟通协作能力
- 三年及以上语音合成或语音识别算法经验,或三篇及以上顶会论文(各类CCF-A类会议、ICASSP/INTERSPEECH等)
- 熟练使用Python及PyTorch/TensorFlow深度学习框架
- 对以下至少一种方向熟悉并有相关经验:语音大模型框架与理论(如Diffusion、Vall-E/SpearTTS/AudioLM、MusicLM);音频理解大模型/ASR大模型(如qwen-audio、sensevoice、whisper);全模态多模态大模型(如qwen-omni、mimo-omni、Step-Audio、Covo-Audio等)
- 有业务落地工程经验者优先
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。