语音多模态大模型算法研究员
岗位摘要
主导或深度参与语音多模态大模型的架构设计、训练、调优及迭代工作,提升模型整体性能;研究方向包括但不限于音频表征、音视频理解、语音生成、全双工语音对话、语音强化学习;跟踪学术界与工业界的前沿技术动态,能够复现最新成果,推进技术迭代与创新突破
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 主导或深度参与语音多模态大模型的架构设计、训练、调优及迭代工作,提升模型整体性能
- 研究方向包括但不限于音频表征、音视频理解、语音生成、全双工语音对话、语音强化学习
- 跟踪学术界与工业界的前沿技术动态,能够复现最新成果,推进技术迭代与创新突破
- 系统性设计并执行实验方案,深入分析模型表现,定位核心问题并提出有效的优化与解决方案
- 参与团队合作,与团队一起解决技术难题,推动技术进展
任职要求
- 985/211高校研究生及以上学历或优秀本科生,计算机、人工智能、软件、数学等相关专业
- 精通常用算法和数据结构,熟悉Python等编程语言,熟悉Linux平台
- 熟悉机器学习、深度学习,具备扎实的算法基础,熟练使用Pytorch/Megatron深度学习框架
- 在语音多模态大模型某一领域(端到端语音、语音识别与理解、语音合成、Voice Agent)有过深入的研究经历
- 具备卓越的实验分析与问题解决能力,有创新思维与较强的学习能力
- 能够良好沟通、与团队成员高效协作
- 声学相关专业背景优先
- 有国际期刊/会议论文发表优先
- 有语音识别工作经验优先
- 有人机对话相关经验优先
加分项
- 有顶级学术会议(ICASSP、Interspeech、ACL、ICML、NIPS、CVPR等)发表过有影响力研究成果的优先
- 在 ACM/ICPC、NOI/IOI、Kaggle 等编程/AI 比赛获奖者优先
- 主导、参与过 AI 相关的有大影响力的开源/闭源项目的优先
- 张女士 刚刚活跃
福利待遇
- 薪资50-80K·16薪
工作地址
北京海淀区大恒科技大厦12F
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。