多模态大模型研究员
岗位摘要
参与 MiniCPM-o 多模态模型的音视频联合理解能力建设,包括音频理解、视频理解、音视频联合理解等方向;参与全模态全双工大模型的研发,包括主动提醒、边看边说、打断处理等全双工特色能力
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 参与 MiniCPM-o 多模态模型的音视频联合理解能力建设,包括音频理解、视频理解、音视频联合理解等方向
- 参与全模态全双工大模型的研发,包括主动提醒、边看边说、打断处理等全双工特色能力
- 负责音频、视频多模态训练数据的构建、清洗、配比与训练策略设计,提升模型在复杂全模态场景下的理解与推理能力
- 优化音视频-语言模态对齐、时间建模、长序列建模和多模态融合效果
任职要求
- 有多模态大模型、音视频理解、语音理解、视频理解等相关项目经验
- 熟悉 PyTorch、Transformers,具备大模型训练经验
- 能够独立设计实验、排查训练问题、分析指标和 badcase,根据 benchmark 进行模型迭代
- 具备良好的工程能力,能掌控复杂训练代码仓库,熟悉 Linux / CUDA / 多卡训练环境
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。