多模态预训练算法研究员(实习)
岗位摘要
参与下一代多模态基础模型与视觉理解方向的核心研究工作;探索Vision Encoder、Video Encoder及统一多模态编码器等前沿架构;研究高效视觉建模,包括动态分辨率、Token压缩、自适应路由等方向
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 参与下一代多模态基础模型与视觉理解方向的核心研究工作
- 探索Vision Encoder、Video Encoder及统一多模态编码器等前沿架构
- 研究高效视觉建模,包括动态分辨率、Token压缩、自适应路由等方向
- 开展视频理解与时序建模,包括长视频建模与多帧推理等任务
- 参与大规模多模态预训练、跨模态对齐及数据合成相关研究
- 探索多模态推理与Agent能力,如视觉推理、GUI Agent及链式思维
任职要求
- 对AGI和多模态大模型方向抱有强烈热情,持续关注前沿技术进展
- 具备扎实的机器学习与深度学习基础,熟悉Transformer等主流模型架构
- 具备优秀的工程能力与编程能力,熟练掌握Python及PyTorch深度学习框架
- 有多模态大模型、视觉模型、视频理解、动态分辨率、长视频建模、预训练、数据合成、分布式训练等任一方向经验者优先
- 具备良好的学习能力、研究兴趣与自驱力
- 每周全职出勤4天及以上,实习周期不少于3个月
- 工作地点为北京或上海
福利待遇
- 提供顶配算力支持,包括充足GPU训练资源与大规模实验环境
- 与行业顶尖Researcher和Engineer深度合作交流
- 参与下一代多模态基础模型核心研发,研究成果有机会发表于顶会
- 算法与系统成果可直接应用于实际多模态产品与模型中
- 高自由度研究氛围,鼓励探索创新方向,支持高潜力研究课题持续推进
- 日薪400-500元
工作地址
北京海淀区大恒科技大厦12F
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。