视频生成算法研究员(大模型方向)
岗位摘要
负责视频生成基础模型研发,包括视频DiT、扩散生成、时序建模、运动建模等核心架构的研究、改造与迭代,搭建高质量、高连贯性、高泛化性的视频生成基座;攻克视频生成核心难点:时序闪烁、动作失真、人物变形、镜头连贯性、画面一致性、长视频稳定性等问题,持续提升成片质量
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 负责视频生成基础模型研发,包括视频DiT、扩散生成、时序建模、运动建模等核心架构的研究、改造与迭代,搭建高质量、高连贯性、高泛化性的视频生成基座
- 攻克视频生成核心难点:时序闪烁、动作失真、人物变形、镜头连贯性、画面一致性、长视频稳定性等问题,持续提升成片质量
- 跟进学术界与业界前沿视频生成、多模态大一统模型技术,包括文生视频、图生视频、视频续写、视频编辑、物理世界建模等方向,进行技术预研、方案验证与工程落地
- 负责多模态理解-生成模型研发,打通文本、图像、视频的跨模态对齐能力,提升指令跟随、剧情理解、画面生成的精准度,适配短剧剧情化生成场景
- 主导模型SFT、偏好对齐、视频奖励建模、RL对齐算法迭代,通过数据迭代与算法优化,提升视频美学质量、叙事逻辑性、画面真实性
- 构建视频生成评测体系,量化画面质量、时序稳定性、图文匹配度、美学效果等指标,驱动模型迭代与版本升级
任职要求
- 硕士及以上学历,计算机、人工智能、深度学习、CV/多模态相关方向,具备扎实的深度学习、Transformer、生成模型理论基础
- 拥有视频生成、图像生成、多模态大模型相关研究或落地经验,熟悉DiT、扩散模型、时序建模、VAE等核心生成架构
- 熟悉文生视频、图生视频、视频续写、视频编辑等主流任务,了解行业前沿方案(Kling、WAN、Emu、UniVideo等)
- 具备独立算法调研、方案设计、模型训练、ablation实验、效果迭代的完整研究能力
- 熟悉多模态对齐、偏好对齐、视频Reward Model、RLHF/DPO/GRPO等对齐方案者优先
- 有顶会论文、开源项目贡献、工业级视频模型落地经验者优先
福利待遇
- 薪资范围100-200K
- 工作地点北京
- 本科及以上学历
工作地址
北京东城区明阳国际中心B座
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。