多模态研究工程师
岗位摘要
主导视频生成模型的微调和持续训练,包括图像到视频和联合音视频生成;设计并实验用于多模态生成的新型模型架构,包括多模态条件控制(语音、结构化文本、参考图像);利用LoRA、RLHF和全参数微调等技术,提升模型在多样化视觉场景中的质量
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 主导视频生成模型的微调和持续训练,包括图像到视频和联合音视频生成
- 设计并实验用于多模态生成的新型模型架构,包括多模态条件控制(语音、结构化文本、参考图像)
- 利用LoRA、RLHF和全参数微调等技术,提升模型在多样化视觉场景中的质量
- 设计并构建大规模数据管道和自动化标注工作流,支持模型的持续改进
- 探索模型压缩、推理加速和服务优化,实现高效的实时视频处理
任职要求
- 对推动视觉AI边界充满热情,具备自驱力和动手解决复杂技术问题的能力
- 精通PyTorch,具备从数据处理、模型训练到部署的端到端经验
- 扎实理解视频和图像生成架构,包括扩散模型、DiT、ControlNet及最新视频生成模型
- 具备多模态模型训练经验,包括音频、视觉和语言模态的联合处理
- 有分布式训练工具(FSDP、DeepSpeed等)的使用经验
- 有大规模数据处理、数据集构建和自动化数据清洗的经验
福利待遇
- 参与定义下一代消费级AI娱乐范式
- 与顶尖研究、产品和基础设施团队紧密协作
- 在快速发展的独角兽公司中推动技术创新
- 包容多元的工作环境,重视不同背景的贡献
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。