返回岗位列表

阿里巴巴

原生多模态模型研究员

地点:北京 薪资:薪资未公开 日期:2026-01-29

岗位摘要

负责原生多模态模型研究和开发,结合多模态能力(支持文本、图像、语音输入)实现复杂指令生成,包括但不限于文生图、图生图、文档生成、可控编辑等核心方向;负责图像生成模型效果优化,探索扩散模型、自回归模型结构和策略优化等核心技术课题

岗位职责

  • 负责原生多模态模型研究和开发,结合多模态能力(支持文本、图像、语音输入)实现复杂指令生成,包括但不限于文生图、图生图、文档生成、可控编辑等核心方向
  • 负责图像生成模型效果优化,探索扩散模型、自回归模型结构和策略优化等核心技术课题
  • 负责人类反馈与强化学习,聚焦于更加精细的RL算法设计,并基于万相用户反馈的RLHF图像生成质量提升

任职要求

  • 计算机科学、人工智能、机器学习等领域的博士/硕士毕业生,具备计算机视觉等领域的扎实理论基础
  • 掌握机器学习和深度学习基础知识,熟悉常用视觉生成算法,熟悉Pytorch、Tensorflow等至少一种深度学习框架
  • 具备良好的科研能力,有大规模视觉生成算法相关研究经历和具有影响力科研工作(高引论文、知名开源项目等)者优先,有成果发表在CVPR、ICCV、NeurIPS、ICLR、TPAMI等国际顶级会议、期刊者优先
  • 对生成方向具有技术热情,具备视觉生成大模型研发经验,有对话系统、多模态生成等落地项目经验者优先
  • 具备良好的技术洞察力和优秀的业务分析能力,能应对复杂的业务算法需求,能够与工程、产品等多学科团队紧密合作,推动研究成果快速落地并产生实际影响
  • 关注技术影响力,具有开源开放精神,对基础模型的前沿问题有持续热情,有追求,渴望做出有极大影响力的工作