返回岗位列表

阿里巴巴

通义千问(Qwen)视觉生成技术研究员

地点:北京 薪资:薪资未公开 日期:2026-01-29

岗位摘要

下一代理解生成一体化的模型结构设计与研发,探索Autoregressive LLM、Diffusion及两者结合的多种技术路线;研究及探索世界模型的多模态训练数据及对应训练策略;设计及研发自动化评估方法设计与实现,为模型研发提供科学指导

岗位职责

  • 下一代理解生成一体化的模型结构设计与研发,探索Autoregressive LLM、Diffusion及两者结合的多种技术路线
  • 研究及探索世界模型的多模态训练数据及对应训练策略
  • 设计及研发自动化评估方法设计与实现,为模型研发提供科学指导

任职要求

  • 计算机科学、计算机视觉、人工智能、机器学习、具身智能等领域的博士/硕士毕业生
  • 对通用视觉理解或生成模型有一定研究实践,在图像/视频/3D等至少一种模态上有实际研发经验
  • 熟练掌握Pytorch,熟悉Megatron等大模型训练框架,有优秀的coding/工程能力
  • 自我驱动力,动手能力强,工作细致,对AI行业有浓厚的兴趣,有较强的学习能力和责任心
  • 善于平衡研究目标及落地实现,具备跨学科视野与协作意识,能够与工程、产品等多学科团队紧密合作,推动研究成果快速落地并产生实际影响力
  • 关注技术影响力,具有开源开放精神,对基础模型的前沿问题有持续热情,具备独立思考能力和系统性研究思维,敢于挑战现有范式,能够独立应用技术解决复杂问题

加分项

  • 曾发表顶级会议论文并具有一定的学术影响力,包括但不限于:CVPR、ECCV、NeurIPS、ICML、ICLR、ACL、TPAMI等国际顶级计算机会议/期刊
  • 拥有知名开源项目,在开源社区具有较好的影响力,或在竞赛中获得引领性的研究成果

福利待遇

  • 曾发表顶级会议论文并具有一定的学术影响力,包括但不限于:CVPR、ECCV、NeurIPS、ICML、ICLR、ACL、TPAMI等国际顶级计算机会议/期刊
  • 拥有知名开源项目,在开源社区具有较好的影响力,或在竞赛中获得引领性的研究成果