返回岗位列表

智谱AI

VLM Agentic RL 研究实习生

地点:北京 薪资:薪资未公开 日期:2026-07-20

岗位摘要

深入研究并掌握CogVLM(GLM-V)系列模型的基础架构,优化现有的RL训练与推理链路;负责搭建VLM RL with Tools的算法框架,实现模型在Rollout过程中对工具的自主调用与逻辑闭环

岗位职责

  • 深入研究并掌握CogVLM(GLM-V)系列模型的基础架构,优化现有的RL训练与推理链路
  • 负责搭建VLM RL with Tools的算法框架,实现模型在Rollout过程中对工具的自主调用与逻辑闭环
  • 针对多步RL迭代中的核心难点和挑战,探索创新性RL架构,优化trace-level奖励分配策略,优化PPO/GRPO/HRPO等对齐算法
  • 负责多模态Agentic数据的合成、模型迭代训练以及在主流Benchmark(如MMSearch, V*, Facts等)上的性能测试与调优

任职要求

  • 985高校计算机、电子、自动化等相关专业在读硕士或博士
  • 深入理解常用的多模态算法(如CLIP, ViT, LLaVA系列)及强化学习基础理论(PPO, DPO, GRPO等)
  • 具备多模态大模型、Agent智能体或强化学习相关的实际项目经历;有VLM + Tool Use相关经验者优先考虑
  • 熟练运用Megatron或DeepSpeed等主流深度学习框架,具备优秀的编程习惯
  • 具备较强的科研敏锐度,能够独立阅读并复现前沿论文;工作态度认真负责,具备良好的团队协作与沟通能力,能适应高强度的科研节奏

加分项

  • 在 CVPR, ICCV, NeurIPS, ICLR 等 CCF-A 类会议发表过多模态或 RL 相关论文
  • 参与智谱 AI 最前沿的 VLM 研发进程,接触核心模型(CogVLM/GLM-4.5V)的训练细节
  • 充足的 H100/A100 算力资源支持,助力你的算法构想快速验证
  • 与顶尖 AI 科学家和工程大牛并肩作战的机会
  • 实习期间表现优秀的同学会获得转正机会

福利待遇

  • 参与智谱AI最前沿的VLM研发进程,接触核心模型(CogVLM/GLM-4.5V)的训练细节
  • 充足的H100/A100算力资源支持,助力你的算法构想快速验证
  • 与顶尖AI科学家和工程大牛并肩作战的机会
  • 实习期间表现优秀的同学会获得转正机会