VLM Agentic RL 研究实习生
岗位摘要
深入研究并掌握CogVLM(GLM-V)系列模型的基础架构,优化现有的RL训练与推理链路;负责搭建VLM RL with Tools的算法框架,实现模型在Rollout过程中对工具的自主调用与逻辑闭环
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 深入研究并掌握CogVLM(GLM-V)系列模型的基础架构,优化现有的RL训练与推理链路
- 负责搭建VLM RL with Tools的算法框架,实现模型在Rollout过程中对工具的自主调用与逻辑闭环
- 针对多步RL迭代中的核心难点和挑战,探索创新性RL架构,优化trace-level奖励分配策略,优化PPO/GRPO/HRPO等对齐算法
- 负责多模态Agentic数据的合成、模型迭代训练以及在主流Benchmark(如MMSearch, V*, Facts等)上的性能测试与调优
任职要求
- 985高校计算机、电子、自动化等相关专业在读硕士或博士
- 深入理解常用的多模态算法(如CLIP, ViT, LLaVA系列)及强化学习基础理论(PPO, DPO, GRPO等)
- 具备多模态大模型、Agent智能体或强化学习相关的实际项目经历;有VLM + Tool Use相关经验者优先考虑
- 熟练运用Megatron或DeepSpeed等主流深度学习框架,具备优秀的编程习惯
- 具备较强的科研敏锐度,能够独立阅读并复现前沿论文;工作态度认真负责,具备良好的团队协作与沟通能力,能适应高强度的科研节奏
加分项
- 在 CVPR, ICCV, NeurIPS, ICLR 等 CCF-A 类会议发表过多模态或 RL 相关论文
- 参与智谱 AI 最前沿的 VLM 研发进程,接触核心模型(CogVLM/GLM-4.5V)的训练细节
- 充足的 H100/A100 算力资源支持,助力你的算法构想快速验证
- 与顶尖 AI 科学家和工程大牛并肩作战的机会
- 实习期间表现优秀的同学会获得转正机会
福利待遇
- 参与智谱AI最前沿的VLM研发进程,接触核心模型(CogVLM/GLM-4.5V)的训练细节
- 充足的H100/A100算力资源支持,助力你的算法构想快速验证
- 与顶尖AI科学家和工程大牛并肩作战的机会
- 实习期间表现优秀的同学会获得转正机会
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。