视觉多模态算法工程师
岗位摘要
探索图片内容理解、图像文本描述等视觉多模态大模型的模态对齐、后训练、指令微调技术;负责从SFT、RLHF、RLAIF、DPO系列后训练到部署优化的全流程算法设计与实现;负责多模态大模型在图像理解方向的算法研发,包括图像理解、agent研发等任务
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 探索图片内容理解、图像文本描述等视觉多模态大模型的模态对齐、后训练、指令微调技术
- 负责从SFT、RLHF、RLAIF、DPO系列后训练到部署优化的全流程算法设计与实现
- 负责多模态大模型在图像理解方向的算法研发,包括图像理解、agent研发等任务
- 跟踪图像、视频、视觉多模态领域前沿算法,面向终端场景构建算法流程并完成技术方案落地
- 理解并改进现有模型,提升算法性能和准确性,解决产品实际问题
- 增强视觉多模态模型的图像grounding、VQA、caption等核心能力
- 设计与实现视觉多模态大模型训练管线,包括数据清洗、采样策略、分布式训练、混合精度训练及参数高效微调
任职要求
- 硕士及以上学历,1-3年相关工作经验
- 熟悉多模态大模型原理和训练方案,包括InternVL、LLaVA、Qwen-VL等
- 熟练掌握C/C++、Python编程语言
- 熟悉并能实现主流对齐与优化算法,包括SFT、PPO、GRPO、GSPO、DAPO、Actor-Critic机制、Value Model与Reward建模
- 有大模型训练平台经验者优先,如DeepSpeed、Megatron-LM、Colossal-AI、Ray、vLLM等
福利待遇
- 月薪30-50K,15薪
- 工作地点位于北京海淀区大恒科技大厦
工作地址
北京海淀区大恒科技大厦南区9
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。