多模态大模型算法工程师
岗位摘要
参与多模态大模型(文本、图像、视频等)的算法研究与工程实现,重点攻关模型在复杂视觉场景下的代码生成能力,覆盖从设计稿到可运行前端代码的端到端链路;推动多模态模型的通用工具使用能力建设,让模型能够基于视觉输入调用Python工具、搜索工具、文件操作等通用工具链,实现从视觉理解到工具编排的闭环
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 参与多模态大模型(文本、图像、视频等)的算法研究与工程实现,重点攻关模型在复杂视觉场景下的代码生成能力,覆盖从设计稿到可运行前端代码的端到端链路
- 推动多模态模型的通用工具使用能力建设,让模型能够基于视觉输入调用Python工具、搜索工具、文件操作等通用工具链,实现从视觉理解到工具编排的闭环
- 跟踪学术界与工业界前沿进展,包括鲁棒视觉表征与视觉特征编解码、多模态模型的RLVR与RLHF、Synthetic Data、视觉审美与品质评估等方向
- 设计与开发高效的分布式训练与数据系统,优化大规模多模态模型的训练流程与数据处理链路,支撑海量多模态数据的高效存储、检索、清洗与迭代
任职要求
- 国内外计算机科学、人工智能专业的优秀本科生、研究生和博士生
- 极强的自驱力:能够在方向不完全明确时自己定义问题、推动落地,不依赖被动派活
- 扎实的工程基建能力:熟悉大模型背景下的分布式编程技术,能独立搭建、维护并优化训练与评测链路;精通Python,熟悉至少一种主流开源LLM/VLM RL训练框架
- 对视觉与产品有独特的品味:对什么是好的视觉效果、好的页面、好的交互有自己的判断和坚持,能将品味注入到数据、训练目标和评估标准中
- 具备良好的沟通能力和团队协作精神,能独立解决复杂技术问题
加分项
- 有大规模分布式训练系统或分布式数据系统开发经验,熟悉 DeepSpeed/Megatron 等并行训练框架,或有海量数据处理、存储、检索系统的实战经验
- 有前端/Web 开发背景,或对 UI/UX、视觉设计有较深的理解与实践
- 有 tool use、function calling、agent 系统等相关研究或工程经验
- 在顶级会议/期刊(NeurIPS、ICML、CVPR、ACL、ICLR 等)发表过相关论文
- 参与过开源大模型项目的贡献
- 有算法竞赛教练或培训经历,ACM
- ICPC、NOI/IOI 等编程竞赛获奖经历
- 祝女士 刚刚活跃
福利待遇
- 具有竞争力的薪酬待遇:50-80K·16薪
- 参与前沿AI技术研发,与顶尖团队共同探索多模态大模型的最新进展
- 丰富的技术交流机会,鼓励发表论文、参与开源项目及行业竞赛
工作地址
北京海淀区大恒科技大厦南座12层
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。