多模态大模型算法工程师
岗位摘要
构建多模态大模型在Pre-training、SFT及RLHF全阶段的核心数据引擎,主导海量多模态语料的智能采集、多维清洗、去重过滤与自动化标注;建立“数据合成与构造 -> 模型训练 -> 能力评测”的全链路闭环验证体系,通过数据消融与归因分析推动模型基础能力上限突破
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 构建多模态大模型在Pre-training、SFT及RLHF全阶段的核心数据引擎,主导海量多模态语料的智能采集、多维清洗、去重过滤与自动化标注
- 建立“数据合成与构造 -> 模型训练 -> 能力评测”的全链路闭环验证体系,通过数据消融与归因分析推动模型基础能力上限突破
- 参与设计并优化PB级多模态训练数据的全生命周期管理架构,为千亿级模型高效分布式训练提供数据底座
- 持续追踪学界与业界前沿成果(如Scaling Law数据端演进、合成数据生成技术),将前沿算法敏捷落地于实际业务
任职要求
- 极客级别工程能力:精通Python、Shell,具备卓越编码品味与架构设计能力;熟练掌握Git及敏捷开发流程,具备主导多人协作项目实战经验
- 深厚AI算法底蕴:扎实的深度学习、CV与NLP理论基础,精通PyTorch;深入理解GPT-4V、Gemini、LLaVA、MiniCPM-V等主流多模态大模型的底层架构与训练机制,具备模型微调与评测经验
- 敏锐的数据嗅觉:对“什么是高质量数据”有深刻直觉,善于从原始数据中发现提升模型能力的Key Point,对Bad Case有极强分析与解决能力
- 前瞻视野与自驱力:保持对前沿技术的追求,具备优秀英文文献阅读能力,能够快速学习并解决开放性难题
- 加分项:在CVPR、ICCV、ACL、NeurIPS、ICLR等顶会发表过多模态/数据驱动相关论文;知名开源项目核心贡献者;拥有千亿级大模型数据预处理或大规模分布式训练实战经验
加分项
- 在人工智能顶级会议(如 CVPR, ICCV, ACL, NeurIPS, ICLR 等)发表过多模态/数据驱动相关论文
- 知名开源项目(特别是大模型、多模态或数据处理框架)的核心贡献者
- 拥有千亿级大模型数据预处理、大规模分布式训练或数据合成(Synthetic Data)实战经验者优先
福利待遇
- 具有竞争力的薪酬体系:50-80K·15薪,薪资水平领先行业
- 参与打造下一代多模态大模型,直接定义模型认知与生成边界
- Data-Centric AI核心技术路线,驱动AGI愿景实现
- 扁平化团队氛围,与顶尖AI人才共同成长
- 公司位于北京海淀区科建大厦,交通便利,工作环境优质
工作地址
北京海淀区科建大厦面壁智能
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。