返回岗位列表

面壁智能

多模态大模型数据科学家

地点:北京 薪资:薪资未公开 日期:2026-07-20

岗位摘要

构建核心数据引擎:主导多模态大模型在预训练、指令微调、偏好对齐等全阶段的数据体系建设,攻克海量多模态语料的智能采集、多维清洗、去重过滤、自动化标注与深度挖掘等核心技术壁垒;驱动“数据-模型”飞轮迭代:建立数据合成与构造、模型训练、能力评测的全链路闭环验证体系,通过精准的数据消融与归因分析,确保数据…

岗位职责

  • 构建核心数据引擎:主导多模态大模型在预训练、指令微调、偏好对齐等全阶段的数据体系建设,攻克海量多模态语料的智能采集、多维清洗、去重过滤、自动化标注与深度挖掘等核心技术壁垒
  • 驱动“数据-模型”飞轮迭代:建立数据合成与构造、模型训练、能力评测的全链路闭环验证体系,通过精准的数据消融与归因分析,确保数据策略实质性突破模型基础能力上限
  • 打造极致的数据基建:参与设计并优化PB级多模态训练数据的全生命周期管理架构,突破海量数据的高效吞吐与加载瓶颈,为千亿级模型的高效分布式训练提供坚实底座
  • 探索前沿技术边界:持续追踪并复现学界与业界最前沿成果,如Scaling Law在数据端的演进、合成数据生成技术等,将前沿算法敏捷落地于实际业务,极致挖掘多模态数据的潜在价值

任职要求

  • 极客级别的工程能力:精通Python、Shell等语言,具备卓越的编码品味与架构设计能力;熟练掌握Git及敏捷开发流程,对代码质量有近乎严苛的追求,具备主导多人协作项目的实战经验
  • 深厚的AI算法底蕴:扎实的深度学习、计算机视觉与自然语言处理理论基础,精通PyTorch等主流框架;深入理解主流多模态大模型(如GPT-4V、Gemini、LLaVA、MiniCPM-V等)的底层架构与训练机制,具备丰富的模型微调与评测经验
  • 敏锐的数据嗅觉:对“什么是高质量数据”有深刻的直觉与洞察力,善于从繁杂的原始数据中发现提升模型能力的关键点,对Bad Case有极强的分析与解决能力
  • 前瞻视野与自驱力:时刻保持对前沿技术的饥饿感,具备优秀的英文文献阅读能力,能够快速学习并解决无先例可循的开放性难题
  • 加分项:在人工智能顶级会议(如CVPR、ICCV、ACL、NeurIPS、ICLR等)发表过多模态或数据驱动相关论文;知名开源项目(特别是大模型、多模态或数据处理框架)的核心贡献者;拥有千亿级大模型数据预处理、大规模分布式训练或数据合成实战经验者优先

加分项

  • 在人工智能顶级会议(如 CVPR, ICCV, ACL, NeurIPS, ICLR 等)发表过多模态/数据驱动相关论文
  • 知名开源项目(特别是大模型、多模态或数据处理框架)的核心贡献者
  • 拥有千亿级大模型数据预处理、大规模分布式训练或数据合成(Synthetic Data)实战经验者优先

福利待遇

  • 直接参与打造下一代多模态大模型,定义模型认知与生成边界
  • 与顶尖团队合作,持续探索前沿技术边界
  • 提供丰富的计算资源和数据基础设施支持