多模态大模型数据科学家
岗位摘要
构建核心数据引擎:主导多模态大模型在预训练、指令微调、偏好对齐等全阶段的数据体系建设,攻克海量多模态语料的智能采集、多维清洗、去重过滤、自动化标注与深度挖掘等核心技术壁垒;驱动“数据-模型”飞轮迭代:建立数据合成与构造、模型训练、能力评测的全链路闭环验证体系,通过精准的数据消融与归因分析,确保数据…
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 构建核心数据引擎:主导多模态大模型在预训练、指令微调、偏好对齐等全阶段的数据体系建设,攻克海量多模态语料的智能采集、多维清洗、去重过滤、自动化标注与深度挖掘等核心技术壁垒
- 驱动“数据-模型”飞轮迭代:建立数据合成与构造、模型训练、能力评测的全链路闭环验证体系,通过精准的数据消融与归因分析,确保数据策略实质性突破模型基础能力上限
- 打造极致的数据基建:参与设计并优化PB级多模态训练数据的全生命周期管理架构,突破海量数据的高效吞吐与加载瓶颈,为千亿级模型的高效分布式训练提供坚实底座
- 探索前沿技术边界:持续追踪并复现学界与业界最前沿成果,如Scaling Law在数据端的演进、合成数据生成技术等,将前沿算法敏捷落地于实际业务,极致挖掘多模态数据的潜在价值
任职要求
- 极客级别的工程能力:精通Python、Shell等语言,具备卓越的编码品味与架构设计能力;熟练掌握Git及敏捷开发流程,对代码质量有近乎严苛的追求,具备主导多人协作项目的实战经验
- 深厚的AI算法底蕴:扎实的深度学习、计算机视觉与自然语言处理理论基础,精通PyTorch等主流框架;深入理解主流多模态大模型(如GPT-4V、Gemini、LLaVA、MiniCPM-V等)的底层架构与训练机制,具备丰富的模型微调与评测经验
- 敏锐的数据嗅觉:对“什么是高质量数据”有深刻的直觉与洞察力,善于从繁杂的原始数据中发现提升模型能力的关键点,对不良案例有极强的分析与解决能力
- 前瞻视野与自驱力:时刻保持对前沿技术的饥饿感,具备优秀的英文文献阅读能力,能够快速学习并解决无先例可循的开放性难题
- 加分项:在人工智能顶级会议(如CVPR、ICCV、ACL、NeurIPS、ICLR等)发表过多模态或数据驱动相关论文;知名开源项目(特别是大模型、多模态或数据处理框架)的核心贡献者;拥有千亿级大模型数据预处理、大规模分布式训练或数据合成实战经验者优先
加分项
- 在人工智能顶级会议(如 CVPR, ICCV, ACL, NeurIPS, ICLR 等)发表过多模态/数据驱动相关论文
- 知名开源项目(特别是大模型、多模态或数据处理框架)的核心贡献者
- 拥有千亿级大模型数据预处理、大规模分布式训练或数据合成(Synthetic Data)实战经验者优先
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。