大模型数据治理工程师
岗位摘要
设计并推动大规模多模态数据治理架构,涵盖数据采集、清洗、标准化、标签体系及元数据管理;负责数据治理平台核心模块建设,实现自动化质量检测、数据血缘追踪和数据版本管理;深入分析大模型训练数据特性,设计存储、索引及访问优化方案
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 设计并推动大规模多模态数据治理架构,涵盖数据采集、清洗、标准化、标签体系及元数据管理
- 负责数据治理平台核心模块建设,实现自动化质量检测、数据血缘追踪和数据版本管理
- 深入分析大模型训练数据特性,设计存储、索引及访问优化方案
- 推动数据治理平台与大模型训练及相关平台的深度融合
- 协同多团队推动复杂数据治理项目落地,确保方案技术可行并高质量交付
任职要求
- 本科及以上学历,计算机、数据工程或相关专业,3年以上数据治理或大数据平台建设经验
- 精通SQL和Python,熟悉Scala/Java/golang,具备Spark、Flink、Kafka、Ray等大数据技术栈经验
- 熟悉数据集元数据管理、数据血缘、数据质量和数据安全合规
- 有主流数据治理平台(如Apache Atlas、DataHub)使用或开发经验
- 熟悉数据仓库/数据湖架构,了解Iceberg、Hudi、Delta Lake等技术
- 具备系统架构设计与工程落地能力,良好的沟通协调能力及团队合作精神
- 有AI/大模型数据治理相关经验者优先;有AI算法、数据相关公司工作经历优先;有创业公司工作经历优先
工作地址
上海徐汇区西岸智塔东塔楼30楼
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。