多模态大模型数据工程实习生
岗位摘要
负责多模态训练数据处理Pipeline的开发与优化;基于Spark、Ray、Hive等分布式计算框架,开发和优化海量图文数据处理Pipeline;参与多模态训练数据的采集、解析、清洗、去重、过滤、标注等核心环节建设
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 负责多模态训练数据处理Pipeline的开发与优化
- 基于Spark、Ray、Hive等分布式计算框架,开发和优化海量图文数据处理Pipeline
- 参与多模态训练数据的采集、解析、清洗、去重、过滤、标注等核心环节建设
- 持续优化数据链路性能、稳定性及资源利用效率
- 参与训练数据存储、索引、检索等基础能力建设
- 参与数据集管理、数据版本管理及数据治理相关系统开发
- 推动训练数据生产流程标准化与自动化
- 构建数据质量、覆盖率、分布等评估体系
- 开发数据分析与可观测性工具,提升数据链路透明度
- 调研LLM/VLM领域前沿数据工程与数据构建方案,并在工作中落地
任职要求
- 本科及以上学历,计算机相关专业优先
- 熟练掌握Python语言、Linux开发环境、分布式存储与计算原理
- 具备Spark/Ray/Hive等任意分布式计算引擎使用经验及数据Pipeline搭建经验
- 具备较强的问题分析与解决能力,能快速学习并独立推进技术项目
- 良好的沟通能力和团队合作精神
- 快速学习新知识、新技能,有技术热情,自驱力强
- 每周到岗≥4天,连续实习≥3个月,实习6个月以上优先
福利待遇
- 实习薪资300-400元/天
- 参与前沿多模态大模型数据工程实践
- 接触大规模分布式计算与数据处理技术
- 积累数据Pipeline开发与优化经验
- 与资深工程师团队协作,提升技术能力
工作地址
北京海淀区大恒科技大厦12F
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。