大数据开发工程师(多模态方向)
岗位摘要
设计、开发和维护基于Spark Core/Spark SQL的大规模自动化ETL Pipeline,处理PB级多模态图文数据;优化Spark作业性能和稳定性,解决调度延迟、OOM等问题,提高任务执行效率,减少人工介入成本
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 设计、开发和维护基于Spark Core/Spark SQL的大规模自动化ETL Pipeline,处理PB级多模态图文数据
- 优化Spark作业性能和稳定性,解决调度延迟、OOM等问题,提高任务执行效率,减少人工介入成本
- 基于互联网发现和挖掘高质量的文本/多媒体数据,并对原始语料进行分析、过滤、重写,为多模态大模型训练及业务场景提供数据基础
- 与算法研究员协作,设计数据实验,探索分析不同数据策略对VLM模型能力及训练效率的影响,支持更高效的VLM模型训练
- 跟进业界最新的VLM数据相关工作成果,并探索将其应用或改进的落地可能性
任职要求
- 计算机、大数据相关专业,本科及以上学历
- 具备扎实的代码能力,熟悉Python,熟悉多线程编程、分布式计算、网络通信、内存管理
- 熟悉Linux环境,能编写Shell/Python脚本自动化日常任务
- 熟练掌握如Spark、Hive、Hadoop等大数据处理工具/框架,有VLM数据管理/处理基建开发与设计经验
- 了解深度学习基础原理,以及多模态大模型基础原理
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。