返回岗位列表

阶跃星辰

大数据开发工程师(多模态方向)

地点:北京 薪资:薪资未公开 日期:2026-01-20

岗位摘要

设计、开发和维护基于Spark Core/Spark SQL的大规模自动化ETL Pipeline,处理PB级多模态图文数据;优化Spark作业性能和稳定性,解决调度延迟、OOM等问题,提高任务执行效率,减少人工介入成本

岗位职责

  • 设计、开发和维护基于Spark Core/Spark SQL的大规模自动化ETL Pipeline,处理PB级多模态图文数据
  • 优化Spark作业性能和稳定性,解决调度延迟、OOM等问题,提高任务执行效率,减少人工介入成本
  • 基于互联网发现和挖掘高质量的文本/多媒体数据
  • 对原始语料进行分析、过滤和重写,为多模态大模型训练及业务场景提供坚实的数据基础

任职要求

  • 计算机、大数据相关专业,本科及以上学历
  • 具备扎实的代码能力,熟悉Python
  • 熟悉多线程编程、分布式计算、网络通信、内存管理
  • 熟悉Linux环境,能编写Shell/Python脚本自动化日常任务
  • 熟练掌握如Spark、Hive、Hadoop等大数据处理工具/框架
  • 有VLM(视觉语言模型)数据管理/处理基建开发与设计经验
  • 了解深度学习基础原理,以及多模态大模型基础原理